当客户询问门店稽查与货架陈列检核应采用何种方案时,答案其实非常明确:两者结合使用。
多模态大模型好比一位全科医生,知识储备广泛,能应对各类复杂问题;专用小模型则像一位专科医生,在特定领域深耕细作,精准高效。二者各具优势,强行二选一反而容易陷入认知误区。

朗镜科技 ShelfMind 的架构正是基于这一理念——以专用小模型作为识别主力,大模型在复杂理解与语义汇总等环节提供辅助配合。各司其职,才能让图像识别真正实现稳定、可量化的产出。
为什么这样设计?因为许多客户在通用大模型上测试单张货架图时,惊叹“效果太强了”,但一旦涉及批量落地,就会发现:单纯依赖大模型进行零售图像识别,不仅速度慢、成本高,而且结果不稳定。单图演示效果出色,与批量稳定上线,完全是两回事。
LENZ:大模型单图识别看似完美,批量部署为何容易失败?
在通用大模型中随手上传一张货架图,询问“某SKU有几个排面”,它回答得头头是道。但请注意:
- 测试的是单张图片,而非数千张批量数据;
- 仅是一次性提问,并非7×24小时稳定调用;
- 答案正确与否需要人工判断,系统不会自动校验;
- 单图验证的是方向可行性,无法验证量产稳定性。
批量上线至少需要补齐以下环节:
- 效果能否量化?——准确率是否达标?结果是否一致?
- 速度能否跟上?——高峰期是否会超时?
- 成本是否清晰?——每日处理数万张图片的费用是多少?
- 结果是否可用?——大模型输出的是文本描述,而业务系统需要结构化数据。
- 出错如何应对?——是否有兜底机制?
这些环节不经过充分验证,POC(概念验证)阶段表现再好,上线后也必然翻车。
LENZ:复杂场景下,大模型仅为环节之一,小模型才是核心主力
举个真实案例:从货架照片到输出每个商品的售价,听起来简单?实际需要7个步骤:价签检测(小模型)→ SKU识别(小模型)→ OCR(大模型)→ 几何匹配(算法)→ 语义汇总(大模型)→ 数据补全(算法)→ 生成报表。
大模型只参与其中2个步骤。SKU识别离不开专用小模型,二者协同配合,才是零售图像识别的正确解法。缺少任何一步,最终结果都可能出现偏差。
零售图像识别要实现批量落地,必须将效果、速度、成本、数据解析、兜底机制全部打通。复杂场景更需要搭建流水线——小模型负责高效完成自身擅长的任务,大模型则处理它擅长的高阶理解。这就是朗镜科技 ShelfMind 一直在做的事:不盲目迷信大模型,也不固守小模型,能够稳定输出结果的技术方案,才是真正优秀的方案。
