如果你向一个AI提问:“这张货架照片里有什么?”
多模态大模型会像一位全科医生,快速扫视整张图片,告诉你“这是一排饮料,左边是可乐,中间是茶饮”。它能够理解场景,进行自然对话,并保持上下文连贯。
专用小模型则像一位专科医生,精准地框出每一个商品,告诉你“第3排第2个是500mL可乐,第4排第5个是1L可乐”。它速度快、精度高,但无法与你进行对话交流。
那么问题来了:零售场景下的货架识别,究竟应该选择哪种AI模型?
朗镜科技给出的答案很明确:两者都要。正是基于这一判断,他们构建了ShelfMind零售领域模型,让多模态大模型和专用小模型各司其职,将大模型的“理解能力”和“兜底能力”与小模型的“快速响应”和“精准识别”完美融合,为零售货架识别提供了AI领域的最优解决方案,帮助品牌实现更高质量、更高效率的门店稽查与货架陈列检核。
能力对比:各有所长,各有所短
多模态大模型(VLM)—— 看得懂场景的“全科医生”
多模态大模型能够“看”图像,并用自然语言“表述”出来。它擅长整体理解——解读场景、理解文档、描述单张图片的内容。指代识别(“左边那个”“第二层”)、关系判断(“价签和商品是否匹配”)、VQA推理、多步判断以及报告生成,都是它的强项。
然而,多模态大模型也存在明显的短板:
- 闭集SKU识别:速度慢、成本高,不如专用分类模型
- 规模化新品识别:单张图片可以描述,但批量情况下无法稳定输出SKU ID
- 检测/分割/计数:精度和速度均不如专用小模型
- 检索匹配:不如Embedding加向量检索
- OOD告警:商品库规模过大时,无法可靠判断“库里是否有该商品”
多模态大模型能识别“这是什么品牌”,但难以准确判断“这是哪一款、多大规格、什么包装”。它也无法利用货架上的空间和价格信息来辅助判断。当同一系列、同一口味的不同规格商品摆放在一起时,大模型往往无法区分500mL与1L的差异。

专用小模型 —— 精度与速度的“专科医生”
专用小模型在特定任务上具有明显优势。
- 闭集SKU识别方面,它比大模型更快、更便宜、效果更优。
- 检测、分割、计数任务,其精度和速度均优于大模型。
- 在价签检测和SKU识别这两个零售核心环节,框数量越多,相比大模型越划算。
但它的短板也很清晰:不具备场景理解和语言推理能力,无法独立完成复杂任务。
核心结论是:复杂任务需要配合大模型和其他算法搭建流水线,小模型只是其中的一个环节。

朗镜科技ShelfMind:让两者各司其职
既然大模型和小模型各有优劣,那么零售场景的最优解到底是什么?
朗镜科技ShelfMind零售领域模型的思路是:将两者结合。采用“小模型快速分类 + 多模态大模型兜底难例”的级联架构,让每一类模型做自己最擅长的事情。
小模型负责“快”和“准”——价签检测、SKU识别这些高频、高精度要求的任务,交由专用小模型处理。
大模型负责“懂”和“兜”——复杂场景的理解、困难样本的兜底、语义推理和报告生成,则交给多模态大模型执行。
这才是核心思路:不依赖单一模型解决所有问题,而是让合适的模型承担合适的任务。
