今年WAIC的现场,画风有些不同寻常。视觉智能公司Chance AI在大会期间正式发布了新一代视觉推理智能——Chance Vision 1.5。这一消息迅速在业内引发热议,原因很简单:它在高难度多模态理解与推理基准MMMU-Pro的最新公开榜单上,以86.9%的综合准确率直接登顶全球第一,刷新了该基准的SOTA(State of the Art,即特定任务当前最佳水平)。
更值得关注的是,Chance AI并没有让这个模型只停留在排行榜上。他们把它直接搬到了WAIC的高密度真实场景中进行实测。观众只需拍一张现场照片,就能完成展商识别、信息理解、要点提炼,甚至还能继续追问。说白了,逛展这件事,谁能拍得又准又深,谁就占据了优势。

图 1|Chance AI 亮相 WAIC 2026,将视觉推理能力带入真实展会环境
在WAIC,把一次拍摄变成对现场信息的深度理解
上千家展商、密集的产品演示和层出不穷的专业术语同时出现,很多观众逛完一圈,手机里存了几百张照片,但回到酒店一想:“刚才那家公司到底是做什么的?那个产品解决了什么问题?”——完全想不起来。传统搜索呢?你得先看清楚展商名字,再组织关键词,再跳转到好几个页面去翻找答案,效率和体验都不太理想。
Chance AI在WAIC现场把这条路径压缩到了“一次拍摄”。会前,用户可以根据Agent、硬科技、机器人和初创项目等方向选择路线;进了展馆,只需对准展位、展板或设备拍一张,Chance AI就能从画面中识别出展商与产品,然后自动补全团队背景、技术路线和产品定位,提炼出值得关注的要点,最终整理成一份结构化笔记——可以继续追问、收藏,也可以一键分享。

图 2 | 巴西人工智能协会(ABRIA)代表到访 Chance AI 展位
举个例子,当你对准一台外形陌生的机器人时,Chance AI不会只给出一个“这是一台人形机器人”的标签。它会继续理解现场的展板文字、设备形态以及周围的环境上下文,说明它由谁开发、正在展示什么能力、和同类产品相比有哪些值得关注的差异。用户不需要先知道“我应该问什么”,摄像头本身就是理解现场的入口。

图 3 | 观众使用 Chance AI 识别现场信息,并生成可以继续探索的结果
86.9% 登顶MMMU-Pro,Chance Vision 1.5 达到SOTA
支撑现场体验的技术底座,是Chance Vision 1.5。它在MMMU-Pro最新公开榜单中拿下了86.9%的综合准确率,这个成绩意味着什么?——人类专家的准确率是85.4%,GPT-5.4 Thinking w/ tools是82.1%,Gemini 3.0 Pro是81.0%。Chance Vision 1.5不仅是第一,而且超过了人类专家。
MMMU-Pro不是什么简单的拍照识物测试。它覆盖工程图、地图、图表、化学结构等专业视觉材料,还特意删除了那些不依赖图片就能作答的问题,增加了干扰选项,引入了Vision-only设置。说白了,这才是真正考验模型“有没有脑子”——能不能真正结合视觉信息、专业知识和复杂推理去完成任务。
换句话说,Chance Vision 1.5的能力不只是适用于展会中的物体和展商识别,它同样能处理那些结构复杂、信息密集且需要专业知识参与的视觉问题。WAIC现场的展示,只是把这套高难度视觉推理能力,转化成了普通用户可以直接体验的交互:无需预先组织问题,只需把摄像头对准眼前的事物,AI就能从画面和上下文出发,直接开始理解。
Chance AI联合创始人兼CTO吴晓凡在展台前说了句很实在的话:“榜单验证的是AI能不能看懂复杂画面,真正的产品问题是,看懂之后它该查什么、为什么查,以及如何帮助用户完成下一步。视觉让AI看见世界,记忆让它理解眼前的人。”

图 4 | 现场展示 Visual Agent 从视觉感知、实时推理到场景理解的多层能力
下一代方向:让摄像头成为AI理解现实世界的入口
从Chance Vision 1.5到个人视觉记忆,再到工具调用与多步执行,Chance AI正在搭建一套完整的Camera-First Visual Agent技术路径。视觉模型负责理解复杂画面,记忆系统判断什么与用户相关,Agent则将理解转化为查询、判断与行动。
目前,Chance AI App是这套技术面向生活场景的第一阶段载体,覆盖旅行、消费、收藏、审美与生活问答等需求。数据方面,产品总用户数已达30万,近30天MAU约9万,月安装量约3.5万;美国及Tier 1市场用户约占MAU的40%—46%。这组数字说明,市场对这类“看一眼就懂”的交互方式,接受度正在快速提升。
下一阶段,Chance AI计划把复杂视觉理解、行业知识推理和Agent流程编排能力,延伸至视觉信息密集的生产力工具与垂直行业。让商品图片、设备照片、工程图、表单、视频和现场画面,都能直接进入理解、查询、判断与后续工作流。长期来看,这套能力还会进入机器人、智能眼镜、可穿戴设备及其他智能硬件,使AI能够通过摄像头感知现实世界、理解人的意图,并在获得授权后参与真实行动。
可以确定的是,视觉推理的赛道已经不再是“谁看得更准”那么简单。真正的分水岭,正在变成“看懂了之后,能做什么”。
