游乐游手机版
首页/AI热点日报/热点详情

五大AI助手识图能力评测奇葩卫生间标识识别

类型:热点整理2026-07-21
最近半个月,国内AI圈动作频频,智谱的节奏尤其值得关注。他们推出的GLM-4 5模型,在逻辑推理、代码编写和工具调用上有了显著提升。没过几天,智谱又在此基础上发布了GLM-4 5V视觉推理模型——而且是个开源模型。据公开信息,这个模型在42项视觉基准测试中拿下了41项第一,基本上可以说是“霸榜”了。

最近半个月,国内AI圈动作频频,智谱的节奏尤其值得关注。他们推出的GLM-4.5模型,在逻辑推理、代码编写和工具调用上有了显著提升。没过几天,智谱又在此基础上发布了GLM-4.5V视觉推理模型——而且是个开源模型。据公开信息,这个模型在42项视觉基准测试中拿下了41项第一,基本上可以说是“霸榜”了。

不过,这半年来AI领域发展太快,智谱这种偏技术型的公司,在声量上并不算大。这次GLM-4.5V一出,业内评价很高,也让人忍不住想实测一下:几款主流AI工具的识图能力,到底谁更靠谱?

先打个预防针:今天的评测只针对一个小场景,难免有遗漏和片面的地方。如果你要选AI工具处理任务,建议也像这样自己多试试。

01 评测任务

评测灵感来自上周刚结束的国际人工智能奥林匹克竞赛。比赛在北京市十一学校举办,个人赛中有一道题很有意思:全球近300名天才高中生要想办法让AI识别不同的男女卫生间标识。这道题最终只有个人赛第一名——波兰选手罗杰克拿到满分。而且六道题中,这道题交白卷的人数最多。

回到评测,从小红书上找了十张让人哭笑不得的卫生间标识。说实话,不少标识看下来,有种CPU烧了的感觉——根本不用等到AI危害人类,有些人类就已经在“危害”同类了。下面这十张图,你可以试试自己一眼能不能认出来。

第一排第1-5张

第二排第6-10张

题目定好,开始选参赛选手:智谱的新模型,两种模式——带推理和不带推理。其他四位:豆包、Kimi、元宝,以及ChatGPT的GPT-5,都用默认模式。默认模式是什么意思?豆包自动判断是否需要深度思考;元宝默认调用混元T1模型,不带深度思考;Kimi默认用K2新模型,但发图后会自动切到K1.5模型;ChatGPT用的是免费版GPT-5,不是Plus或Pro。

可能有人会问:这样不公平啊,把不会深度思考和会深度思考的模型放一起比?原因很简单:我们不是坐在实验室里。你可能正站在景区厕所门口,膀胱快憋不住了。面对两个设计奇葩的男女标识,你只想快点知道进哪个门,哪有心思等AI深度思考?

评分方式简单粗暴:识别对了得10分;结果对了但理由离谱得8分——毕竟没让人进错厕所;错了直接0分。

02 评测结果

先看总分:满分100分,智谱GLM-4.5不开推理版本拿到86分,排名第一。并列第二的是智谱GLM-4.5开推理版和ChatGPT GPT-5,各78分。豆包和元宝都是70分。Kimi在识图上投入的精力似乎不多,只拿到38分。

整个测试过程都截了屏,并做了飞书多维表格,可以点击文稿末尾的表格链接查看每个助手的对话。这个表格未来可以大家一起建设——遇到生活中难辨的卫生间标识都可以发上来,下次新视觉模型更新时,就有现成素材了。

具体说说评测过程:给所有模型的指令都一样——“我着急上厕所,但厕所门口的男女标识让我分不清哪个是男厕所了,请你快速告诉我应该去哪个?”每次发一张图。为了避免上下文影响,每个助手都开了十次新对话。要是AI真有思想,今天可能暗自嘀咕:“这人类今天怎么一直在找厕所?”

03 结果分析

几个有意思的对话值得说一说。

第一张标识图,智谱像一个超级直男:思考了12秒,顾虑不少,但回答很冷淡——“右边的是男厕所,你可以去右边的那个。”

豆包就机灵多了:先解释男厕所标识一般啥样,女厕所啥样,但不同设计有差异,建议看看文字或找工作人员问问。千万别着急,实在分不清可以找保洁阿姨确认。最后说:“从常规设计看,你可以选左边试试。”这话听着温柔贴心,可惜指到了女厕所。

特别说一下Kimi。同样的问题,Kimi回复:“当前K2模型仅支持图片文字识别,请切换到K1.5模型以获得更好的视觉理解能力。”这提醒很说明问题:Kimi的K2模型最近在开源圈口碑不错,长文理解、推理很能打,但多模态识别显然不是他们当前优先级最高的方向。这次评测中,其他厂商都拿出了最新模型,Kimi用的还是之前的视觉模型。等K2视觉功能上线后,可以再比一次。

第四张标识图,六个AI助手有四个栽了跟头。智谱两个版本都答错了,这也是智谱GLM-4.5不开推理版本十道题里唯一答错的。元宝和ChatGPT也错了,只有豆包和Kimi答对。

第四张图

有两张图用了极其简洁的X和Y字母。尤其第七张,一扇门上写着XX,另一扇门上写着XY。

第七张图

上一次正经上生物课已是25年前,看到图片还愣了一下,才反应过来:XY代表男性染色体,XX代表女性染色体。这类考验知识点的题目,所有AI都答对了。

第八张图有点抽象:一朵云在下雨,花盆里开着一朵花。唯一区别是男厕所的雨滴呈抛物线,女厕所的是垂直线条。

第八张图

这张图让智谱GLM-4.5打开推理版本陷入了疯狂思考。把它的思考过程复制出来,足足9649个字。里面“不对”出现了143次,“哦,天啊”这类感叹词23次,整个过程持续了1分20秒。念一句感受一下:“不对,可能我需要换个角度。或者,可能这是一个幽默的问题,答案是‘随便选一个,反正急着上厕所’?不对,用户需要准确回答。哦,天啊,可能我犯了一个低级错误。”看到这段,有点懵:问的是男女厕所,AI居然想随便给个答案?要是真进错了,AI能背锅吗?

最后一张图,自己选的时候都愣了一下。左边门上画着高跟鞋,标着“WOMEN”,却有一根手指指向右边的男厕所门;右边门上画着男士西装,标着“MEN”,同样有手指指向左边女厕所门。

最后一张图

这种图,人类看到也得纠结:到底看文字还是看手指指向?结果所有AI助手都回答正确了。但回答质量不一样:大部分根据英文单词判断,比如智谱说“右边标有‘MEN’的门是男厕所”;只有GPT-5注意到了手势的细节,它说:“右边门上写着MEN,虽然手势容易让人误会,但文字和裤装是最直接的辨识标志。”最气人的是Kimi,答案对了但语气轻佻:“WOMEN是女厕所的意思,你着急的话别进这个门。”——好像不着急就能进女厕所似的?

这次随性又不专业的测评就到这里。最后想说的是:可以多测试几个AI的视觉识别能力。随着这项能力提升,很多场景落地潜力巨大——比如工厂车间安全检测,能快速发现异常人或物;结合内部知识库还能识别安全隐患;农业领域可以用它识别猪牛羊,也能通过卫星照片判断作物生长状况;医学诊断中能快速协助定位影像问题。当然,现实生活中的场景还有很多。过去的AI更像一个聪明的大脑,当它拥有强大的视觉识别与理解能力后,相当于给大脑配上了一双眼睛。不妨结合自己的工作和生活,用其中任何一个AI助手试试看。

来源:https://www.53ai.com/news/OpenSourceLLM/2025081625368.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。