多款AI模型坦克大战测试全部翻车
多个国内外AI模型(豆包、DeepSeek、千问、Kimi、GPT、Gemini、Claude)未能正确回答《坦克大战》修改规则的视觉推理题,因其依赖固有知识、缺乏主动推理,难以处理“如果”条件与图片信息的冲突。
上次聊到DeepSeek的图像识别能力不如豆包,有些朋友对此颇有微词。其实不必过于较真——尺有所短,寸有所长,各家模型各有擅长领域,这再正常不过。我那次只聚焦识别图片,豆包确实比DeepSeek表现更佳,这点毫无争议。但话说回来,豆包也并非十全十美。
今天这个测试题,豆包同样栽了跟头,而且不只是它,DeepSeek、Qwen、Kimi集体失手,即便是GPT、Claude这样的业界顶流,也都没能给出正确答案。
AI固然强大,但人类总能找到刁钻角度,让它们集体哑火。
这次是一个视觉理解题。把下面这张图交给AI,然后问了一个问题:
不知道有没有玩过《坦克大战》的老玩家,还记不记得这款80后家喻户晓游戏的规则?
题目的刁钻之处在于,我用“如果”修改了基础规则。AI必须先理解坦克大战的原始规则,但不能死记硬背,得通过图片信息进行推理,才能给出正确答案。
下面看看各家AI是怎么接招的。
来源:https://juejin.cn/post/7653777184240681014
本站内容用于信息整理与展示,如有侵权或内容问题请及时联系处理。
相关推荐
补充同频道和同主题内容,方便继续浏览更多相关内容。
同类最新
继续查看同栏目最近更新的文章。
CAD零基础入门教程:坐标输入、图层管理与基础绘图命令
本文面向CAD零基础学习者,系统讲解坐标输入、图层管理与基础绘图命令的核心用法。通过分步实操与常见问题排查,帮助新手建立精确绘图习惯,掌握规范出图的基础能力。
CAD从入门到项目交付:绘图、标注、图块与实战工作流
掌握CAD的核心在于建立“画得准、标得清、复用快、交付稳”的工作流。本文提供从环境设置、高频命令组合、标注规范、图块标准化到项目分阶段交付的完整路径,帮助初学者避免常见返工陷阱,独立完成可检查、可复用、可打印的工程图纸。
Claude Code 登录指南:个人、Teams 与企业账号区分与授权步骤
本文详细解析 Claude Code 登录前的账号类型区分方法,涵盖个人订阅、Teams 席位与企业 Enterprise 席位的授权路径差异。提供终端登录命令、环境变量排查及常见异常处理步骤,帮助用户快速完成正确授权并避免登录路径混淆。
Claude Code 文件修改前的权限模式配置与命令审批指南
本文详细介绍Claude Code在修改文件前的权限模式配置方法,包括defaultMode可选值、permissions allow与deny规则设置、多层级配置文件管理以及 status验证技巧,帮助开发者安全高效地使用AI编程助手。
Claude Code接入VS Code后先测扩展和终端命令
在VS Code中接入Claude Code后,建议优先验证扩展面板与集成终端两条入口。本文提供标准检查顺序、关键命令与常见故障排查路径,帮助你快速确认环境就绪,避免后续开发受阻。
