游乐游手机版
首页/科技数码/文章详情

揭秘谷歌Gemini 3:性能全面升级,AI新纪元开启

时间:2026-01-28 12:07
第一个国产版Gemini3,来了。 1月26日,阿里正式发布千问旗舰推理模型Qwen3-Max-Thinking。 据介绍,Qwen3-Max-Thinking总参数超万亿、预训练数据量高达36

首个国产版的Gemini 3,终于来了。

1月26日,阿里正式发布了通义千问旗舰推理模型Qwen3-Max-Thinking。

据介绍,Qwen3-Max-Thinking的总参数量超过万亿,预训练数据量高达36T+ Tokens,在科学知识、数学推理、代码编程等多项权威评测中刷新了全球纪录。它在数学推理的AIME 25和HMMT 25上拿到了国内首个双满分,甚至在“人类最后的测试”HLE中得分58.3,大幅超过GPT-5.2-Thinking的45.5和Gemini 3 Pro的45.8。

更关键的是时间点。如果你最近关注AI圈,会发现各家大模型厂商都在憋大招,阿里抢在这个节骨眼上发布Qwen3-Max-Thinking,摆明了就是要争“国产第一个Gemini 3”的名号。

榜单数据再好看,到底能不能媲美Gemini 3?

试了几次千问生成代码,前几次任务失败率还挺高的,但只要碰到阿里擅长的场景,表现就完全不一样。比如让它做一个卖水果的电商,商品分类、加购结账这些功能,基本一次就写出来了,而且逻辑很完整,体验也流畅。很明显,电商这种场景它见得太多,淘宝天猫的数据喂得够饱,所以做起来特别顺手。

但换成其他类型的任务,成功率就不太稳定了。如果你的需求正好在它的舒适区里,那体验确实要好;如果偏离了,可能得多试几次调整提示词。

我还专门测试了一个更复杂的交互案例:用摄像头做体感控制的打气球游戏,这也是Gemini 3展示过的经典demo。具体需求是:用手势控制屏幕上的准星,做捏合动作来射击从下往上飘的气球,还要有天空背景、云层漂移、击中特效、连击反馈这些细节。

千问的表现让我有点意外。整个游戏的框架它一次就搭出来了:天空渐变背景、气球从底部生成往上飘、大小不同速度不同、UI显示分数和连击数,这些基础逻辑都没问题。

交互效果做得挺有意思。伸出食指,屏幕上的准星就会跟着手移动,拇指和食指捏合就能开火。击中气球的瞬间,屏幕会轻微震动,气球爆开时有粒子特效散开,还有“叮”的一声音效,反馈感做得很足。连续击中将显示combo数字,这种即时反馈确实有代入感。

但实际玩起来有个明显的问题:瞄不准。手明明对准一个气球了,但准星位置总是偏的,打好几下才能碰巧击中。这应该是手部追踪和屏幕坐标映射之间有偏差,或者校准算法不够精确。虽然千问做出了体感控制的完整流程:摄像头调用、手势识别、射击反馈这些环节都跑通了,但核心的“指哪打哪”这个精度没做好,导致游戏性打了折扣。

不过,千问这次最厉害的地方,不是参数有多大,而是它“想问题”的方式变了。在关键的模型推理能力提升中,千问新模型采用了一种全新的测试时扩展机制,推理性能提升的同时还更经济。

打个比方,以前的AI做数学题是这样的:同时写10份答案,然后投票看哪个对的人多,就选哪个。这种方法很笨,浪费算力,而且10份答案里可能犯的都是同一个错误。

Qwen 3改成了人类的做法:先做一遍,做完看看哪里不对,总结一下经验,再重新做。就像你做错题本一样,第二遍肯定比第一遍做得好。结果就是,在那个需要用工具解决问题的测试里,千问拿了58.3分,Gemini只有45.8分,差了一大截。

在调用工具层面,千问的做法是把工具使用能力“训练进”模型里,在完成初步的工具使用微调后,通义团队对模型进一步在大量多样化任务上进行了基于规则奖励与模型奖励的联合强化学习训练,使得Qwen3-Max-Thinking拥有更智能结合工具进行思考的能力。

它用三步训练法:先教会用工具,再在各种任务里强化练习,最后形成条件反射。好处很明显:用起来又快又顺,不用每次都去读工具说明书,而且模型自己知道该在什么时候用什么工具。这就是为什么千问在HLE测试里比Gemini高出12分,特别是需要连续用好几个工具解决复杂问题的时候,这种“肌肉记忆”优势就体现出来了。

相比之下,Gemini走的是传统软件工程的路子:模型只负责理解你要干什么,具体调工具靠外部API框架。这样做最大的好处是灵活:Google想接入沃尔玛的购物功能,不用重新训练模型,插个API就行。但代价是每次用工具都要走“理解意图—翻译成API调用—执行—解析结果”这一整套流程,慢而且容易出错。

千问的代码生成能力,已超越单纯的“语法翻译器”,更像一位理解你意图的技术伙伴。它不仅能将需求转化为可运行的代码,更具备工程直觉:知道何时优化性能、何时简化实现、何时添加容错机制。

这种“度”的把握,恰恰是AI从“工具”走向“协作者”的关键跃迁。

来源:https://36kr.com/p/3658516807639680
上一篇芯思科技CEO:存储芯片供应短缺或将持续至2027年 下一篇船舶电动化与AI智能驾驶重塑现代海运出行
本站内容用于信息整理与展示,如有侵权或内容问题请及时联系处理。

相关推荐

补充同频道和同主题内容,方便继续浏览更多相关内容。

同类最新

继续查看同栏目最近更新的文章。

更多
优必选CEO周剑:家庭机器人生态核心投入过半精力
科技数码 · 2026-07-01

优必选CEO周剑:家庭机器人生态核心投入过半精力

先说几个核心判断:优必选正在布局一盘长远战略。创始人兼CEO周剑在近期一场媒体沟通会上,直接亮出了公司未来的发展路线——工业、商用、家庭陪伴机器人三条业务主赛道并行推进,现阶段每条线各占约一半精力。一边是已经能够稳定创造收入的工业场景,另一边则是他眼中“最具想象力与未来空间”的家庭陪伴领域。工业人形

CPO/NPO/OIO开启封装级光连接价值空间,技术路线尚未收敛
科技数码 · 2026-07-01

CPO/NPO/OIO开启封装级光连接价值空间,技术路线尚未收敛

6月30日,申银万国在光连接系列研报中重点指出,MPO光连接器领域的投资机会值得高度关注。通俗来说,随着AI算力集群持续扩张,光互联升级带来的连锁效应——数据中心光纤通道数量、前面板端口密度、机柜内光纤管理复杂度——均在同步攀升。光连接器的角色早已超越传统的低价值标准件,如今它直接决定着链路插损、可

龙岗AR实景剧本游内测体验短板有效破解之道
科技数码 · 2026-07-01

龙岗AR实景剧本游内测体验短板有效破解之道

在今年龙岗区第二届人工智能与机器人发展大会上,区级部门一次性推出了7个AI“龙搭子”。其中,名为“龙导游”的成果成为文商旅融合领域的核心亮点。据南都N视频记者了解,依托“龙导游”打造的全区全域AR实景剧本游“龙岗大陆”,已在今年五一假期发布了内测版本。经过一个月市场验证后,该项目正式启动面向全社会的

南下资金6月30日净买入中芯国际与建滔积层板
科技数码 · 2026-07-01

南下资金6月30日净买入中芯国际与建滔积层板

6月30日,南下资金持续大举买入港股,单日净流入金额高达58 95亿港元。接下来,我们直接盘点哪些个股获得资金青睐、哪些遭到减持: 净买入方面,中芯国际领跑全场,单日吸金19 33亿港元;建滔积层板紧随其后,净买入10 59亿港元;腾讯控股获得7 65亿港元净流入;智谱(02513 HK)也有6 5

电动汽车电池新国标7月实施热失控不起火不爆炸
科技数码 · 2026-07-01

电动汽车电池新国标7月实施热失控不起火不爆炸

自2026年7月1日起,两项关乎电动汽车安全的核心强制性国家标准将正式实施,为行业加装“安全锁”——《电动汽车安全要求》(GB 18384-2025)与《电动汽车用动力蓄电池安全要求》(GB 38031-2025)同步落地。此次标准升级,从整车架构与电池系统两大维度,精准填补了近年来多起事故暴露出的