最近,AI圈里一项被称为“人类终极考场”(Humanity's Last Exam,HLE)的顶级基准测试,爆出了一个不小的冷门——Zoom的人工智能系统以48.1%的得分冲到了榜首,直接把谷歌Gemini 3 Pro之前45.8%的纪录给刷新了。
你可能会问:一家不自研底层大模型的公司,凭什么能反超那些砸了重金的头部模型厂商?Zoom的首席技术官黄学东——没错,就是那位前微软AI高管——给出了一个相当干脆的答案:他们没有去烧钱训练万亿参数的私有大模型,而是搞出了一套高度协同的“联邦式人工智能架构”。这套架构的核心有三个组件:
- Z评分器(Z-Scorer):扮演整个系统的决策中枢角色,实时分析来自OpenAI、Google、Anthropic等多家主流模型的输出,然后按任务需求现场选出最优的那个响应。
- 探索–验证–联合机制:一种多智能体协作范式,说白了就是让不同AI模型互相质疑、交叉验证、协同优化,推理质量和逻辑严谨性就这么一步步提上来了。
- 流量控制器:本质上是一个高度智能化的调度枢纽——它不替代模型,而是整合模型;不堆算力,而重编排。正是这种“集成即能力”的思路,让Zoom做到了任何单点模型都难以企及的综合表现。
成绩一出,技术圈立刻炸了锅,观点两极分化。以工程师Max Rumpf为首的一批开发者直言,Zoom不过是在各大厂API之上搭了个“高级封装层”,这次突破仅仅体现在脱离真实场景的学术测试里,对终端用户来说价值微乎其微,甚至被扣上了“借他人之力博虚名”的帽子。
但另一派人,比如开发者朱宏成,看法截然不同。在他看来,在当前AI评估体系下,“模型联邦”已经成了必然路径——这就像Kaggle数据竞赛冠军几乎清一色采用模型融合策略,而不是孤注一掷押单一架构。从商业视角看,这条路子极具现实智慧:既规避了天文数字般的训练成本,又赋予Zoom在模型供应商之间自由切换的能力,彻底摆脱了生态绑定的困局。
黄学东认为,这次HLE登顶是对Zoom全栈AI战略的一次关键印证。不过,对全球3亿用户来说,真正的考验在于即将发布的AI Companion 3.0。尽管48.1%的成绩映射出当前机器在高等数学、抽象哲学等复杂认知任务上的前沿水平,但用户真正关心的是:当数以亿计的会议记录被自动归纳、行动项被精准提取时,这套“联邦大脑”是否真的比任何单一模型更高效、更可靠、更懂人。
