首页 游戏 软件 资讯 排行榜 专题
首页
AI
GPT-5发布华人团队揭秘:清北校友核心贡献深度解析

GPT-5发布华人团队揭秘:清北校友核心贡献深度解析

热心网友
22
转载
2025-12-12


免费影视、动漫、音乐、游戏、小说资源长期稳定更新! 👉 点此立即查看 👈

新智元报道

编辑:Aeneas

【新智元导读】号称满分屠榜的GPT-5.2,一发布就降智了?许多网友现身表示,似乎确实比开始弱了很多。但提前实测的网友表示,它的确很强,甚至当得起GPT-6之称!

昨夜,OpenAI放出了GPT-5.2炸弹。

根据最新公布的基准测试,它几乎完全碾压Gemini 3 Pro。

GPT-5.2最擅长帮人们完成有经济价值的任务,比如做电子表格、做PPT、写代码和审查代码、分析长文档等等。

而且号称在GDPval等基准测试中,有70.9%的时间能追赶甚至吊打专业人士。

可以说,这是OpenAI进入红色预警,甚至不惜改变AGI目标,都要完成的一个产品,而且还身负着狙击Gemini 3的重任。


所以,GPT-5.2实测起来,体感究竟如何?

GPT-5.2实测:一上线就降智?

出乎意料都是,一个GPT-5.2实测翻车的帖子,在X上火了。

如果向它提问:「garlic」中有多少个R?它会回答:0个。


相比之下,其他模型的表现就要稳定得多。


归根结底,这是LLM的一个底层问题:因为tokenization而无法统计字母数量。

不过,只要强制选到Thinking版本,GPT-5.2就能答对这个问题了。



在reddit上,也有很多网友表示:在GPT-5.2刚发布的时候,似乎功能还很强。

结果几个小时后,它紧接着就降智了。


有人表示,自己早上八点半开始用的时候还好好的,喝完一杯咖啡后,GPT-5.2忽然就不行了。


似乎每次新模型一发布,几小时后就会被削弱,OpenAI这是什么操作?


大佬现身说法:还是挺强的

不过这点小插曲,还是没有影响坊间的正面评论。

昨晚GPT-5.2一发布,网友们就被震撼了。

比如有人说,ARC-AGI 2的这次飞跃属实疯狂,OpenAI究竟是怎么做到的?




本来大家还以为OpenAI已经落后谷歌了,看来并没有!


看起来,OpenAI内部还捂着不少厉害的东西没发布。


而且,领略过GPT-5.2超强满血版的用户,对它是一致好评。


沃顿商学院教授Ethan Mollick表示,自己有幸提前使用了GPT-5.2,它的性能还是令人印象很深刻的。


比如下面这个任务:创建一个视觉上有趣的着色器,可以在twigl-dot-app中运行,使其看起来像一座无限的新哥特式塔楼城市,部分淹没在波涛汹涌的海洋中。

对于这个视频,很多网友大加赞叹:GPT-5.2不仅遵循了指令,还在代码中选择了非常合理的审美和结构。



然后,教授又让GPT-5.2绘制一张人类历年考试成绩的图表。


这个任务十分复杂,因为需要在过程中查找和交叉引用大量资料,然后一次性就生成有用的结果。

可以看到,GPT-5.2的表现十分惊艳。


这个Twigl代码的实例,显出了GPT-5.2的强大编码能力。


推理、数学、编程的重大飞跃

Magicpathai的CEO表示,自己已经测试GPT-5.2有一段时间了。

他对于这个模型的评价是——「复杂推理、数学、编程和模拟方面的一次重大飞跃」。


在下面这个实例中,它在单个文件中就构建了一个完整的3D图形引擎,还支持交互式控制,分辨率达到4K。

在这个视频中,他还用GPT-5.2进行了高难度推理。

有人质疑道:这个图形引擎会不会是GPT-5.2调库完成的?CEO表示,所有代码和图形完全是从0开始写的。


也就是说,GPT-5.2的进步不是渐进式的,而是编码助手功能的彻底范式转变。


网友们惊呼:这种进步的速度,实在是令人头晕目眩。


这位CEO对于GPT-5.2的评价是:它是OpenAI推出的最佳智能体模型,可以连续运行大量工具而不会出现问题,并且比其前代产品速度更快。

为了测试它的功能,他构建了一个智能体,可以同时使用GPT-5.2、5.1和5。

结果显示,GPT-5.2调用工具时无需任何前导码,而且即使在长时间会话中,也不会迷失方向。


还有人让GPT-5.2用ASCII写出了自己的内心世界,答案很震撼。


总之,在大多数人的反馈中,GPT-5.2能稳定地处理实际工作,条理清晰,工作流程顺畅。


相比于会出现小中断的旧模型,GPT-5.2对于任务的理解更强,完成得也更顺利。


ARC Prize表示,GPT-5.2 Pro(X-High)的最新SOTA得分为90.5%,这就意味着,AI在一年内效率已经提高了约390倍。



背后神秘华人,浮出水面

同以往一样,这次GPT-5.2的幕后功臣,依然有不少华人。

比如,最早预告GPT-5.2的OpenAI华人研究员、北大校友Yu Bai。


他本科在北大学习数学,在斯坦福获得统计学博士学位。


负责后训练的Yun Dai,本科来自清华大学,在加州大学尔湾分校获得了计算机科学硕士学位。


另一位OpenAI华人研究员Zuxin Liu,从事推理模型后训练工作。

他本科毕业于北航,在CMU攻读硕士和博士学位。


Aston Zhang来自在伊利诺伊大学厄巴纳-香槟分校攻读博士学位,现在是OpenAI的研究员。


他感谢了团队,尤其强调了GPT-5.2 Thinking的处理多步骤任务能力。


总之,昨晚的AI大战,OpenAI给出了强烈一击。

接下来,谷歌又会拿出什么来应对呢?

参考资料:

https://x.com/skirano/status/1999182295685644366

https://x.com/emollick/status/1999185085719887978

秒追ASI

⭐点赞、转发、在看一键三连⭐

点亮星标,锁定新智元极速推送!

来源:https://www.163.com/dy/article/KGJ3FK2K0511ABV6.html
免责声明: 游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。

相关攻略

林俊杰离职后,首次发布长篇告别自述
科技数码
林俊杰离职后,首次发布长篇告别自述

新京报贝壳财经讯(记者罗亦丹)3月26日,在本月初离职,广受科技圈关注的原阿里千问技术负责人林俊旸在社交账号发布了一篇名为From "Reasoning " Thinking to "Agentic "

热心网友
03.27
普林斯顿团队颠覆传统模型推理,速度提升19%的神奇方法
科技数码
普林斯顿团队颠覆传统模型推理,速度提升19%的神奇方法

在人工智能飞速发展的今天,大型语言模型已经成为我们日常生活中不可或缺的助手。然而,就像一台高性能跑车需要不断优化才能跑得更快一样,这些AI模型在生成文本时也面临着速度瓶颈。最近,由普林斯顿大学和LM

热心网友
03.26
MIT团队突破:AI系统如何掌握真实工程推理能力?
科技数码
MIT团队突破:AI系统如何掌握真实工程推理能力?

这项由麻省理工学院机械工程系和土木环境工程系联合开展的研究发表于2026年3月,论文编号为arXiv:2603 04124v1。研究团队针对一个关键问题展开探索:当我们用严格的奖励机制训练小型AI模

热心网友
03.16
MIT全新RandOpt算法,破解大模型训练久耗痛点
AI
MIT全新RandOpt算法,破解大模型训练久耗痛点

只需向模型添加高斯噪声,性能就能比肩甚至超越GRPO PPO等经典调参算法。MIT新论文向大家都在头疼的“调参”开炮了!为了将预训练模型变成某一任务领域专家,无数人夜以继日,纷纷掉发。然而现在,一对

热心网友
03.16
AI与基础科研融合的三大关键问题解析
科技数码
AI与基础科研融合的三大关键问题解析

(来源:麻省理工科技评论)好奇心驱动的研究长期以来一直是技术变革的火种。一个世纪前,对原子的好奇催生了量子力学,并最终孕育出现代计算核心的晶体管;反过来看,蒸汽机是一项实用的突破,但人们在热力学领域

热心网友
03.15

最新APP

你比我猜
你比我猜
休闲益智 03-26
锦绣商铺
锦绣商铺
模拟经营 03-26
儿童画画
儿童画画
休闲益智 03-25
疯狂猜词
疯狂猜词
休闲益智 03-25
诸神皇冠
诸神皇冠
棋牌策略 03-25

热门推荐

猎豹浏览器免安装网页版:在线云端使用入口与教程
电脑教程
猎豹浏览器免安装网页版:在线云端使用入口与教程

猎豹浏览器免安装网页版入口是https: web lemur-browser com,具备界面简洁响应迅速、多端同步无缝衔接、安全防护层级丰富、文档处理能力突出、资源兼容性广泛覆

热心网友
03.27
昆仑万维发布三大世界第一梯队AI模型
科技数码
昆仑万维发布三大世界第一梯队AI模型

据昆仑万维集团消息,3月27日下午,昆仑万维(300418 SZ)旗下天工AI顺利举办“世界模型前沿技术与天工AIGC全家桶大模型生态”专场发布会,携Matrix-Game 3 0、SkyReels

热心网友
03.27
杨植麟、张鹏、夏立雪、罗福莉论道大模型:未来一年趋势前瞻
科技数码
杨植麟、张鹏、夏立雪、罗福莉论道大模型:未来一年趋势前瞻

本报(chinatimes net cn)记者石飞月 北京报道大模型未来会走向哪里?OpenClaw的爆火似乎为全行业指明了一个方向,但接踵而至的舆论质疑,又让这个答案变得扑朔迷离。3月27日,在2

热心网友
03.27
Anthropic核心模型意外泄露,网络安全股面临冲击风险
科技数码
Anthropic核心模型意外泄露,网络安全股面临冲击风险

Anthropic一款尚未发布的新AI模型因数据泄露意外曝光,引发市场对AI颠覆网络安全行业的担忧再度升温,网络安全板块股价周五盘前全线下挫。据《财富》杂志报道,Anthropic正在开发并已开始向

热心网友
03.27
Token经济到来,解析互联网大厂的布局与冷思考
科技数码
Token经济到来,解析互联网大厂的布局与冷思考

3月初,腾讯在深圳总部楼下设立“龙虾站”,引发千人排队尝鲜。OpenClaw掀起的“全民养虾”热潮,在短短一个月内让更多人看到了AI Agent深入业务场景的价值,随即推动Token调用量大规模增长

热心网友
03.27