首页 游戏 软件 资讯 排行榜 专题
首页
科技数码
OpenAI十年庆:GPT-5.2发布与奥尔特曼的超级智能十年蓝图

OpenAI十年庆:GPT-5.2发布与奥尔特曼的超级智能十年蓝图

热心网友
92
转载
2025-12-12

面对谷歌等竞争对手带来的压力,在红色紧急状态下的OpenAI,在十周年之际火速发布GPT-5.2。

当地时间12月11日,OpenAI正式推出最新模型GPT-5.2,据最新介绍,该模型适用于专业工作和长时运行智能体,是迄今为止适用于专业知识工作的最强模型系列,在通用智能、长上下文理解、智能体化工具调用和视觉方面得到显著改进,在执行端到端的复杂现实世界任务方面优于以往的模型。

GPT‑5.2共有Instant、Thinking和Pro三个版本,将从今天开始向付费计划用户逐步推出,在 ChatGPT 中,GPT‑5.1将继续对付费用户可用三个月,之后将停止支持。在API(应用接口)中,已对所有开发者开放。

OpenAI CEO山姆·奥特曼(Sam Altman)发文表示:“即使没有诸如输出精美文件这类新功能,GPT-5.2也感觉像是我们许久以来获得的最大升级。​”

据介绍,GPT-5.2在多数基准测试中都达到了新的先进水平,在GDPval测试中(GDPval是OpenAI推出的AI评估基准,旨在衡量前沿模型在真实经济价值任务中的表现,以弥补学术测试与实际应用间的差距),在涵盖44个职业、定义明确的知识工作任务上,表现优于行业专业人士。


GPT-5.2在GDPval测试中的表现,Thinking版在70.9%的比较中击败或持平顶尖行业专业人士。

编码能力方面,GPT-5.2在SWE-Bench Pro(一项对现实世界软件工程进行的严格评估,测试四种语言,旨在更具抗污染性、挑战性、多样性和行业相关性)上,Thinking版取得了 55.6%的最高成绩,在SWE-bench Verified上,Thinking版取得了80%的高分。


OpenAI表示,对于日常专业使用而言,这意味着模型能够更可靠地调试生产代码、实现功能请求、重构大型代码库,并以更少的人工干预端到端地发布修复。

GPT‑5.2 Thinking在前端软件工程方面也优于GPT‑5.1 Thinking。早期测试者发现它在前端开发和复杂或非传统的 UI 工作(尤其是涉及 3D 元素的工作)方面明显更强,比如制作海洋波浪模拟、假日贺卡制作器、打字游戏等。

据介绍,GPT‑5.2 Thinking的事实准确性、长上下文、视觉以及工具调用性能都迎来大幅提升。比GPT‑5.1 Thinking的幻觉更少,在一组匿名查询中,包含错误的回答相对减少了30%;在4-needle MRCR 变体(长达 256k token)任务上实现接近100%准确率,同时,对于需要思考超出最大上下文窗口的任务,GPT‑5.2 Thinking与OpenAI新的Responses /compact端点兼容,扩展了模型的有效上下文窗口;视觉方面,GPT‑5.2 Thinking成为OpenAI迄今为止最强的视觉模型,在图表推理和软件界面理解方面的错误率大约降低了一半,还能更好地理解图像中元素的定位;工具调用性能方面,GPT‑5.2 Thinking在Tau2-bench Telecom测试上实现了98.7%的得分,对于延迟敏感的使用场景,其在reasoning.effort='none'(无推理)设置下的表现也远优于GPT‑5.1和GPT‑4.1。


GPT‑5.2与GPT-5.1的视觉能力对比。

在科学与数学能力方面。在 GPQA Diamond(研究生级别的、防谷歌的问答基准)测试上,GPT‑5.2 Pro达到93.2%,GPT‑5.2 Thinkin达到92.4%。

OpenAI表示,在最近与GPT‑5.2 Pro合作的研究中,研究人员探索了统计学习理论中的一个开放性问题。在特定、明确界定的设定下,模型提出了一个证明,随后得到了作者的验证,并与外部专家一起进行了审查,这证明了前沿模型已经在人类的密切监督下协助数学研究。

同时,在ARC-AGI 1(衡量通用推理能力的基准)测试上,GPT‑5.2 Pro成为第一个突破90%阈值的模型,相比去年o3‑preview的87%有所提高,同时将实现该性能的成本降低了约390倍。

在难度更高、更能隔离流体推理能力的 ARC-AGI-2基准测试上,GPT‑5.2 Thinking在思维链模型中得分为 52.9%,GPT‑5.2 Pro更是达到 54.2%,模型的推理新颖性、抽象问题的能力进一步提升。

值得一提的是,当天还是OpenAI成立十周年,奥特曼发布了题为《十年》的博客,回顾了OpenAI成立十年来的突破、经验教训以及有关AGI的思考。

他表示,OpenAI取得的成就超出了他最大胆的梦想,“我们当初设定了一个疯狂、不太可能且史无前例的目标。从极度不确定的开端起步,尽管希望渺茫,但通过持续努力,现在看来,我们似乎有望实现我们的使命”。

奥特曼表示,当他回顾早期的照片时,首先震惊于每个人看起来都那么年轻。接着,又震惊于每个人看起来都异常乐观,而且那么快乐。“那是一段疯狂而快乐的时光:尽管我们被严重误解,但我们怀着坚定的信念,觉得这件事意义重大,即使成功机会渺茫也值得为之付出巨大努力,我们拥有非常有才华的人,并且目标明确”。


OpenAI在十周年视频中发布的创业早期照片。

他表示,三年前推出ChatGPT时,世界注意到了,而当推出 GPT-4 时,反响更是热烈;突然间,考虑通用人工智能(AGI)不再是件疯狂的事。“过去的三年极其紧张,充满了压力和重大的责任;这项技术以前所未有的规模和速度融入了世界。这需要我们以极高的执行力来完成,而且我们不得不立即为此建立一种全新的能力。在这段时间里,从一无所有成长为一家庞大的公司绝非易事,需要我们每周做出成百上千个决策。我为团队做出的许多正确决策感到自豪,而那些错误的决策,则大多是我的责任”。

奥特曼表示从未对OpenAI的研究、产品路线图以及整体上通向使命的路径感到如此乐观。再过十年,几乎可以肯定OpenAI将构建出超级智能。“我预计未来会让人感到奇妙;从某种意义上说,日常生活和我们最关心的事情变化会非常小,我敢肯定,我们将继续更关注其他人的行为,而非机器的行为。但从另一种意义上说,2035年的人们将能够做到一些我认为我们现在难以轻易想象的事情”。

来源:https://www.163.com/dy/article/KGIT02IQ0514R9P4.html
免责声明: 游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。

相关攻略

善恶有报!钟汉良《蜜语纪》38集大结局,是今年看过最解气结局
娱乐
善恶有报!钟汉良《蜜语纪》38集大结局,是今年看过最解气结局

2026年开春收视黑马《蜜语纪》,于4月底迎来大结局。 当所有看惯国产剧套路的观众,都以为结局无非是霸道总裁携“娇妻”登顶职场巅峰时,《蜜语纪》却给出了截然不同的答案——它不仅让观众看爽了,更抛出了全剧最清醒、最硬核的内核。 反派悉数恶有恶报!剧中那位让人恨得牙痒痒的鲁贞贞,可谓将算计做到了极致。怀

热心网友
05.01
张雪成为符号,故事开始俗套
娱乐
张雪成为符号,故事开始俗套

张雪:逆袭故事背后的真实温度 十四岁,初中毕业,从摩托车修理铺的学徒工起步;二十五年后,带领团队战胜国际强队,站上世界超级摩托车锦标赛的最高领奖台——这是张雪的故事。听起来,是不是像极了那些年在《读者》《意林》里反复出现的励志叙事?热血,逆袭,以凡人之躯比肩传奇。 但看得多了,难免会生出一种熟悉的疏

热心网友
04.29
捕获野生夜魔侠!漫展「反向搭讪粉丝」求合照 真相曝光网笑疯
娱乐
捕获野生夜魔侠!漫展「反向搭讪粉丝」求合照 真相曝光网笑疯

《夜魔侠:重生》第二季强势回归,空降全球收视冠军 漫威的硬核之作《夜魔侠:重生》第二季,自3月25日开播以来,势头可谓锐不可当。刚一上线,便直接空降Disney+全球收视榜榜首,其专属话题标签 DaredevilBornAgain更是在首播当晚,迅速冲上社群平台“X”的全球趋势第一,热度可见一斑。

热心网友
04.28
《High Potential》女主放话
娱乐
《High Potential》女主放话

看来,要让观众对一对CP的“催婚”持续上头,Kaitlin Olson心里自有一套精密的算法。作为ABC热门剧《High Potential》的女主角兼执行制片人,她在第二季大结局播出后的一席谈,几乎给Morgan和Karadec的感情发展按下了暂停键。理由很直接:如果现在就让他们在一起,往后的戏还

热心网友
04.28
《叵测》大结局:背后boss,薛琴以一人之力,搭上7条“人命”!
娱乐
《叵测》大结局:背后boss,薛琴以一人之力,搭上7条“人命”!

悬疑剧《叵测》大结局深度解析:真相揭晓,复杂人性引人深思 热播悬疑剧《叵测》迎来震撼收官,当最终真相浮出水面,无数观众陷入沉默与反思。孟广才的“出轨”表象、弟弟薛永辉的牺牲、焦利军的谋划、汪大柱的义气,这一切竟都是为了掩护核心人物——薛琴。这段纠缠于三男一女之间的复杂关系,交织着扭曲的友谊与爱情,究

热心网友
04.26

最新APP

宝宝过生日
宝宝过生日
应用辅助 04-07
台球世界
台球世界
体育竞技 04-07
解绳子
解绳子
休闲益智 04-07
骑兵冲突
骑兵冲突
棋牌策略 04-07
三国真龙传
三国真龙传
角色扮演 04-07

热门推荐

《Zero Parades: For Dead Spies》游戏评分与媒体评价汇总
游戏攻略
《Zero Parades: For Dead Spies》游戏评分与媒体评价汇总

《Zero Parades: For Dead Spies》的媒体评测已经解禁,结果相当亮眼。这款被许多人视为《极乐迪斯科》精神续作的作品,在OpenCritic上拿到了86分的媒体均分,在Metacritic上也有83分。游戏将于5月21日正式登陆PC平台,看来2026年的必玩叙事RPG名单上,又

热心网友
05.18
Excel多级分类汇总一句话快速完成
AI
Excel多级分类汇总一句话快速完成

目录 你是否也遇到过这些问题 处理效果 前置准备 超简单AI自动化解决方案 第1步:准备好你的原始数据 第2步:针对指定的文件下达指令 第3步:验收 还能解决这些同类问题 指令为什么这么有用? 更多场景直接抄作业 销售数据三级汇总 成本数据多级汇总 库存数据汇总 员工薪资汇总 常见问题答疑 核心价值

热心网友
05.18
Kimi K2.6 智能体功能深度解析与体验评测
AI
Kimi K2.6 智能体功能深度解析与体验评测

AI Agent 的发展,正迎来一个关键的转折点,从概念验证迈向真正的生产力交付。 想象一下,当一个 AI 智能体能够在无需人工介入的情况下,独立完成一个复杂项目的全流程,并将成功经验固化为可随时调用的“技能”——这是否标志着 AI 在职场中的角色,已经从辅助工具演变为自主的生产力单元? 随着 Op

热心网友
05.18
苹果WWDC26前瞻 iOS27新Siri界面交互升级预测
AI
苹果WWDC26前瞻 iOS27新Siri界面交互升级预测

彭博社的马克・古尔曼在最新报道中透露了一个有趣的发现:苹果为WWDC 26发布的宣传海报,其设计细节可能暗藏玄机,指向了即将在iOS 27中亮相的全新Siri交互界面。 根据古尔曼的分析,新版Siri的核心变化在于与灵动岛的深度融合。唤醒时,它将不再以传统的全屏或底部卡片形式出现,而是会以一个扩展的

热心网友
05.18
GitHub刷星乱象调查 AI项目成虚假评分重灾区
AI
GitHub刷星乱象调查 AI项目成虚假评分重灾区

GitHub 的 Star 数量还值得信赖吗?真相可能比你想象的更严峻。 开源社区中“购买 Star”的现象早已不是秘密,其便捷程度甚至超过点外卖,单价低廉且支持批量折扣。然而,卡内基梅隆大学(CMU)一项被 ICSE 2026 顶会收录的最新研究,首次系统性地揭示了这场“造假生意”的惊人规模:Gi

热心网友
05.18