游乐游手机版
首页/AI热点日报/热点详情

OpenAI最新开源GPT-oss模型,两百万小时训练,AI Agent专属可商用

类型:热点整理2026-07-20
OpenAI开源GPT-oss模型,提供1200亿和200亿两种参数规格,采用Apache2 0商业许可。该模型专为AIAgent设计,原生支持函数调用、网络搜索和Python执行,训练时长超200万小时。120B版本性能对标o4-mini,需80GB显存;20B版本与o3-mini相当,16GB显存即可运行。

今天凌晨,OpenAI突然发布了一项重磅开源成果——GPT-oss正式对外开放。此次一口气推出了1200亿和200亿两种参数规格,并直接采用Apache 2.0商业许可,诚意十足,备受开发者关注。

这款模型专为AI Agent量身打造。函数调用、网络搜索、Python执行等智能体开发中的核心能力,GPT-oss均原生支持。换言之,用它构建安全、功能强大的智能体应用,将比以往更加得心应手。

性能方面,GPT-oss-120B版本直接对标o4-mini,测试数据不分伯仲。当然,代价也不小——至少需要80GB显存的GPU才能运行。相比之下,20B版本虽然性能略低,但与o3-mini有一拼,且硬件门槛大幅降低,16GB显存即可满足,甚至能在普通消费级显卡上流畅运行。

为了训练GPT-oss,OpenAI在英伟达H100上累计运行超过200万小时。放眼整个开源模型圈,这恐怕也是训练时长最长的模型之一。

开源地址:https://github.com/openai/GPT-oss
https://huggingface.co/openai/GPT-oss-120b

OpenAI的CEO Sam Altman亲自发文解读本次发布。他的核心观点非常明确:这是一款最先进的开放权重推理模型,真实世界的表现足以与o4-mini抗衡,而且你完全可以在本地电脑上运行——小版本甚至能塞进手机。在他看来,这应该是当前全球最出色、也最好用的开放模型。

他还强调,OpenAI将耗费数十亿美元研发成果的模型推向世界,是希望让尽可能多的人接触到AI。虽然安全问题不容忽视,但团队已在生物安全等核心风险上做了大量工作,内部安全基准测试中,GPT-oss的表现与前沿模型相当。

有趣的是,Altman提到20B版本能在手机上运行,这一说法瞬间引发了不少质疑。毕竟按照官方数据,20B版本也需要16GB显存,普通手机怎么可能跑得动?网友的评论很直白:“估计得是那种特制的手机才能用吧。”

社区的反应可以说是两极分化。有人感谢Sam和OpenAI团队赋予开发者如此强大的能力,也有人直言不讳:市场迫使OpenAI开源,而他们只是在用“造福人类”的叙事来包装一次竞争性举措。毕竟在这个赢家通吃的行业里,每一步棋都藏着战略考量。

但无论如何,把性能接近o4-mini的开源推理模型交到全世界开发者手中,这件事本身就意义重大。有人甚至感叹,这不仅是开源运动的里程碑,更是一次行业规则的改写——连xAI的马斯克都被拉出来对比了,Grok-2和Grok-3的开源到底在哪里?

从更宏观的视角看,OpenAI的愿景是让AGI造福全人类,而选择基于美国创造的、以民主价值观为基础的开放AI技术栈进行开发,免费向所有人开放,这本身就传递了一个清晰的信号。

架构层面,GPT-oss采用了混合专家模型(MoE)路线。

GPT-oss-120B由36层组成,总参数量1168亿,但每次前向传递只激活51亿参数。相比之下,GPT-oss-20B是24层结构,总参数209亿,每次激活36亿。这种设计让计算资源得到更高效的分配,处理复杂任务时游刃有余。

每个MoE模块包含的专家数量也不一样:120B版本有128个专家,20B版本有32个专家。模型通过一个标准的线性路由器投影,将残差激活映射到每个专家分数,然后在前向传递时,根据分数选择每个token的前4个专家,再按softmax权重加权输出。说白了,就是让模型根据输入数据的复杂度,动态调配计算资源。

注意力模块借鉴了GPT-3的架构,采用带状窗口和全密集模式交替设计,窗口带宽128个token。这种交替模式在处理长序列数据时,效率和性能表现都相当不错。

每层注意力模块包含64个查询头,每个头维度64,采用分组查询注意力技术(键值头数量8)。旋转位置嵌入(RoPE)和YaRN技术的加持,让密集层的上下文长度扩展到了131072个token——处理长文档、长对话场景时,这一优势体现得淋漓尽致。

归一化和激活函数也经过了精心设计:采用根均方归一化(RMSNorm),在每个注意力和MoE模块之前应用。激活函数则选择了门控SwiGLU,非线性能力和表达能力都有可靠保障。

实测数据更是亮眼。

在AIME美国数学邀请赛中,GPT-oss-120B在高推理模式下达到了96.6%的准确率,逼近o4-mini的98.7%。编程领域也不遑多让,Codeforces编程竞赛的Elo评分达到2622,距离o4-mini的2719差距不大。

多语言能力同样可圈可点:法语84.6%、德语83.0%、西班牙语85.9%,高推理模式下的表现说明它在跨语言任务上的适应性相当强。

总的来说,这次开源的意义不亚于一次行业的重新洗牌。当最前沿的小模型以开放姿态走向世界,接下来的创新速度会快到什么程度?值得我们拭目以待。

来源:https://www.53ai.com/news/OpenSourceLLM/2025080692530.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。