游乐游手机版
首页/AI热点日报/热点详情

OpenAI深夜重新开源gpt-oss,性能达o4-mini水平

类型:热点整理2026-07-20
OpenAI近日开源两款大模型gpt-oss-120b与gpt-oss-20b,其推理性能在多种任务中媲美o4-mini。120b模型仅需单张H100显卡即可高效运行推理任务,20b模型仅需16GB显存即可运行推理任务。采用Apache2 0开源许可,支持完整的思维链推理、微调与智能体能力,且预训练成本低至不足50万美元。

今夜,OpenAI终于拿出了让开发者们真正兴奋的东西——两款全新开源模型,性能直指自家旗舰级产品。

这意味着什么?简单来说,从今往后,开发者有了能在单张GPU上跑出o4-mini水平的开源选择。

OpenAI重新开源!深夜发布gpt-oss,o4-mini水平

两款模型分别是「gpt-oss-120b」和「gpt-oss-20b」。名字里的数字,指向的是总参数量与激活参数量的不同配比。

  • gpt-oss-120b:总参数1170亿,激活参数51亿。定位很清晰——需要高推理能力的生产级和通用型场景。在核心推理基准测试中,它的表现与o4-mini相当,并且只需一张80GB显存的GPU(如H100)就能高效运行。

  • gpt-oss-20b:总参数210亿,激活参数36亿。目标场景是低延迟、本地化或专业化部署。它的表现在常用基准中与o3-mini类似,但更惊人的是,它只需要16GB显存的边缘设备就能跑起来。

两款模型在工具使用、少样本函数调用、思维链推理以及HealthBench等专业评测中,表现甚至超过了OpenAI自家的o1和GPT-4o这些专有模型。这背后是一个有意思的信号:开源模型的潜力,远未被封顶。

除此之外,还有几个关键亮点值得留意:

  • Apache 2.0许可证:这是最宽松的开源协议之一。你可以自由使用、修改、商业化,没有版权传染风险或专利陷阱。对实验、定制和商业部署来说,是理想选择。

  • 可配置推理投入:根据你的具体用例和延迟需求,可以灵活调整低、中、高三档推理投入。这意味着可以在性能和速度之间做精细平衡。

  • 完整思维链:你可以完整访问模型的推理过程。这对于调试、验证和提升输出可信度来说,价值巨大。

  • 支持微调:支持参数级微调,可以针对特定用例对模型进行完全定制。

  • 原生智能体能力:模型原生支持函数调用、网页浏览、Python代码执行和结构化输出。这使其天然适合构建AI智能体工作流。

  • 原生MXFP4量化:MoE层在训练时就采用了原生MXFP4精度,这就是为什么120B模型能在单张H100上运行、20B模型仅需16GB内存的原因——效率设计从一开始就被写进了基因里。

OpenAI还特地准备了一个体验网站和完整的开源仓库,方便大家直接上手尝试。

GPT-2以来,首次开源

gpt-oss系列模型,是OpenAI自GPT-2以来首次开源的语言模型,这个时间跨度本身就说明了其重要性。

今天,OpenAI同步放出了一份34页的技术报告,完整披露了预训练与后训练的全流程细节。模型采用了当前最先进的预训练和后训练技术。

在预训练与模型架构方面,相较于此前开源的Whisper和CLIP,gpt-oss在推理能力、效率和在广泛部署环境中的实用性上都实现了跃升。每个模型都基于Transformer架构并融入MoE设计,显著减少了处理输入时的激活参数量。

架构设计上,模型借鉴了GPT-3的设计理念,采用了交替的密集注意力和局部带状稀疏注意力模式。为了进一步提升推理和内存效率,还采用了分组多查询注意力机制(组大小为8)和旋转位置编码(RoPE),原生支持128K上下文。

训练数据以英语为主,重点覆盖STEM、编程和通用知识领域。OpenAI使用了o200k_harmony分词器,它是o4-mini和GPT-4o所用分词器的“超集”。今天,这款分词器也同步开源了。

对开发者来说,gpt-oss两款模型与Responses API天然兼容,专为智能体工作流打造。它能自主判断何时需要复杂推理、何时需要极低延迟输出,并动态调整推理投入。同时它还完全可定制,提供完整的思维链和结构化输出支持。

一个值得注意的经济学数字:整个预训练成本,不到50万美元。

后训练

后训练阶段,流程与o4-mini相似,包含监督微调和高算力强化学习两个阶段。训练过程中,模型以OpenAI模型规范为目标对齐,并学习在生成答案前先进行思维链推理和使用工具。

通过采用与专有o系推理模型相同的技术,gpt-oss在后训练中展现出卓越能力。与API中的o系列推理模型相似,这两款开源模型支持低、中、高三种推理投入,开发者只需在系统提示词中加入一句话,即可在延迟与性能间灵活切换。

开源小模型,比肩旗舰o3/o4-mini

在多个基准测试中,gpt-oss-120b的表现堪称惊艳。在编程竞赛、通用问题解决以及工具调用方面,它直接超越了o3-mini,达到了甚至超越了o4-mini的水平。

即便规模较小的gpt-oss-20b,在相同评估中也与o3-mini持平或更优,在AIME数学测试和健康领域基准上甚至超越了o3-mini。

有趣的是,在AIME数学测试中,随着推理token的增加,两款模型的准确率折线逐渐逼近。这意味着,如果给足时间和计算资源,小模型在某些场景下也能达到大模型的水平——这对边缘部署和设备端AI是个利好信号。

OpenAI近期研究表明,未经直接监督训练的思维链有助于发现模型潜在的不当行为,这一观点也得到了业内同行的认同。研究团队遵循o1-preview的设计原则,并未对gpt-oss的思维链直接监督,这让模型更加透明。

OpenAI,终于Open AI了

gpt-oss-120b和gpt-oss-20b的开源,标志着OpenAI在开源模型领域迈出了极其重要的一步。在同等规模下,它们的推理性能可以与o3-mini、o4-mini一较高下,甚至在部分场景中领先。

这不仅仅是技术层面的突破,更关乎生态。开源模型为所有开发者提供了强大的工具,同时补充了托管模型的生态,加速前沿研究、促进创新。更重要的是,模型开源降低了新兴市场、缺少算力的小企业的准入门槛。

一个健康的开放模型生态系统,是让AI普及并惠及所有人的一个重要维度。奥特曼骄傲地表示,gpt-oss是OpenAI“数十亿美元”研究成果的结晶,是全世界最出色、最实用的开放模型。这个评价,放在今天这个时间节点来看,并不夸张。

来源:https://www.53ai.com/news/OpenSourceLLM/2025080620746.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。