OpenAI深夜发布重磅消息,正式开源了两款高性能推理模型——gpt-oss-120b和gpt-oss-20b。这两款模型不仅能在笔记本和手机上流畅运行,性能表现更直逼闭源版本!本文将带你全面了解这两款开源模型的核心参数、实测表现、技术细节以及开源背后的战略考量。
一、核心参数与性能亮点
OpenAI此次开源的这两款模型命名非常直观——gpt-oss,即Open Source Series(开源系列)。它们的核心参数如下:
- gpt-oss-120b:总参数1170亿,采用MoE(混合专家)架构,激活参数约51亿,可在单张80GB GPU上运行,性能接近闭源版本的o4-mini。
- gpt-oss-20b:总参数210亿,同样采用MoE架构,激活参数约36亿,可在16GB内存的消费级设备上运行,性能接近o3-mini。
两款模型均采用Apache 2.0许可证,允许商用无需付费或额外授权,这对广大开发者而言无疑是一个重大利好。
从性能表现来看,gpt-oss系列已经跻身开源模型推理能力的第一梯队,但在代码生成和复杂推理任务中仍略逊于闭源模型(如GPT-o3和o4-mini)。

二、实测展示:断网环境下也能流畅运行
模型发布一小时后,OpenAI官方随即放出了实测效果视频。由负责开发者体验的Dom和Zhaohan在一台120GB的Macbook Pro上进行了测试(借助Ollama运行120B模型,实际背后部署了2块H100)。
1. 工具调用能力测试
他们测试了gpt-oss在思维链中调用工具的能力,包括搜索和Python解释器。开启Browser Tool和Python Tool后,提问:
“旧金山天气如何?”可以看到,本地的gpt-oss-120b稳定地输出了正确结果。
2. 复杂计算与Python工具调用
第二个测试中,他们让两个非常大的数字相乘。gpt-oss反复调用Python工具,虽然中间出现过错误,但最终给出了正确答案。
3. 断网环境下的游戏创作
接下来,二人直接断开网络,在本地创建了一个射击类小游戏,并成功将游戏中的图标改成了草莓样式。整个过程体验流畅,生成速度达到40-50 tokens/s。
完整实测视频如下:
三、预训练与模型架构
OpenAI同时发布了技术博客,详细介绍了这两款模型背后的技术细节。
预训练与后训练
gpt-oss模型采用了OpenAI最先进的预训练和后训练技术进行训练,特别关注推理能力、效率以及在广泛部署环境中的实际可用性。这是自GPT-2以来,OpenAI发布的第一个开放权重语言模型。
模型架构细节
- 每个模型均为Transformer架构,利用专家混合(MoE)减少处理输入所需的活跃参数数量。
- gpt-oss-120b每个token激活5.1B参数,gpt-oss-20b激活3.6B参数,总参数分别为117B和21B。
- 使用类似GPT-3的交替密集和局部带状稀疏注意力模式。
- 采用分组多查询注意力,组大小为8,以提升推理和内存效率。
- 使用旋转位置嵌入(RoPE)进行位置编码,原生支持最长128k的上下文长度。
- 训练数据主要由英语文本组成,重点关注STEM领域、编程和通用知识。
- 分词器基于o200k_harmony超集,今天也同步开源。
四、后训练与推理强度
这些模型采用与o4-mini相似的流程进行了后训练,包括有监督微调阶段和高算力的强化学习阶段。目标是使模型符合OpenAI模型规范,并在生成答案之前学会使用链式思维(CoT)和工具调用。
与API中的o系列推理模型类似,这两个开源模型支持三种推理强度——低、中、高——在延迟与性能之间实现灵活权衡。开发者可以通过系统提示语中的一句话,轻松设定所需的推理强度。
五、评估结果
团队对两个模型进行了标准学术基准测试评估,从编程、竞赛数学、健康问答和Agent工具使用等方面衡量其能力。结果如下:
- gpt-oss-120b:在竞赛编程(Codeforces)、通用问题解决(MMLU和HLE)以及工具调用(TauBench)方面,表现优于OpenAI的o3-mini,并达到或超过o4-mini的水平。在健康相关问答(HealthBench)和竞赛数学(AIME 2024与2025)上,甚至超越了o4-mini。
- gpt-oss-20b:尽管体积较小,在同样的评估中也达到或超过了OpenAI o3-mini的水平,尤其在竞赛数学和健康问答方面表现更加突出。
六、思维链(CoT)与安全性
OpenAI最近的研究表明,监测模型推理过程的链式思维有助于识别不当行为。因此,gpt-oss模型上并未对CoT进行任何形式的直接监督,这为开发者和研究人员提供了自主研究和实现各自CoT监测机制的机会。
重要提醒:开发者不应在其应用中将模型的链式思维内容直接展示给用户,因为这些内容可能包含虚构或有害信息,语言可能不符合OpenAI的安全标准,甚至可能泄露模型被明确指示不得在最终输出中包含的信息。
七、OpenAI为什么要开源?
在技术博客的最后,OpenAI解释了此次开源的意义:
- gpt-oss系列是开源权重模型向前迈出的重要一步,以其体量实现了推理能力和安全性的实质性提升。
- 开源模型是对OpenAI托管模型的重要补充,为开发者提供了更丰富的工具选项,加速前沿研究,推动创新,并支持更安全、透明的AI开发。
- 降低了新兴市场、资源受限行业以及中小型组织进入AI的门槛——这些组织可能缺乏采用专有模型所需的预算或灵活性。
- 开放获取这些在美国开发的高能力模型,有助于推动AI发展走向更加民主化。
一个健康的开源模型生态,是实现AI普及并惠及全人类的重要维度之一。
八、小贴士与常见问题
小提示:
- 在本地部署gpt-oss-20b时,建议使用至少16GB显存的消费级GPU(如RTX 4090)或16GB内存的Mac电脑。
- 如果希望获得最佳推理性能,可尝试使用Ollama、llama.cpp等工具进行量化部署。
- 思考一下:对于需要高精度的数学或代码任务,建议启用高推理强度;对于普通问答,中低强度即可。
常见问题1:gpt-oss模型能运行在手机上吗?
可以。gpt-oss-20b仅有210亿总参数(激活参数约36亿),经过适当的量化(如4-bit)后,可以在最新旗舰手机(如iPhone 15 Pro、Samsung S24 Ultra)的本地运行,但速度可能受限于硬件算力。建议使用专门的推理框架(如MLC-LLM)进行优化。
常见问题2:Apache 2.0许可证具体允许我做什么?
Apache 2.0允许你自由使用、修改、分发该模型,甚至用于商业项目,无需支付任何费用或获得特殊授权。但需注意保留原作者的版权声明,并在修改后的作品中注明改动。
常见问题3:gpt-oss-120b需要什么样的硬件?
gpt-oss-120b总参数1170亿,激活参数约51亿。在8-bit量化下推理需要约60GB显存,建议使用单张80GB GPU(如NVIDIA H100、A100 80GB、AMD MI250等)。如果使用4-bit量化,则可在约30GB显存下运行,但精度会有所下降。
常见问题4:为什么模型没有进行CoT监督对齐?
OpenAI认为,不对CoT进行直接监督可以保留模型推理过程的原始状态,从而让开发者自行监测模型的不当行为、欺骗行为及滥用情况。这有助于构建更安全、更透明的AI系统,但也意味着开发者需要对输出的CoT内容负责审查。
