大陆时间2025年8月6日凌晨,OpenAI悄悄扔出了两颗重磅冲击波——gpt-oss-120b和gpt-oss-20b两款高性能轻量级语言模型,不仅开源,还支持商业应用。这意味着什么?意味着开发者终于可以绕过API付费限制,将媲美顶级闭源模型的能力直接部署到自己的项目里。
先快速过一下这两款模型的核心亮点。它们不是简单的“缩小版GPT”,而是真正为实际应用场景设计的全能选手:
- 智能体能力:原生支持工具调用、Web搜索、Python代码执行和结构化输出,别小看这几项,这基本覆盖了当前AI应用开发90%的功能需求。
- 完整思维链可见:模型的思考过程可以完整获取,调试起来方便得多,对输出结果也能建立更高的信任度。
- 可配置推理深度:支持low/medium/high三档推理效果,按需调整,兼顾效率与质量。
- 可参数微调:细粒度调优不是梦,针对性场景的定制化变得非常灵活。
- Apache 2.0许可:这点很关键——实验、定制、商业部署统统没问题,没有版权限制或专利风险。
简单用Ollama试了试,效果确实不错,不过要说的是,完整功能需要订阅才能解锁。

模型架构
两款模型都是基于Transformer架构,核心思路是用专家混合(MoE)技术来降低计算开销——每个token只激活部分参数,而不是全量计算。具体来看:
| 模型 | 层数 | 总参数 | 每token激活参数 | 总专家数 | 每token激活专家数 | 上下文长度 |
|---|---|---|---|---|---|---|
| gpt-oss-120b | 36 | 117b | 5.1b | 128 | 4 | 128k |
| gpt-oss-20b | 24 | 21b | 3.6b | 32 | 4 | 128k |
训练数据方面,OpenAI使用的是一个高质量、以英文为主的纯文本数据集,重点覆盖了STEM、编程和通用知识领域。值得注意的是,他们用了基于o4-mini和GPT-4o令牌化器超集的o200k_harmony方案,这个令牌化器本身也已经开源,源代码在GitHub上可以找到。
评估
性能表现是衡量模型价值的关键,直接上数据:
| gpt-oss-120b | gpt-oss-20b | OpenAI o3 | OpenAI o34-mini | |
|---|---|---|---|---|
| 推理与知识 | ||||
| MMLU | 90 | 85.3 | 93.4 | 93 |
| GPQA 钻石级 | 80.9 | 74.2 | 77 | 81.4 |
| 人类终极测试 | 19 | 17.3 | 24.9 | 17.7 |
| 竞赛数学 | ||||
| AIME 2024 | 96.6 | 96 | 91.6 | 93.4 |
| AIME 2025 | 97.9 | 98.7 | 88.9 | 92.7 |
一组数据很能说明问题:gpt-oss-120b在竞赛编程(Codeforces)、通用问题解决(MMLU和HLE)以及工具调用(TauBench)方面,已经超越了OpenAI o3-mini,甚至与o4-mini不相上下。更夸张的是,它在健康相关查询(HealthBench)和竞赛数学(AIME 2024/2025)上,比o4-mini表现还更好。即便是规模更小的gpt-oss-20b,也在多个评估中与o3-mini打平甚至超越,尤其在竞赛数学和医疗领域表现突出。

可用性
最让人惊喜的是部署门槛。OpenAI做了原生MXFP4量化,gpt-oss-120b模型可以在80GB内存中运行,而gpt-oss-20b只需要16GB。这意味着什么?120b版本可以直接部署在主流数据中心的高端设备上,面向生产环境;而20b版本几乎可以在任何一台像样的消费级设备上本地推理,快速迭代和实验都不成问题。
在优化方面,OpenAI确实下了功夫。他们与众多主流部署平台达成了合作:
- Hugging Face
- Azure
- vLLM
- Ollama
- llama.cpp
- LM Studio
- AWS
- Fireworks
- Together AI
- Baseten
- Databricks
- Vercel
- Cloudflare
- OpenRouter
硬件方面同样不容忽视——与NVIDIA、AMD、Cerebras和Groq的深度合作,确保了模型在各类系统上都能实现性能优化。看得出来,OpenAI这次是真的希望让这些模型被广泛地用起来。
总结
坦白说,gpt-oss系列并不是OpenAI最先进的模型,但它的意义恰恰在于“汇聚了OpenAI内部前沿的技术理念、模型架构和训练方法”。尤其是强大的智能体能力——工具调用、Web搜索、Python代码执行等,给开发者提供了几乎无限的可能。
两个参数版本各有定位:20b版本只需16GB显存,适合普通消费者和轻量级部署;120b版本需要80GB显存,瞄准的是生产环境和高性能需求场景。
OpenAI这次开源gpt-oss,本质上是在加速前沿研究,促进创新,并且推动在更广泛的应用场景下实现更安全、更透明的AI开发。对于开发者来说,这绝对是一个值得深度研究的起点。
