OpenAI 终于向开源社区扔了一枚重磅冲击波——时隔五年,正式发布开源推理模型 gpt-oss。两款型号均采用混合专家(MoE)架构,配合 4 位量化(MXFP4),原生支持 128k 上下文。更关键的是,20b 版本在 16GB 内存的笔记本上就能跑,120b 版本单张 H100 即可搞定。OpenAI 声称这是开源 SOTA,性能直逼 o4-mini,Apache 2.0 许可全面开放。到底有多强?一起来看看实测数据和背后的门道。

模型表现如何?
OpenAI 的目标很明确:让这款开源模型成为同类中的领头羊。从目前披露的数据来看,确实有底气这么说。
在编程竞赛平台 Codeforces(带工具辅助)上,gpt-oss-120b 得分 2622,gpt-oss-20b 得分 2516,双双超越 DeepSeek R1,但略低于 o3 和 o4-mini。而在号称“人类最后的考试”的 Humanity’s Last Exam 中,120b 拿下 19%,20b 拿下 17.3%,虽然不及 o3,但已经超过了 DeepSeek 和通义千问等现有顶尖开源模型。
不过必须警惕的是,这两款模型的幻觉问题比较突出。在 OpenAI 内部的 PersonQA 基准(测试人物知识准确性)上,120b 幻觉率高达 49%,20b 更是达到 53%。相比之下,早期闭源的 o1 模型仅为 16%,最新的小型闭源 o4-mini 也只有 36%。OpenAI 解释这符合预期:小模型知识储备有限,更容易产生幻觉。
另一个值得关注的对比:gpt-oss-120b(激活参数 51 亿)在主要任务上与 Qwen 3(Thinking / Coder)表现相当,但使用的活跃参数少了约 5 倍,而且精度更低——这意味着架构效率确实了得。
详细评估数据:
模型训练
从训练投入来看,gpt-oss-120b 用了 210 万 H100 GPU·小时,而 DeepSeek-R1 用了 266 万 H800 小时(约 14.8 万亿 tokens,671B 参数)。做个粗略的算力反推:如果单块 H100 有效算力按 300 TFLOPS 算,210 万小时对应约 2.268×10^24 次浮点运算。考虑到 120b 模型(MoE 架构,活跃参数 51 亿)加上注意力开销,等效计算量约 60 亿参数级别,那么训练 token 数大致在 6.3 万亿左右。不过 300 TFLOPS 的实测算力可能偏乐观,实际活跃参数更少,token 数可能在 6.3 万亿量级。
训练方法上,这两款模型都用了高计算资源的强化学习(RL),让模型在模拟环境中习得正确推理。这种技术同样用于 OpenAI 的 o 系列模型,因此新模型获得了类似的链式思考(chain-of-thought)能力。OpenAI 特别指出,这些开放模型很适合用作 AI 智能体,可以调用网络搜索、Python 代码执行等工具辅助推理。不过目前仅支持文本,无法处理图像或音频。
写在最后
在 Playground 上实际试了一下,问它能否在笔记本上运行,结果答非所问,效果不太理想。模型具体表现还有待后续更多测试。无论如何,OpenAI 五年来首次开源,且性能确实能打,对社区来说无疑是一大惊喜。
