OpenAI 即将开源的大模型又有新料了——这次可不是空xue来风,而是实打实的技术规格被曝了出来。1200亿参数的混合专家架构,搭配128K超长上下文窗口,再加上Float4量化和英伟达Blackwell芯片的加持,整套组合拳相当有意思。下面就把泄露出的几个核心细节捋一捋。
模型架构:1200亿参数的混合专家模型(MoE)
据爆料,OpenAI 这次可能放出两款模型:一款是1200亿(120B)参数的混合专家(MoE)模型,推理时只激活约50–60亿(5B/6B)参数。这就意味着,它既能塞进海量知识,又能把推理效率拉得很高,运行成本自然就降下来了。另一款是200亿(20B)参数的稠密模型,更轻量,部署起来也更灵活。目前来看,这两款都专注于文本处理,暂时不涉及多模态能力。
训练技术:或采用 Float4 与英伟达最新 Blackwell 芯片
为了把效率推到极致,模型很可能用了Float4来做训练或量化。这是一种相当激进的量化方案,能大幅压缩模型体积、提升运算速度。推测是借助英伟达最新发布的 Blackwell 架构 GPU 完成的——毕竟这系列芯片原生支持 Float4 运算。另一种可能是,模型在训练后通过训练后量化(PTQ)技术压缩到 Float4。
激活函数:带范围限制的 SwiGLU
为了配合 Float4 量化,模型可能采用了 SwiGLU 激活函数,并对其输出范围做了裁剪,限制在 **-7 到 7** 之间。这跟经典的 ReLU6 函数思路类似,目的是消除激活值中的极端异常值,让数值分布更稳定,从而减少量化带来的精度损失。对于 Float4 这种低精度格式来说,这一步几乎不可或缺。
上下文窗口:通过 YaRN 技术扩展至 128K
模型支持128K的超长上下文窗口,但并非从头硬训出来的。推测其基础窗口是4K,然后在训练中途用 YaRN 这类技术直接扩展到128K——这种“中途接力”的做法,在业界已经有不少成功先例了。
注意力机制:滑动窗口注意力(SWA)与注意力汇聚(Attention Sinks)
为了高效处理128K的长文本,模型用了两项关键技术:
- 滑动窗口注意力(SWA):窗口大小设为128。每个词元(token)只需要关注它邻近的128个词元,这样计算复杂度就从二次方降到了线性级别。
- 注意力汇聚(Attention Sinks):SWA 的一个先天问题是会遗忘早期的信息,所以模型强制始终关注最开头的几个(比如4或8个)关键 token,保证处理长序列时不会“失忆”。NVIDIA 的 TensorRT-LLM 也已经支持这个功能了。
底层架构:融合 Llama/Mixtral 特点并使用偏置项
基础架构大概率借鉴了 Llama 和 Mixtral 这些成功开源模型的思路。关键特征包括:
- 合并的 QKV 矩阵:把注意力机制里的查询(Q)、键(K)、值(V)矩阵合并在一起,优化计算效率。
- 广泛使用偏置项(Biases):这和 Llama 等去掉偏置项的做法相反,该模型似乎在 MLP、注意力层甚至 MoE 的路由层都保留了偏置项。这很可能有助于提升模型的拟合能力。

