游乐游手机版
首页/AI热点日报/热点详情

OpenAI开源模型泄露六大技术细节详解

类型:热点整理2026-07-20
OpenAI开源模型泄露,采用1200亿参数混合专家架构,推理时仅激活约50亿参数。支持128K上下文窗口,通过YaRN技术扩展。使用Float4量化与英伟达Blackwell芯片,配合SwiGLU激活函数及滑动窗口注意力机制,融合Llama与Mixtral特点。

OpenAI 即将开源的大模型又有新料了——这次可不是空xue来风,而是实打实的技术规格被曝了出来。1200亿参数的混合专家架构,搭配128K超长上下文窗口,再加上Float4量化和英伟达Blackwell芯片的加持,整套组合拳相当有意思。下面就把泄露出的几个核心细节捋一捋。

模型架构:1200亿参数的混合专家模型(MoE)

据爆料,OpenAI 这次可能放出两款模型:一款是1200亿(120B)参数的混合专家(MoE)模型,推理时只激活约50–60亿(5B/6B)参数。这就意味着,它既能塞进海量知识,又能把推理效率拉得很高,运行成本自然就降下来了。另一款是200亿(20B)参数的稠密模型,更轻量,部署起来也更灵活。目前来看,这两款都专注于文本处理,暂时不涉及多模态能力。

训练技术:或采用 Float4 与英伟达最新 Blackwell 芯片

为了把效率推到极致,模型很可能用了Float4来做训练或量化。这是一种相当激进的量化方案,能大幅压缩模型体积、提升运算速度。推测是借助英伟达最新发布的 Blackwell 架构 GPU 完成的——毕竟这系列芯片原生支持 Float4 运算。另一种可能是,模型在训练后通过训练后量化(PTQ)技术压缩到 Float4。

激活函数:带范围限制的 SwiGLU

为了配合 Float4 量化,模型可能采用了 SwiGLU 激活函数,并对其输出范围做了裁剪,限制在 **-7 到 7** 之间。这跟经典的 ReLU6 函数思路类似,目的是消除激活值中的极端异常值,让数值分布更稳定,从而减少量化带来的精度损失。对于 Float4 这种低精度格式来说,这一步几乎不可或缺。

上下文窗口:通过 YaRN 技术扩展至 128K

模型支持128K的超长上下文窗口,但并非从头硬训出来的。推测其基础窗口是4K,然后在训练中途用 YaRN 这类技术直接扩展到128K——这种“中途接力”的做法,在业界已经有不少成功先例了。

注意力机制:滑动窗口注意力(SWA)与注意力汇聚(Attention Sinks)

为了高效处理128K的长文本,模型用了两项关键技术:

  • 滑动窗口注意力(SWA):窗口大小设为128。每个词元(token)只需要关注它邻近的128个词元,这样计算复杂度就从二次方降到了线性级别。
  • 注意力汇聚(Attention Sinks):SWA 的一个先天问题是会遗忘早期的信息,所以模型强制始终关注最开头的几个(比如4或8个)关键 token,保证处理长序列时不会“失忆”。NVIDIA 的 TensorRT-LLM 也已经支持这个功能了。

底层架构:融合 Llama/Mixtral 特点并使用偏置项

基础架构大概率借鉴了 Llama 和 Mixtral 这些成功开源模型的思路。关键特征包括:

  • 合并的 QKV 矩阵:把注意力机制里的查询(Q)、键(K)、值(V)矩阵合并在一起,优化计算效率。
  • 广泛使用偏置项(Biases):这和 Llama 等去掉偏置项的做法相反,该模型似乎在 MLP、注意力层甚至 MoE 的路由层都保留了偏置项。这很可能有助于提升模型的拟合能力。

OpenAI 开源模型泄露:六大技术细节

来源:https://www.53ai.com/news/OpenSourceLLM/2025080201243.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。