游乐游手机版
首页/科技数码/文章详情

新加坡国立大学研究:AI助手处理长文本能否又快又准

时间:2026-08-18 10:40
新加坡国立大学提出Mix-Quant推理加速框架,针对AI智能体处理长文本时预填充与解码阶段精度需求不同的特点,预填充采用低精度FP4加速,解码保持高精度BF16,实现约3倍预填充加速且几乎不损失精度,有效平衡速度与准确性。

新加坡国立大学的一支研究团队最近提出了一项值得关注的新成果——他们设计了一种名为Mix-Quant的推理加速框架,专门解决AI智能体在处理长文本、复杂上下文和多步骤任务时“速度慢、误差容易累积”的关键问题。相关论文已以预印本形式发布在arXiv,编号为2605.20315,发布时间是2026年5月。通俗来说,这项研究的核心观点是:AI在“阅读输入内容”和“生成最终答案”这两个推理阶段,对计算精度的需求并不相同,因此不应该采用完全一致的量化策略。

速度与精度的两难困境

设想一下,当你让AI助手去搜索网页、调用外部工具、翻查历史记录、编写代码并自动调试时,它在后台其实一直在反复执行“读内容、做推理、写输出”这套流程。每推进一步,AI都需要把此前的对话上下文、工具返回结果以及中间推理痕迹重新处理一遍,然后才能决定下一步操作。

这意味着一个非常现实的问题:AI每次推理前需要读取的内容,通常远远大于它最后真正输出的内容。实验数据已经说明了这一点——在软件工程任务场景中,AI平均需要读入约22.8万个词,而最终输出仅约3.9万个词,输入规模接近输出的6倍。另一个涉及长期记忆管理的任务里,这个比例甚至达到36倍——AI需要读取11万个词,却只生成3000个词。可以把它理解为:厨师每做一道菜前,都得先把整本菜谱从头到尾重新翻一遍,才能决定下一步该放什么调料。

在大模型推理领域,处理这些海量输入文本的阶段被称为“预填充”(prefilling),而随后逐词生成回答的阶段则叫“解码”(decoding)。预填充阶段更像工厂中高速并行的流水线——可以同时处理整段输入文本,但计算负载极大;解码阶段则更像精细的手工作业——每次只生成一个词,速度相对较慢,但每一步都要求足够稳定和精确。

为了提升大模型推理速度,工程实践里常用的一种优化方法叫“量化”(quantization)。你可以把它理解成把高清图片压缩成较低分辨率,以减少存储和计算成本——原本用高精度浮点数表示的参数或激活值,被转换为更低精度的数字格式,从而降低算力消耗、提升推理吞吐。目前较激进的一类量化方案是FP4,也就是只用4个二进制位表示一个数字,而常规场景通常需要16位甚至32位。

但难点也恰恰在这里:如果把整个AI推理过程都统一切换到FP4这样的低精度模式,虽然推理速度会明显提升,但生成质量往往会同步下滑。就像把菜谱印成模糊的低清版本,厨师在浏览标题和配料表时也许还能勉强识别“盐”和“糖”,可一旦进入需要精确判断“到底放多少克”的步骤,就容易出错,而且错误还可能层层放大,导致最终结果偏离预期。

这正是研究团队面对的核心难题:AI智能体需要高效处理超长输入,但现有加速方式又容易损伤推理质量。Mix-Quant的重要贡献就在于,它找到了一条兼顾大模型推理加速与输出精度的路径——不是对整个推理流程一刀切地量化,而是针对不同阶段采用差异化策略。

一、读文章时可以“马虎”,但写答案时必须“认真”

研究团队发现了一个非常关键的不对称性:AI在读文章、理解上下文的预填充阶段,与它在生成答案、执行任务的解码阶段,对精度误差的敏感程度并不一致。

在预填充阶段,AI主要是在把输入文本统一“读完”和“编码”,并将这些理解结果存入所谓的“KV缓存”(Key-Value Cache)这个临时记忆结构中。这个阶段有几个重要特点。首先,输入文本本身是固定不变的,不会因为模型内部产生了一些数值误差就发生变化——即便AI在阅读时存在轻微理解偏差,原始文本依然在那里,不会被改写。其次,长文本天然存在大量冗余。研究团队做了一项分析:对于一段12.8万词的长文本,他们统计了模型在生成答案时注意力(attention)真正聚焦的位置。结果显示,排名前4096个最关键的词语,仅占全部文本的3.125%,却平均承载了95.8%的注意力权重。换句话说,真正影响最终答案的往往只是少量关键信息,绝大多数文本内容对最终结果的贡献相对有限。因此,预填充阶段即便出现一些量化误差,这些误差也大概率落在不那么重要的位置,对整体理解和最终回答的影响通常较小。

而解码阶段则完全不同。AI每生成一个词,都会依赖原始输入以及之前已经生成的所有内容。这是一个前后强依赖的链式过程——任何一步出现偏差,后续步骤都可能被带偏。研究中用公式描述了这一点:任意时刻t生成的词y_t,依赖于输入x和此前生成的y₁到y_{t-1}。如果某一步因为低精度量化导致AI把“调用搜索工具”误写成了无效指令,那么之后的工具调用、状态更新乃至整条推理链都可能基于这个错误继续展开,错误会像滚雪球一样不断积累。学术上通常把这种现象称为“雪球效应”——一个很小的起始偏差,可能在长序列生成中被持续放大。对于需要多轮思考和多步执行的AI Agent任务,这种影响尤其明显:写代码时一个变量名错了,可能导致整段程序无法运行;调用外部API时参数格式稍有问题,就可能导致调用失败;多轮对话中一处状态判断错误,也会影响后续所有决策。

正是基于对这两个阶段差异的认识,研究团队提出了Mix-Quant的核心方案:在预填充阶段使用激进的低精度量化(FP4)以获得更高的推理速度,而在解码阶段则保留高精度BF16,确保生成质量和任务稳定性。BF16是一种精度远高于FP4的数字表示方式,也是当前深度学习和大模型推理中极为常见的标准精度之一。这就像一位翻译人员,在快速浏览几十页原始资料时可以先粗读提纲,但到了正式撰写关键译文时,必须字斟句酌、尽量避免偏差。

二、Mix-Quant究竟是怎么工作的

Mix-Quant采用的量化格式叫NVFP4,这是英伟达(NVIDIA)专门面向其新一代Blackwell系列GPU显卡(如RTX 5090和B200)设计的一种低精度数值格式。传统低精度量化往往只是简单地把数字直接“四舍五入”到最接近的低精度表示,而NVFP4在设计上更精细,它引入了两级缩放机制,以尽量减少量化误差。

可以用一个更直观的比喻来理解这一机制:假设你要把一幅高清画作压缩成低分辨率版本。最粗糙的办法,是直接把整张图统一降采样,结果往往会整体模糊。而NVFP4更像是先把整幅图拆分成许多由16个像素组成的小区块,对每个区块分别做局部对比度调整(即“局部缩放”,用FP8 E4M3格式表示),再对整张图做一次统一的亮度校准(即“全局缩放”)。通过局部与全局两层调整,图像虽然整体精度下降了,但关键区域的细节保留会更好。

从数学表达上看,NVFP4对每个数值xᵢ的量化过程是:先结合全局缩放因子α_g和局部缩放因子σ_b(i)对xᵢ做归一化,再将归一化结果映射到最接近的FP4可表示值;在反量化时,再把两个缩放因子乘回去,以恢复其近似值。局部缩放因子σ_b通常由该区块中绝对值最大的元素决定,从而保证区块内最大值可以被更准确地表达。研究团队进一步发现,由于NVFP4本身的表示机制已经足够细致,直接采用最简单的“就近取整”(RTN)量化策略,就能够获得很不错的效果,无需额外复杂的量化校准算法。这一点对于实际部署很重要,因为它降低了工程门槛,也减少了额外运行开销。

在系统设计层面,Mix-Quant采用的是“预填充-解码分离部署”的架构。具体来说,输入文本的预填充处理由专门的“预填充工作节点”承担,这些节点运行的是FP4量化版本模型,因此吞吐更高、速度更快;当预填充完成后,生成的KV缓存会通过一种名为NIXL的高速传输机制,发送给专门负责输出生成的“解码工作节点”,而这些解码节点上的模型仍然保留BF16高精度。这样一来,解码节点就可以在高精度模式下稳定地逐词生成答案。两套工作节点分工明确、协同运行,也避免了在同一个模型内部频繁切换精度格式,从而减少了精度转换带来的额外开销和潜在数值对齐问题。

三、实验验证:到底快了多少,准了多少

为了评估Mix-Quant在大模型推理加速中的实际表现,研究团队在NVIDIA RTX 5090和B200显卡上,基于主流推理框架vLLM进行了系统测试。测试对象包括多款当前表现突出的开源智能体模型:Qwen3-8B、Qwen3.5-9B、Gemma-4-26B-A4B-it以及Gemma-4-31B-it。每个模型都分别测试了三种运行模式:原始BF16高精度版本、全程FP4低精度版本(也就是“均匀NVFP4”方案),以及Mix-Quant混合量化方案。

在推理速度方面,实验结果相当突出。以Qwen3-8B为例,在单请求、不同输入长度的测试中,Mix-Quant在预填充阶段相较于原始BF16模型实现了2.21倍(2000词输入)到3.51倍(32000词输入)的加速。输入越长,收益越明显,这与AI智能体处理长上下文、长文档和多轮任务的实际需求高度一致。在多请求并发处理的批量推理场景中,当批量大小从1提升到32时,加速比也稳定保持在2.15倍到3.74倍之间。整体而言,Mix-Quant在预填充阶段平均实现了约3倍的大模型推理加速效果。

在准确率和任务效果方面,研究团队使用了多个代表性测试基准进行验证。BFCL v4用于评估AI的工具调用和函数调用能力,LongMemEval用于测试AI在长期多轮对话中的记忆管理与历史检索能力,τ-bench关注AI作为通用助手在复杂状态对话任务中的表现,LongBench-V2和AA-LCR则用于衡量模型在长文档理解、综合分析与长文本推理方面的能力。此外,研究还纳入了数学推理基准MATH500、AIME24和AIME25,以评估模型在高精度逻辑推理场景下的表现。

以Qwen3-8B为例,原始BF16模型在五个智能体任务基准上的综合平均分为42.85分。如果改成全程FP4量化,平均分会明显下滑到38.64分,性能损失大约在10%左右。而采用Mix-Quant之后,平均分恢复到了41.45分,基本追回了绝大部分损失。尤其是在考察长期记忆能力的LongMemEval测试中,全程FP4量化使得分数从57.00大幅降到49.82,而Mix-Quant又把成绩拉回到了54.85,恢复效果非常明显。对于规模更大的Gemma-4-31B-it模型,结果更具有说服力:BF16基线是77.63分,全程FP4为76.21分,而Mix-Quant达到77.14分,几乎与原始高精度模型持平。这说明在更大模型上,仅对预填充阶段进行量化,带来的质量损失已经非常有限。

在数学推理任务中,Mix-Quant同样展现出稳定优势。以Qwen3.5-9B为例,BF16版本在AIME24和AIME25上的成绩分别是68.89和60.00,全程FP4量化后下降到54.44和40.00,性能损失相当明显。而Mix-Quant则恢复到了70.33和56.67,整体上已经非常接近原始水平。对Gemma-4-26B-A4B-it而言,Mix-Quant在五项测试中的综合平均分是71.93,而BF16基线为71.94,几乎完全一致;相比之下,全程FP4只有66.31。由此可见,Mix-Quant在长文本理解、工具调用、数学推理以及AI Agent任务等多类场景下,都体现出了很好的速度与精度平衡能力。

四、分阶段消融实验:进一步验证哪个阶段更敏感

为了更准确地验证“解码阶段比预填充阶段对量化更敏感”这一关键假设,研究团队还专门设计了一组消融实验。他们对多种量化组合进行了横向对比,包括:全程BF16(完全不量化)、全程NVFP4(全流程低精度量化)、Mix-Quant(只量化预填充阶段,解码保持BF16),以及一个反向对照方案P16D4(预填充保持BF16,只量化解码阶段)。

实验结果清楚支持了研究团队的理论判断。以Qwen3-8B为例,全程BF16的综合平均分为40.42,全程NVFP4下降到33.59,整体下滑6.83分;P16D4,也就是只量化解码阶段时,平均分为36.74,下降3.68分;而Mix-Quant,也就是只量化预填充阶段时,平均分为38.32,仅下降2.10分。可以很直观地看到,两种“只量化一半”的方案都优于“全流程量化”,但只量化解码阶段造成的损失明显更大。这直接说明:解码阶段确实对量化误差更敏感,把高精度保留给解码过程是更合理也更有效的推理优化策略。对于Gemma-4-26B-A4B-it,这一规律同样成立——P16D4的平均分是59.85,Mix-Quant则达到60.18,虽然差距不算很大,但Mix-Quant仍然表现更优。

当然,研究团队也坦诚指出,Mix-Quant并不是绝对无损的完美方案。因为预填充阶段的量化误差仍然可能影响KV缓存精度,而KV缓存又会继续参与后续解码,因此这种误差会对最终输出产生一定间接影响。也就是说,Mix-Quant在部分任务基准上与原始BF16模型之间仍会保留一些差距。不过,考虑到它能够带来约3倍的预填充加速,对于大多数真实的大模型部署场景和AI应用系统而言,这样的精度损耗通常是可以接受的。

说到底,这项研究告诉了我们什么

归根结底,Mix-Quant提出了一个看似简单、但很有工程价值的原则:同一个大语言模型在不同推理阶段,对精确度的需求并不相同,因此计算资源的分配也不应一刀切,而应该根据阶段特性进行差异化优化。

这一点对于正在快速普及的AI助手、AI Agent和长文本处理应用尤其重要。未来,当你使用AI去整理上百页文档、管理复杂项目流程,或者让它自动联网搜索、整合资料并输出报告时,底层推理系统可以更高效地工作——面对海量输入时优先追求吞吐和速度,在生成最终回答时则优先确保质量和稳定性。这意味着同样的GPU硬件资源能够服务更多用户,系统响应速度会更快,整体部署成本也会更低。

这项研究还进一步揭示了一个更宏观的方向:AI推理优化不应只关注单一维度,比如单纯追求低比特量化、单纯压缩模型,或者单独提升吞吐,而应基于对不同计算阶段本质特征的理解,针对性设计更合适的系统策略。Mix-Quant只是这一方向上的一个起点,未来它完全可以和其他推理加速技术结合使用,比如稀疏注意力机制(让模型只关注文本中真正关键的部分)以及KV缓存压缩技术,从而进一步降低长上下文推理和长文本处理的成本。

还有一个很值得继续探索的问题是:目前Mix-Quant在预填充阶段统一采用FP4精度,但实际上即便在预填充内部,不同网络层、不同注意力头、不同模块对量化误差的敏感程度也可能存在差异。未来是否可以进一步演化为“按层量化”甚至“按注意力头量化”的更细粒度策略,在推理速度、显存占用和输出质量之间找到更精确的平衡?这很可能会成为后续研究的重要方向。

如果你对这项大模型量化、推理加速和AI智能体优化技术感兴趣,可以通过arXiv编号2605.20315查阅完整论文。研究代码也已经开源,相关开发者和技术团队可以在此基础上继续测试、复现与扩展。

Q&A

Q1:Mix-Quant只量化预填充阶段,不量化解码阶段,这样是不是意味着解码速度没有改善?

A:是的,Mix-Quant的性能提升主要集中在预填充阶段,解码阶段依然保持BF16高精度运行,因此解码速度基本与原始模型一致。不过在很多AI智能体和长文本推理任务中,输入文本规模通常远大于输出文本,有时比例甚至可达36:1,所以真正的主要瓶颈往往就在预填充阶段。只要把预填充加速起来,整体推理时延就能得到非常明显的改善。如果业务场景还需要进一步提升解码速度,也可以叠加其他专门针对解码阶段的优化技术。

Q2:NVFP4只有Blackwell系列显卡才支持吗,其他GPU能用Mix-Quant的思路吗?

A:Mix-Quant的核心思想——即“预填充低精度量化、解码保持高精度”——本质上是与具体硬件无关的通用推理优化框架,理论上可以结合多种低精度格式来实现。NVFP4目前确实是英伟达Blackwell系列GPU(如RTX 5090、B200)上的专属格式,因此在这些显卡上能获得最理想的硬件加速收益。但在其他GPU平台上,也可以尝试使用INT4、FP8等低精度量化格式来实现类似的相位感知量化思路,只是最终的推理加速效果和精度表现会因硬件与实现方式而有所不同。

Q3:Mix-Quant适用于所有大语言模型吗,还是只对特定模型有效?

A:从论文给出的实验结果来看,Mix-Quant在Qwen3-8B、Qwen3.5-9B、Gemma-4-26B和Gemma-4-31B这四个架构和规模各不相同的模型上都表现出了较一致的效果,说明这一方法具备不错的通用性。通常来说,只要模型所在应用场景存在明显的预填充瓶颈,也就是输入文本显著多于输出文本,那么Mix-Quant这种分阶段量化策略就有较大机会发挥价值。一般情况下,模型规模越大,对量化误差的鲁棒性往往也越强,因此在更大参数规模模型上,精度保留和推理加速表现通常还会更理想。

来源:https://www.163.com/dy/article/KU23TSLA0511DTVV.html
上一篇微软下周发布全新编程模型争取开发者认可 下一篇AI加速走向物理世界,BEYOND Expo 2026正式开幕
本站内容用于信息整理与展示,如有侵权或内容问题请及时联系处理。

相关推荐

补充同频道和同主题内容,方便继续浏览更多相关内容。

同类最新

继续查看同栏目最近更新的文章。

更多
2026中国航空产业大会10月底南昌启幕:首次与航博会同期举办,聚焦低空经济新路径
科技数码 · 2026-08-31

2026中国航空产业大会10月底南昌启幕:首次与航博会同期举办,聚焦低空经济新路径

2026中国航空产业大会与南昌航空产业博览会将于10月31日至11月4日在南昌国际博览城首次同期举办。大会聚焦低空经济,设置主旨报告、行业专家报告及低空产业洽谈会等主题活动,旨在探讨航空产业新路径,推动低空物流、城市巡检等新业态集聚,打造中部领先、全国知名的航空产业交流高地。

联想来酷Air 16酷睿5 315版开售:国补后3739元,16英寸轻薄本选购指南
科技数码 · 2026-08-28

联想来酷Air 16酷睿5 315版开售:国补后3739元,16英寸轻薄本选购指南

联想来酷Air 16酷睿5 315版于8月27日正式开售,搭载6核处理器与12GB内存,配备16英寸16:10屏幕。叠加国家补贴后预估到手价仅3739 15元,主打长续航与静音办公。本文详细解析其硬件配置、接口布局及购买建议,助您快速决策。

牛来AirPods保护套海外走红:萌趣硅胶设计引发关注
科技数码 · 2026-08-28

牛来AirPods保护套海外走红:萌趣硅胶设计引发关注

一款名为“牛来”的AirPods硅胶保护套在日本市场引发关注,售价约1726日元。其独特的搞怪萌趣造型、兼容多代机型的硅胶材质以及专属挂饰设计,使其在社交平台上迅速走红,成为近期备受瞩目的国产原创数码周边产品。

行李箱选购全攻略:材质、轮子与尺寸避坑指南
科技数码 · 2026-08-28

行李箱选购全攻略:材质、轮子与尺寸避坑指南

选购行李箱时,材质、轮子和尺寸是核心决策点。PP材质抗冲击且轻便,适合频繁托运;万向轮决定推行顺滑度;尺寸需匹配航空限重。本文拆解关键参数,结合具体产品案例,助您选出耐用且实用的行李箱。

《湮灭之潮》成都试玩会:技嘉RTX 5080风魔显卡实测体验
科技数码 · 2026-08-28

《湮灭之潮》成都试玩会:技嘉RTX 5080风魔显卡实测体验

2026年8月《湮灭之潮》成都试玩会圆满举行,千名玩家现场体验西方奇幻大作。文章重点解析技嘉RTX 5080风魔显卡在虚幻5引擎下的表现,涵盖Blackwell架构、DLSS 4 5技术及16GB GDDR7显存对高画质流畅运行的支撑作用。