ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

打破直觉:被“重点保护”的模型部分,为何反成量化突破口?

时间:2026-09-16 01:08:07来源:互联网编辑:快讯

在人工智能模型优化的探索中,一个看似违背直觉的发现正引发广泛关注:被视为量化“禁区”的Gated DeltaNet(GDN)循环结构,在极端量化条件下不仅未崩溃,反而展现出与原始模型相当的性能。这项突破性成果源于对270亿参数模型Qwen3.8-27B的深度改造,研究人员通过将整个模型(包括GDN核心组件)压缩至4-bit精度,创造出体积缩减67%、推理速度提升19%的Minima模型,在多项基准测试中与16-bit版本持平。

传统注意力机制通过存储所有历史token的键值对(KV缓存)实现上下文理解,但这种设计导致显存占用随对话长度线性增长。GDN采用截然不同的策略:用固定大小的状态矩阵概括历史信息,通过“衰减系数×旧状态 + 写入强度×新内容”的更新公式实现信息迭代。这种机制理论上能避免KV缓存膨胀,但社区普遍认为其递归特性会使量化误差持续累积,尤其对控制记忆保留的α门控和写入强度的β门控参数格外谨慎。

研究团队通过系统性实验拆解了这一担忧。首先发现GDN接收的隐藏状态数据与注意力层同样嘈杂,峰值可达普通数值百倍,但NVFP4分块量化格式通过为每16个数值独立计算缩放系数,有效限制了异常值的干扰范围。更关键的是,α和β参数在参与计算前会分别经过softplus和sigmoid函数处理,这些非线性变换将输入误差压缩了80%以上,形成天然的误差屏障。

在递归误差累积的验证中,研究人员设计了“锁步实验”:用32000个token的输入测试不同扰动下的状态偏差。结果显示,初始误差在后续步骤中既未放大也未衰减,始终稳定在12%左右。当人为注入1%的脉冲干扰后,误差在数千步内衰减至原始值的十分之一,远快于理论衰减速度。这归功于GDN的覆盖式写入机制——新信息会直接替换状态矩阵中对应方向的旧值,而非简单叠加,这种设计使误差被持续更新的内容主动清除。

端到端评估进一步证实量化优势:在32000 token的长文本处理中,Minima的困惑度损失从初始段的0.081 nats/token降至末段的0.011,最终2000个token的表现甚至超越原始模型。在MMLU-Pro知识测试、AIME数学竞赛等六项基准中,量化模型与原始版本的平均分差距不足0.82分,完全处于统计误差范围内。特别在AIME竞赛题中,Minima在四个随机种子测试中全部答对26题,实现完美复现。

工程实现中,研究团队解决了三个关键挑战:针对服务框架融合运算导致的缩放系数不匹配问题,通过强制同步局部缩放参数消除误差;统一采用纯文本路径编码避免多模态模块的干扰;修正评测工具的问题指令传递机制,确保测试结果可靠性。对于仍需KV缓存的传统注意力层,研究人员发现将其压缩至FP8精度可扩大1.8倍缓存容量,配合静态缩放系数校准后,困惑度损失从0.41降至0.07,且不增加推理延迟。

这项研究揭示了模型架构设计与量化鲁棒性的深层关联:GDN的抗噪能力源于其数学形式中内置的误差抑制机制,而非依赖额外训练。同期另一团队采用量化感知训练虽也实现4-bit压缩,但需要原始模型作为教师进行蒸馏,而Minima仅通过训练后校准即达到同等效果。不过研究人员指出,这种特性高度依赖于α和β的对数空间参数化设计,线性参数化的门控结构可能失去类似保护,为后续混合架构量化研究指明了方向。

更多热门内容