2026-08-25 — views
新方法使压缩的4位模型超越全精度版本
为什么值得读 开发者应关注此方法,因为它能恢复通常在压缩和量化过程中丢失的能力。
一种新的修复技术使压缩后的4位模型在七个基准测试中超越了其全精度原版,恢复了通常因压缩和量化而丢失的能力。
标准压缩的问题
使大型语言模型变小几乎总是伴随着代价。标准做法涉及通过移除层、头或神经元来压缩架构,然后将权重量化为4位。虽然这两个步骤都节省了资源,但它们系统地降低了推理和代码生成等能力。因此,部署流程在生产前添加了一个称为“修复”的恢复步骤。
现有方法为何失败
大多数效率流程依赖于量化感知训练(QAT)或量化感知蒸馏(QAD)。QAT通过嘈杂的前向传递重新运行昂贵的后训练过程,这可能不稳定。QAD通过从冻结的全精度教师进行蒸馏来避免此问题。然而,一旦模型经过结构压缩,原始全精度版本不再作为精确匹配存在。唯一可用的教师是恢复的检查点,它充当退化的目标并限制了学生的准确率。
介绍量化感知修复
新方法“量化感知修复”(QAH)通过直接从原始预压缩模型而非恢复的模型进行蒸馏来打破这一上限。教师是全尺寸且全精度的,而学生是以MXFP4运行的半大小模型。由于教师的输出分布与架构无关,不匹配不会阻止知识转移。在QAH下,量化成为针对原始教师的第二次蒸馏过程,提供了bfloat16检查点从未获得的监督。
基准测试结果
团队将QAH应用于压缩至60B参数并量化为MXFP4的GPT-OSS 120B模型。所得的4位模型在九个基准测试中的七个上超越了其自身的全精度版本。它更小、运行成本更低,且比其量化的检查点更准确。
与QAT的比较
在与使用GPT-OSS 9B模型的QAT进行头对头比较中,两种方法达到了相似的峰值准确率。然而,QAH在约100步达到峰值,比QAT的700步快约七倍。此外,QAH在达到峰值后保持稳定,而QAT一旦超过最佳点就会急剧崩溃。
实务笔记
开发者应考虑使用这种蒸馏策略,以避免与将模型无限推向硬标签的交叉熵目标相关的稳定性风险。通过将学生锚定到固定的教师分布上,团队可以安全地提供服务检查点,而无需担心随时间的退化。
来源
- Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original ↗