2026-08-25 — views
新方法讓壓縮後的 4 位模型擊敗全精度版本
為什麼值得讀 開發者應關注此方法,因為它能恢復在壓縮和量化過程中通常會丟失的功能。
一種新的修復技術使壓縮後的 4 位模型在七項基準測試中勝過其全精度原始版,恢復了量化過程中通常會喪失的能力。
標準壓縮的問題
使大型語言模型變小幾乎總是有代價的。標準做法涉及通過移除層、頭或神經元來壓縮架構,然後將權重量化為 4 位。雖然這兩個步驟都能節省資源,但它們會系統性地損害推理和程式碼生成等能力。因此,部署流程會在生產前添加一個稱為修復的恢復步驟。
為什麼現有方法失敗
大多數效率流程依賴於感知量化訓練 (QAT) 或感知量化蒸餾 (QAD)。QAT 通過噪聲前向傳播重新運行昂貴的後訓練過程,這可能是不穩定的。QAD 通過從凍結的全精度教師進行蒸餾來避免此問題。然而,一旦模型經歷結構壓縮,原始全精度版本就不再作為精確匹配存在。唯一可用的教師是恢復的檢查點,它作為一個退化的目標,限制了學生的準確性。
引入感知量化修復
新方法「感知量化修復 (QAH)」通過直接從原始、壓縮前的模型進行蒸餾來消除這一限制,而不是從恢復的版本進行。教師是全尺寸且全精度的,而學生是半大小且在 MXFP4 下運行。由於教師的輸出分佈與架構無關,不匹配不會阻止知識轉移。在 QAH 下,量化成為針對原始教師的第二輪蒸餾,提供了 bfloat16 檢查點從未獲得的監督。
基準測試結果
團隊將 QAH 應用於壓縮至 60B 參數並量化為 MXFP4 的 GPT-OSS 120B 模型。所得的 4 位模型在九項基準中的七項上擊敗了其自身的全精度版本。它體積更小、運行成本更低,且準確度高於其量化的檢查點。
與 QAT 的比較
在使用 GPT-OSS 9B 模型的頭對頭比較中,兩種方法達到了相似的峰值準確度。然而,QAH 在約 100 步達到峰值,比 QAT 的 700 步快約七倍。此外,QAH 在達到峰值後保持穩定,而 QAT 一旦超過最佳點就會急劇崩潰。
實戰筆記
開發者應考慮使用這種蒸餾策略,以避免與將模型無限期推向硬標籤的交叉熵目標相關的不穩定風險。通過將學生錨定在固定的教師分佈上,團隊可以安全地提供檢查點,而不必擔心隨時間推移的退化。
來源
- Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original ↗