2026-08-25 — views
新手法により、圧縮された4ビットモデルがフルプレシジョン版を凌駕
読む理由 開発者は注意すべきです。この手法は、通常、圧縮および量子化の過程で失われる機能を回復します。
新しい修復技術により、圧縮された4ビットモデルが7つのベンチマークでフルプレシジョン元のモデルを上回る。構造圧縮時の能力喪失を回復し、実装前に適用できる。
標準的な圧縮の問題点
大規模言語モデルを小さくする際、ほぼ常にコストがかかります。標準的なレシピでは、アーキテクチャから層やヘッド、ニューロンを削除して圧縮し、次に重みを4ビットに量子化します。両方のステップはリソース節約になりますが、推論やコード生成などの機能を体系的に劣化させます。したがって、デプロイパイプラインは本番運用前に回復ステップである「ヒーリング」を追加します。
既存手法が失敗する理由
多くの効率化パイプラインは、量子化感知トレーニング(QAT)または量子化感知蒸留(QAD)に依存しています。QATは、ノイズの多い順方向パスを通じて高価なトレーニング後のプロセスを再実行します。これは不安定になり得ます。QADは、凍結されたフルプレシジョンの教師から蒸留することでこれを回避します。しかし、モデルが構造圧縮を受けた後、元のフルプレシジョン版は正確な一致として存在しなくなります。利用可能な教師は回復されたチェックポイントであり、これは劣化したターゲットとして作用し、学生の精度を制限します。
量子化感知ヒーリングの導入
新しいアプローチ「Quantization-Aware Healing(QAH)」は、回復されたものではなく元の圧縮前のモデルから直接蒸留することでこの天井を取り除きます。教師はフルサイズでフルプレシジョンであり、学生はMXFP4で動作する半分サイズのものです。教師の出力分布がアーキテクチャ非依存であるため、不一致が知識転送を妨げることはありません。QAHの下では、量子化は元の教師に対する蒸留の2番目のパスとなり、bfloat16チェックポイントが受けることがなかった監督を提供します。
ベンチマークでの結果
チームは、60Bパラメータに圧縮されMXFP4に量子化されたGPT-OSS 120BモデルにQAHを適用しました。得られた4ビットモデルは、9つのベンチマークのうち7つで自身のフルプレシジョン版を上回りました。それは小さく、実行コストが安く、量子化されたチェックポイントよりも正確です。
QATとの比較
GPT-OSS 9Bモデルを使用したQATとの頭脳対決の比較では、両方の手法は同様のピーク精度に達しました。しかし、QAHは約100ステップでピークに達し、QATの700ステップの約7倍速かったです。さらに、QAHはピーク後も安定していますが、QATは最良の点を過ぎると急激に崩壊します。
実装ノート
開発者は、モデルを硬いラベルに無限に向かわせるクロスエントロピー目標に関連する不安定性リスクを回避するために、この蒸留戦略の使用を検討すべきです。学生を固定された教師分布にアンカーすることで、チームは時間の経過による劣化を気にすることなくチェックポイントを安全に提供できます。
ソース
- Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original ↗