2026-08-25 — views
새로운 방법론으로 압축된 4비트 모델이 정밀 버전보다 성능을 앞당김
읽어야 하는 이유 개발자들은 이 방법이 양자화 및 압축 과정에서 일반적으로 손실되는 기능을 복구하기 때문에 관심을 가져야 합니다.
새로운 치유 기법으로 압축된 4비트 모델이 7 가지 벤치마크에서 정밀도 원본을 능가합니다. 구조적 압축 후 잃어버린 능력을 회복하여 배포 파이프라인의 치유 단계를 대체할 수 있습니다.
표준 압축의 문제점
대규모 언어 모델을 작게 만드는 것은 거의 항상 비용이 따릅니다. 표준 레시피는 레이어, 헤드 또는 뉴런을 제거하여 아키텍처를 압축한 다음 가중치를 4 비트로 양자화하는 것을 포함합니다. 두 단계 모두 자원을 절약하지만 추론 및 코드 생성과 같은 능력을 체계적으로 저하시킵니다. 따라서 배포 파이프라인은 프로덕션 전에 치유라는 복구 단계를 추가합니다.
기존 방법의 실패 이유
대부분의 효율성 파이프라인은 양자화 인식 훈련 (QAT) 또는 양자화 인식 지식 distillation (QAD) 에 의존합니다. QAT 는 노이즈가 있는 순방향 통과를 통해 비용이 많이 드는 사전 훈련 과정을 다시 실행합니다. 이는 불안정할 수 있습니다. QAD 는 동결된 정밀도 교사를 통한 distillation 을 통해 이를 피합니다. 그러나 모델이 구조적 압축을 거치면 원래의 정밀도 버전은 더 이상 정확한 매칭으로 존재하지 않습니다. 유일한可用的 교사 (teacher) 는 복구된 체크포인트로, 이는 열화된 타겟으로 작용하여 학생의 정확도를 제한합니다.
양자화 인식 치유 소개
새로운 접근 방식인 양자화 인식 치유 (QAH) 는 복구된 모델이 아닌 원래 압축 전 모델에서 직접 distillation 을 수행함으로써 이 한계를 제거합니다. 교사는 전체 크기와 정밀도를 가지며, 학생은 MXFP4 에서 실행되는 절반 크기입니다. 교사의 출력 분포가 아키텍처에 무관하므로 불일치가 지식 이전을 방해하지 않습니다. QAH 하에서 양자화는 원래 교사에게 제공되지 않았던 감독을 제공하는 distillation 의 두 번째 패스로 작용합니다.
벤치마크 결과
팀은 GPT-OSS 120B 모델을 60B 파라미터로 압축하고 MXFP4 로 양자화한 모델에 QAH 를 적용했습니다. 결과적으로 4 비트 모델은 9 개 벤치마크 중 7 개에서 자신의 정밀도 버전보다 뛰어납니다. 이는 양자화된 체크포인트보다 작고 실행 비용이 적으며 정확도가 더 높습니다.
QAT 와 비교
GPT-OSS 9B 모델을 사용한 QAT 와의 직접 비교에서 두 방법은 유사한 최고 정확도에 도달했습니다. 그러나 QAH 는 약 100 단계에서 최고점에 도달하여 QAT 의 700 단계보다 약 7 배 빠릅니다. 또한 QAH 는 최고점 이후에도 안정적으로 유지되는 반면, QAT 는 최고점을 지나면 급격히 붕괴됩니다.
실무자 노트
개발자들은 교차 엔트로피 목표가 모델을 무한히 고정된 레이블로 밀어붙이는 것과 관련된 불안정성 위험을 피하기 위해 이 distillation 전략을 고려해야 합니다. 학생을 고정된 교사 분포에 앵커링함으로써 팀은 시간이 지남에 따른 열화를 걱정하지 않고 체크포인트를 안전하게 제공할 수 있습니다.
출처
- Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original ↗