跳到正文
原文
Hugging Face Blog·· 2026-08-25精选AI 评分66

Quantization-Aware Healing:压缩到 4-bit 的模型如何超越其原始全精度版本

Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original

AI 导读

提出 Quantization-Aware Healing(QAH)方法,针对经过结构压缩和量化后的 LLM 进行恢复训练。核心改变是直接从原始全精度模型蒸馏,而非从恢复后的 bf16 检查点蒸馏。

推荐理由

原文给出具体实验数据:4-bit QAH 模型在 7/9 基准上超越 16-bit 源头模型,4 倍权重内存节省。这为压缩模型的恢复训练提供了可迁移的方法思路。

来源:Hugging Face Blog · huggingface.co