Hugging Face Blog·· 2026-08-25精选AI 评分61
Quantization-Aware Healing:4-bit 压缩模型在部分基准上超过原始全精度版本
Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original
AI 导读
Multiverse Computing 提出 Quantization-Aware Healing(QAH),让结构压缩并量化为 MXFP4 的模型直接从压缩前的原始模型蒸馏。
推荐理由
文章以基准数据说明结构压缩后再进行 MXFP4 量化时,直接从原始模型蒸馏的 QAH 可避免恢复上限,并在长上下文、数学和代码任务上取得收益;结果包含与 QAT 的对比,但对完整训练细节仍需查阅论文。
来源:Hugging Face Blog · huggingface.co