Hugging Face Blog·· 2024-09-18精选AI 评分71
Hugging Face 探索大语言模型 1.58bit 极端量化微调方法
Fine-tuning LLMs to 1.58bit: extreme quantization made easy
AI 导读
Hugging Face 提出了一种将现有预训练大语言模型微调至 1.58bit 三值权重的方法,并在 Llama3 8B 上完成了实验验证与开源。研究通过引入动态 lambda 调度机制实现渐进式量化,有效缓解了直接转为三值权重导致的先验知识丢失问题,微调后的模型在 MMLU 等基准上超过了 Llama 1 7B。
推荐理由
针对三值权重通常需从头预训练的高门槛,文章给出了动态调度的渐进量化微调方案与算子实现,可为低精度模型改造提供参考。
来源:Hugging Face Blog · huggingface.co