Hugging Face Blog·· 2024-07-22精选AI 评分69
如何通过 Core ML 在 Mac 本地运行 Mistral 7B
WWDC 24: Running Mistral 7B with Core ML
AI 导读
Hugging Face 发布利用 WWDC24 新特性在 Mac 上通过 Core ML 运行 Mistral 7B 的完整教程。方案结合有状态缓冲区管理 KV cache 与 4-bit 块量化,将模型体积由 14GB 压缩至约 3.8GB,实现使用低于 4GB 内存本地运行。
推荐理由
原文详细演示了利用状态化缓存与 4-bit 量化将大模型转换为 Core ML 的完整流程,为在苹果生态端侧部署提供了实用参考。
来源:Hugging Face Blog · huggingface.co