跳到正文
Hugging Face Blog·· 2025-12-11精选AI 评分77

llama.cpp 推出模型管理功能:引入路由模式支持动态切换多模型

New in llama.cpp: Model Management

AI 导读

llama.cpp server 正式推出路由模式(router mode),允许用户在无需重启服务的情况下动态加载、卸载和切换多个模型。该功能采用多进程架构隔离单模型崩溃风险,支持自动扫描本地缓存或 GGUF 目录,并按首次请求按需加载与 LRU 策略淘汰(默认最多同时加载 4 个模型)。服务提供 OpenAI 兼容的请求路由与手动加载卸载 API,内置 Web UI 也已支持下拉切换模型。

推荐理由

原文介绍了本地部署无需重启即可动态调度多模型的架构机制,读者可以据此改进本地多模型测试与服务流程。

来源:Hugging Face Blog · huggingface.co