Hugging Face Blog·· 2026-07-08精选AI 评分70
Hugging Face Transformers 的 vLLM 建模后端实现原生推理性能
Native-speed vLLM transformers modeling backend
AI 导读
Hugging Face 宣布升级 vLLM 中的 Transformers 建模后端,实测吞吐量已达到或超越 vLLM 原生手写实现水平。该后端利用 torch.fx 对模型计算图进行静态分析并结合 AST 重写算子,在运行时动态执行算子融合与并行切分,同时完整兼容 torch.compile 和 CUDA Graphs。
推荐理由
该更新消除了新架构上线时需要为推理引擎单独编写定制优化的工程负担,使同一套模型代码能兼顾训练与生产环境部署。
来源:Hugging Face Blog · huggingface.co