跳到正文
10月2日周五
  1. NVIDIA Blog79

    NVIDIA GPU 如何加速 OpenAI 的 GPT-6 Astra Ultrafast

    OpenAI 的 GPT-6 Astra Ultrafast 正式在 API 以及符合条件的 ChatGPT Work 和 Codex 中上线,基于 NVIDIA Blackwell GPU 运行。该模式相比 Astra Standard 的 token 生成速度最高提升 8 倍,显著缩短了编码智能体在编辑、测试与调试循环以及工具调用之间的响应等待时间。

    推荐理由:文章介绍了基于硬件架构的推理优化细节,有助于读者评估生成加速对编码智能体与工具调用延迟的具体影响。

9月24日周四
  1. Hugging Face Blog45

    用 LFM2.5-VL-DSpark 加速视觉语言模型推理

    Liquid AI 发布用于视觉语言模型 LFM2.5-VL-3B 的投机解码草稿模型 LFM2.5-VL-DSpark。该模型仅增加 280M 参数(8.9%),在保持输出质量的同时,使端侧解码速度最高提升 3.13x(端到端提升 2.62x),H100 解码最高加速 2.66x。模型开源权重已在 Hugging Face 发布,首日支持 llama.cpp、MLX-VLM 与 SGLang。

9月16日周三