跳到正文
  1. NVIDIA Blog79

    NVIDIA GPU 如何加速 OpenAI 的 GPT-6 Astra Ultrafast

    OpenAI 的 GPT-6 Astra Ultrafast 正式在 API 以及符合条件的 ChatGPT Work 和 Codex 中上线,基于 NVIDIA Blackwell GPU 运行。该模式相比 Astra Standard 的 token 生成速度最高提升 8 倍,显著缩短了编码智能体在编辑、测试与调试循环以及工具调用之间的响应等待时间。

    推荐理由:文章介绍了基于硬件架构的推理优化细节,有助于读者评估生成加速对编码智能体与工具调用延迟的具体影响。

  1. Google DeepMind76

    Google DeepMind 发布前沿模型 Gemini 4 Argon

    Google DeepMind 宣布推出前沿模型 Gemini 4 Argon,将其单次输出 token 上限从 64K 提升至 1M,专用于长流程深度推理、软件工程与网络安全防御。

    推荐理由:该模型大幅提升输出长度上限并展示了真实工业代码迁移等长流程推理实践,读者可据此评估复杂智能体任务落地的可行边界。

  1. Simon Willison86

    Anthropic 发布 Claude Sonnet 5.5 并上线免费层

    Anthropic 推出新模型 Claude Sonnet 5.5,官方称其运行速度提升 30% 以上且多数任务成本降幅可达 30%,现已作为 claude.ai 免费层默认模型。

    推荐理由:作者实测了新模型的思考模式与编码表现,指出其进入免费层改变了主流对话产品的体验基准。

  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 实时对话模型

    Google DeepMind 推出 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款实时对话模型,主打近实时推理与语音智能体能力。

    推荐理由:新模型将并发多步推理融入低延迟语音交互,为开发者构建支持后台工具调用的复杂语音智能体提供了实用基准。

已经到底了