跳到正文
今天10月3日周六1 条
  1. OpenAI News44

    GPT-6 系列模型指南

    OpenAI 面向初创企业推出 GPT-6 系列模型指南,指导如何选择合适的模型并调节推理力度(reasoning effort)。指南还详细介绍了优化提示词与技能(skills)、协同调度工具,以及将工作流推进至生产环境的实践方法。

10月2日周五
  1. NVIDIA Blog79

    NVIDIA GPU 如何加速 OpenAI 的 GPT-6 Astra Ultrafast

    OpenAI 的 GPT-6 Astra Ultrafast 正式在 API 以及符合条件的 ChatGPT Work 和 Codex 中上线,基于 NVIDIA Blackwell GPU 运行。该模式相比 Astra Standard 的 token 生成速度最高提升 8 倍,显著缩短了编码智能体在编辑、测试与调试循环以及工具调用之间的响应等待时间。

    推荐理由:文章介绍了基于硬件架构的推理优化细节,有助于读者评估生成加速对编码智能体与工具调用延迟的具体影响。

10月1日周四
  1. Google DeepMind76

    Google DeepMind 发布前沿模型 Gemini 4 Argon

    Google DeepMind 宣布推出前沿模型 Gemini 4 Argon,将其单次输出 token 上限从 64K 提升至 1M,专用于长流程深度推理、软件工程与网络安全防御。

    推荐理由:该模型大幅提升输出长度上限并展示了真实工业代码迁移等长流程推理实践,读者可据此评估复杂智能体任务落地的可行边界。

9月16日周三
  1. Google Research45

    Google 提出 Retrieve-for-Train:绕过推理瓶颈加速复杂 AI 搜索

    Google 提出 Retrieve-for-Train 框架,通过离线强化学习与扩散模型解决复杂 AI 搜索的查询展开与推理延迟瓶颈。该框架微调 Gemma3-4B 和 Qwen3-4B 离线合成监督数据,再蒸馏到一个 53.9M 参数的轻量扩散检索器。模型通过单次非自回归计算直接生成目标嵌入集合,完全免除测试时 CoT 推理 token 开销。

8月13日周四
  1. Microsoft Research44

    MindTopo 揭示多模态大模型的空间推理能力

    微软推出 AI 拓扑推理基准 MindTopo,从连通、分离、顺序、包围和绳结五大维度评测多模态大模型的空间推理与规划能力。评测显示主流闭源与开源模型在静态识别上的表现均远优于交互式规划,且整体大幅低于人类水平。模型在规划中往往难以随场景变化保持对结构关系的追踪,容易提出违背物理动态约束的动作。

8月11日周二
  1. Mistral AI51

    Mistral推出区域推理端点与优先层,构建欧洲主权AI基础设施

    Mistral正式上线区域端点(Regional Endpoints)并开启优先层(Priority Tier)公测,支持客户自主选择在欧洲或美国运行推理,以满足数据驻留与合规要求。平台同时开始托管第三方开源模型(首发支持 Z.ai 的 GLM-5.2),并联合多家企业组建算力联盟,通过欧洲算力单元(ECUs)模式推进至2030年建设最高 1 GW 算力基础设施的长期计划。

7月29日周三
5月8日周五
  1. Berkeley AI Research64

    BAIR 综述自适应并行推理:推理解析与扩展新范式

    伯克利人工智能研究实验室(BAIR)发表博文,系统综述自适应并行推理(APR)这一推理解析范式。该范式让模型自主决定何时拆分子任务、并发启动多少分支以及如何汇聚结果,以缓解长串行推理带来的上下文腐化与高延迟问题。

    推荐理由:文章系统梳理了自适应并行推理的技术路线,比较了引擎修改与客户端编排两种实现方案及奖励设计。