GPT-6 系列模型指南
OpenAI 面向初创企业推出 GPT-6 系列模型指南,指导如何选择合适的模型并调节推理力度(reasoning effort)。指南还详细介绍了优化提示词与技能(skills)、协同调度工具,以及将工作流推进至生产环境的实践方法。
OpenAI 面向初创企业推出 GPT-6 系列模型指南,指导如何选择合适的模型并调节推理力度(reasoning effort)。指南还详细介绍了优化提示词与技能(skills)、协同调度工具,以及将工作流推进至生产环境的实践方法。
Latent Space 专访了递归语言模型(RLM)与 KernelBench 核心作者、MIT 博士生 Alex Zhang,深入探讨了学术研究选题、AI 生成 GPU 内核的验证瓶颈以及 Harness 架构设计。
OpenAI 的 GPT-6 Astra Ultrafast 正式在 API 以及符合条件的 ChatGPT Work 和 Codex 中上线,基于 NVIDIA Blackwell GPU 运行。该模式相比 Astra Standard 的 token 生成速度最高提升 8 倍,显著缩短了编码智能体在编辑、测试与调试循环以及工具调用之间的响应等待时间。
推荐理由:文章介绍了基于硬件架构的推理优化细节,有助于读者评估生成加速对编码智能体与工具调用延迟的具体影响。
NVIDIA 阐明其 AI 工厂通过高生产力、耐用性和通用性最大化投资回报率。SemiAnalysis AgentX 数据显示,在 DeepSeek V4 Pro 模型上,Vera Rubin NVL72 每兆瓦吞吐量是 GB300 NVL72 的 30 倍以上,每百万 token 成本降低达 45 倍。
Google DeepMind 宣布推出前沿模型 Gemini 4 Argon,将其单次输出 token 上限从 64K 提升至 1M,专用于长流程深度推理、软件工程与网络安全防御。
推荐理由:该模型大幅提升输出长度上限并展示了真实工业代码迁移等长流程推理实践,读者可据此评估复杂智能体任务落地的可行边界。
Anthropic 推出新模型 Claude Sonnet 5.5,官方称其运行速度提升 30% 以上且多数任务成本降幅可达 30%,现已作为 claude.ai 免费层默认模型。
推荐理由:作者实测了新模型的思考模式与编码表现,指出其进入免费层改变了主流对话产品的体验基准。
NVIDIA 在 MLPerf Inference v6.1 评测中首次展示 Vera Rubin NVL72 系统性能,在 Qwen3-VL 基准测试中吞吐量最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高提升 2.5 倍。
Google 提出 Retrieve-for-Train 框架,通过离线强化学习与扩散模型解决复杂 AI 搜索的查询展开与推理延迟瓶颈。该框架微调 Gemma3-4B 和 Qwen3-4B 离线合成监督数据,再蒸馏到一个 53.9M 参数的轻量扩散检索器。模型通过单次非自回归计算直接生成目标嵌入集合,完全免除测试时 CoT 推理 token 开销。
Google DeepMind 推出 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款实时对话模型,主打近实时推理与语音智能体能力。
推荐理由:新模型将并发多步推理融入低延迟语音交互,为开发者构建支持后台工具调用的复杂语音智能体提供了实用基准。
微软推出 AI 拓扑推理基准 MindTopo,从连通、分离、顺序、包围和绳结五大维度评测多模态大模型的空间推理与规划能力。评测显示主流闭源与开源模型在静态识别上的表现均远优于交互式规划,且整体大幅低于人类水平。模型在规划中往往难以随场景变化保持对结构关系的追踪,容易提出违背物理动态约束的动作。
Mistral正式上线区域端点(Regional Endpoints)并开启优先层(Priority Tier)公测,支持客户自主选择在欧洲或美国运行推理,以满足数据驻留与合规要求。平台同时开始托管第三方开源模型(首发支持 Z.ai 的 GLM-5.2),并联合多家企业组建算力联盟,通过欧洲算力单元(ECUs)模式推进至2030年建设最高 1 GW 算力基础设施的长期计划。
扩展后的内核搜索框架 K-Search 引入结构化 CUDA 到 MLX 转译层,能将成熟的 GPU 内核优化经验自动迁移至 Apple Silicon。该系统由 Gemini 3.5 Pro Preview 执行优化推理并生成代码,在真实硬件上闭环迭代。
伯克利人工智能研究实验室(BAIR)发表博文,系统综述自适应并行推理(APR)这一推理解析范式。该范式让模型自主决定何时拆分子任务、并发启动多少分支以及如何汇聚结果,以缓解长串行推理带来的上下文腐化与高延迟问题。
推荐理由:文章系统梳理了自适应并行推理的技术路线,比较了引擎修改与客户端编排两种实现方案及奖励设计。