Google 提出 Retrieve-for-Train:绕过推理瓶颈加速复杂 AI 搜索
Google 提出 Retrieve-for-Train 框架,通过离线强化学习与扩散模型解决复杂 AI 搜索的查询展开与推理延迟瓶颈。该框架微调 Gemma3-4B 和 Qwen3-4B 离线合成监督数据,再蒸馏到一个 53.9M 参数的轻量扩散检索器。模型通过单次非自回归计算直接生成目标嵌入集合,完全免除测试时 CoT 推理 token 开销。
Google 提出 Retrieve-for-Train 框架,通过离线强化学习与扩散模型解决复杂 AI 搜索的查询展开与推理延迟瓶颈。该框架微调 Gemma3-4B 和 Qwen3-4B 离线合成监督数据,再蒸馏到一个 53.9M 参数的轻量扩散检索器。模型通过单次非自回归计算直接生成目标嵌入集合,完全免除测试时 CoT 推理 token 开销。
微软推出 AI 拓扑推理基准 MindTopo,从连通、分离、顺序、包围和绳结五大维度评测多模态大模型的空间推理与规划能力。评测显示主流闭源与开源模型在静态识别上的表现均远优于交互式规划,且整体大幅低于人类水平。模型在规划中往往难以随场景变化保持对结构关系的追踪,容易提出违背物理动态约束的动作。
扩展后的内核搜索框架 K-Search 引入结构化 CUDA 到 MLX 转译层,能将成熟的 GPU 内核优化经验自动迁移至 Apple Silicon。该系统由 Gemini 3.5 Pro Preview 执行优化推理并生成代码,在真实硬件上闭环迭代。
伯克利人工智能研究实验室(BAIR)发表博文,系统综述自适应并行推理(APR)这一推理解析范式。该范式让模型自主决定何时拆分子任务、并发启动多少分支以及如何汇聚结果,以缓解长串行推理带来的上下文腐化与高延迟问题。
推荐理由:文章系统梳理了自适应并行推理的技术路线,比较了引擎修改与客户端编排两种实现方案及奖励设计。