跳到正文
今天10月3日周六2 条
10月2日周五
  1. Google Research45

    Google 迈向基于联邦数据的可证明隐私学习

    Google 宣布推出下一代联邦学习系统,通过结合可信执行环境(TEE)提供端到端可验证且可审计的数据匿名化隐私保证。该系统将数据访问策略公开发布至 Rekor 透明日志,加密数据仅允许在 TEE 内部限时解密运算,相关代码已在 GitHub 开源并支持可重现构建。目前 Gboard 已率先接入该架构,计算速度较上一代系统大幅提升。

  2. Hugging Face Blog48

    AutoSynthData:为企业 AI 智能体生成训练数据

    ServiceNow CoreAI 推出 AutoSynthData,用于将企业 AI 智能体的能力差距转化为定向训练数据。该系统结合目标模型的失败记录与更强教师模型的成功轨迹,自动生成并验证包含系统规范、用户提示词及验证器的全新任务。随着模型能力提升,训练课程会动态转向其薄弱环节,并在 EnterpriseOps Gym 中完成了管线演示与验证。

10月1日周四
  1. Microsoft Research37

    微软研究院预测空间天气对电网的风险

    微软研究院开发了一套端到端机器学习系统,可针对美国本土 66,935 座变电站提前 30 至 60 分钟预测空间天气风险。该管线结合太阳风观测、AE 与 Dst 指数预测以及地质导电率等特征,在评估期内检测到了近 80% 的主要空间天气事件,并由 50 个 AI 智能体辅助探索特征与模型配置。

9月30日周三
  1. Google DeepMind70

    Google DeepMind 发布生物水印技术 SynthID Bio

    Google DeepMind 推出合成生物学水印技术 SynthID Bio,能够在保留蛋白质生物学功能的前提下,将不可察觉的水印签名直接嵌入生物代码与结构中。该方案支持在 AlphaFold 3 预测结构中嵌入数字特征,并在实体合成的蛋白质结合物湿实验中保持了与原版相当的结合亲和力。团队正进一步探索基因组层面的水印应用,并宣布将开源相关代码、体外实验数据与模型权重。

    推荐理由:原文给出了在不破坏生物活性前提下标记生成分子的完整方案,为生物安全筛查与数据防伪提供了可落地的验证方法。

  2. Google Research43

    Diffusion Controller 如何统一并简化 AI 图像生成

    Google 提出 Diffusion Controller 框架,将扩散模型去噪过程重构为连续控制问题,通过轻量附加网络动态校准生成轨迹。该方案提供 PPO 与奖励加权损失两种优化路径,无需改动底层模型即可在保持画质的同时对齐用户意图。评测表明其附加网络表现超越行业标准,全解锁版本相比基线模型取得 90% 的胜率。

9月29日周二
  1. Microsoft Research60

    微软研究院发布生物学 AI 研究系统 Quine

    微软研究院发布面向复杂生物学研究的 AI 系统 Quine,结合生物多模态世界模型与连接科学工具、文献及湿实验的交互框架。在与 Broad Institute 合作的胰腺癌细胞状态转换实验中,该系统用时一个周末即筛选并排序出最有潜力的候选化合物,且最高优先级候选物在多项湿实验检测中获得验证。

    推荐理由:该系统展示了多模态生物世界模型与湿实验闭环协同的范式,有助于评估跨尺度生物表征在药物重定向中的可用性。

  2. Hugging Face Blog53

    面向 MCP 智能体的来源感知验证:ProvenanceGuard 方案解析

    Multiverse Computing 针对 MCP 智能体推出后置验证方案 ProvenanceGuard,用于解决事实成立但引用来源错误的跨源混淆问题。该方法在无需重新训练模型的情况下追踪工具输出与来源标识,将回答拆解为独立断言并分别检验支持源与归因一致性。在医疗智能体测试中其拦截 F1 达到 0.802,支持结合修复流程改写错误回答,已被整合至英伟达 NVFlow 等金融智能体工作流。

9月25日周五
  1. Google Research67

    Google Research 提出连贯长视频生成多智能体框架

    Google Research 提出了一套用于自动化连贯长视频生成的 AI 视频协同导演多智能体框架体系,作为运行在 Gemini 和 Veo 之上的编排层,以解决多镜头叙事中的语义漂移与视觉不一致问题。

    推荐理由:原文拆解了长视频生成中角色与场景漂移的成因,提供了一套通过分层智能体解耦创意与时序一致性的系统性方案。

9月24日周四
9月18日周五
  1. Google Research57

    Google Research 探索利用生成式 UI 动态构建教学互动模拟

    Google Research 推出一项基于生成式 UI(GenUI)的研究实验,允许教师根据课程目标动态生成定制化、阶梯式挑战的互动教学模拟课件。系统内嵌教学法护栏与智能体自动化评估自纠错循环,确保课件的教学逻辑与界面交互可用。目前 Google 已发布涵盖中小学物理、化学等 STEM 领域的 30 多个范例库,并面向教育机构开放试点。

9月16日周三
  1. Google Research45

    Google 提出 Retrieve-for-Train:绕过推理瓶颈加速复杂 AI 搜索

    Google 提出 Retrieve-for-Train 框架,通过离线强化学习与扩散模型解决复杂 AI 搜索的查询展开与推理延迟瓶颈。该框架微调 Gemma3-4B 和 Qwen3-4B 离线合成监督数据,再蒸馏到一个 53.9M 参数的轻量扩散检索器。模型通过单次非自回归计算直接生成目标嵌入集合,完全免除测试时 CoT 推理 token 开销。

9月11日周五
9月4日周五
  1. Google Research44

    Google Research:面向代表性不足人群基因组预测的迁移学习

    Google 研究人员通过评估英国生物样本库(UKB)向日本生物样本库(BBJ)迁移的 8 种临床表型,探索多基因风险评分(PRS)跨人群预测规律。实验显示,当目标人群样本量极小(如 5,000 例)时合并欧洲数据可提升准确率,但样本达 15,000 例或以上时,目标人群专用模型表现反超联合训练。遗传相关性高的保守性状能在大样本下持续获益,而血脂和血糖等群体特异性状获益衰减更快。

8月27日周四
8月24日周一
  1. Import AI38

    Import AI 470:机器无人权、SPADE 自动化环境生成与 Hawkeye 优化 GPU 内核

    METR 研究显示大语言模型在网络漏洞挖掘上实现显著加速,但在数学与 AI 算法优化中提升有限。多所高校联合团队推出 SPADE 框架,让模型通过自博弈交替生成可执行环境与解题,协同演化合成环境与推理能力。在 Qwen3-30B-A3B-Instruct-2507 上通过 GRPO 微调,游戏环境评测平均分达 58.3,较基础模型提升 8.1。

8月13日周四
  1. Microsoft Research44

    MindTopo 揭示多模态大模型的空间推理能力

    微软推出 AI 拓扑推理基准 MindTopo,从连通、分离、顺序、包围和绳结五大维度评测多模态大模型的空间推理与规划能力。评测显示主流闭源与开源模型在静态识别上的表现均远优于交互式规划,且整体大幅低于人类水平。模型在规划中往往难以随场景变化保持对结构关系的追踪,容易提出违背物理动态约束的动作。

7月29日周三
7月26日周日
  1. Berkeley AI Research43

    教大语言模型更新信念以实现高效长周期交互

    ABBEL 框架通过将交互摘要形式化为自然语言信念状态并引入监督评分,解决了大语言模型长周期交互中递归摘要导致的性能损耗问题。在 CollabBench 协同编程测试中,带重构评分的 ABBEL 将与全上下文模型的性能差距缩小约 50%,训练步数从 100 步减半至 50 步。同时该方案大幅削减了峰值上下文 token 长度,兼顾了推理内存效率。

5月8日周五
  1. Berkeley AI Research64

    BAIR 综述自适应并行推理:推理解析与扩展新范式

    伯克利人工智能研究实验室(BAIR)发表博文,系统综述自适应并行推理(APR)这一推理解析范式。该范式让模型自主决定何时拆分子任务、并发启动多少分支以及如何汇聚结果,以缓解长串行推理带来的上下文腐化与高延迟问题。

    推荐理由:文章系统梳理了自适应并行推理的技术路线,比较了引擎修改与客户端编排两种实现方案及奖励设计。

4月20日周一
  1. Berkeley AI Research44

    面向世界模型的长时域基于梯度规划方法 GRASP

    研究团队提出基于梯度的规划器 GRASP,旨在解决世界模型在长时域规划中优化病态与容易陷入局部极小值的问题。GRASP 通过将轨迹提升至虚拟状态实现跨时间并行优化,直接向状态迭代引入随机性以增强探索能力。同时,该方法通过重塑梯度为动作提供清晰信号,有效避开了高维视觉模型中脆弱的状态输入梯度。

3月13日周五
  1. Berkeley AI Research49

    面向大语言模型的大规模交互识别

    针对大语言模型中潜在交互随规模呈指数增长的分析瓶颈,研究人员提出了 SPEX 与 ProxySPEX 交互归因算法。SPEX 基于信号处理与编码理论将交互搜索转化为稀疏恢复问题,在上下文扩展至数千特征时仍能保持高保真度。ProxySPEX 则进一步利用层级结构特性,以减少约 10x 消融计算量的代价实现了与 SPEX 相当的表现。

1月10日周六
  1. Berkeley AI Research44

    Berkeley AI Research:信息驱动的成像系统设计

    Berkeley AI Research 在 NeurIPS 2025 提出一种基于互信息评估与优化成像硬件设计的框架。该方法结合噪声物理模型直接从测量数据估计信息量,在彩色摄影、射电天文学、无透镜成像与显微镜四大领域准确预测下游任务性能。其优化设计在无需特定任务解码器的情况下达到 SOTA 端到端方法水平,且降低了计算与显存开销。