跳到正文
10月2日周五
  1. Google Research45

    Google 迈向基于联邦数据的可证明隐私学习

    Google 宣布推出下一代联邦学习系统,通过结合可信执行环境(TEE)提供端到端可验证且可审计的数据匿名化隐私保证。该系统将数据访问策略公开发布至 Rekor 透明日志,加密数据仅允许在 TEE 内部限时解密运算,相关代码已在 GitHub 开源并支持可重现构建。目前 Gboard 已率先接入该架构,计算速度较上一代系统大幅提升。

10月1日周四
  1. Google DeepMind76

    Google DeepMind 发布前沿模型 Gemini 4 Argon

    Google DeepMind 宣布推出前沿模型 Gemini 4 Argon,将其单次输出 token 上限从 64K 提升至 1M,专用于长流程深度推理、软件工程与网络安全防御。

    推荐理由:该模型大幅提升输出长度上限并展示了真实工业代码迁移等长流程推理实践,读者可据此评估复杂智能体任务落地的可行边界。

9月30日周三
  1. Google DeepMind70

    Google DeepMind 发布生物水印技术 SynthID Bio

    Google DeepMind 推出合成生物学水印技术 SynthID Bio,能够在保留蛋白质生物学功能的前提下,将不可察觉的水印签名直接嵌入生物代码与结构中。该方案支持在 AlphaFold 3 预测结构中嵌入数字特征,并在实体合成的蛋白质结合物湿实验中保持了与原版相当的结合亲和力。团队正进一步探索基因组层面的水印应用,并宣布将开源相关代码、体外实验数据与模型权重。

    推荐理由:原文给出了在不破坏生物活性前提下标记生成分子的完整方案,为生物安全筛查与数据防伪提供了可落地的验证方法。

  2. Google Research43

    Diffusion Controller 如何统一并简化 AI 图像生成

    Google 提出 Diffusion Controller 框架,将扩散模型去噪过程重构为连续控制问题,通过轻量附加网络动态校准生成轨迹。该方案提供 PPO 与奖励加权损失两种优化路径,无需改动底层模型即可在保持画质的同时对齐用户意图。评测表明其附加网络表现超越行业标准,全解锁版本相比基线模型取得 90% 的胜率。

9月25日周五
  1. Google Research67

    Google Research 提出连贯长视频生成多智能体框架

    Google Research 提出了一套用于自动化连贯长视频生成的 AI 视频协同导演多智能体框架体系,作为运行在 Gemini 和 Veo 之上的编排层,以解决多镜头叙事中的语义漂移与视觉不一致问题。

    推荐理由:原文拆解了长视频生成中角色与场景漂移的成因,提供了一套通过分层智能体解耦创意与时序一致性的系统性方案。

  2. Google DeepMind78

    Google 推出 Gemini 3.8 Live 实时数字人功能 Live Avatar

    Google DeepMind 宣布在 Gemini Enterprise 中推出 Gemini 3.8 Live with Live Avatar,为实时对话模型引入近实时的视觉形象与流式视频生成能力。该功能支持在对话进行的同时于后台异步调用工具并获取数据,具备跨 97 种语言的口型与表情同步,并允许企业基于参考图像定制专属形象。所有音视频输出均直接嵌入 SynthID 水印以确保内容可检测。

    推荐理由:企业级交互通过异步工具调用缓解了生成等待带来的停顿问题,使模型在后台查询数据的同时维持自然对话流。

9月24日周四
  1. Google DeepMind61

    Google 升级 Private AI Compute 架构,引入服务端安全持久记忆

    Google 宣布升级 Private AI Compute 架构,引入安全的服务端持久记忆层,在保持端侧隐私标准的同时为 AI 助手提供跨设备的连续记忆能力。该方案结合硬件安全飞地与端到端加密通道,解密密钥完全保留在用户个人设备上,数据在隔离内存处理并即时加密,确保包括 Google 在内的外部各方皆无法访问。团队同步公开了防篡改服务端软件记录与第三方安全审计结果,供社区独立验证。

    推荐理由:该方案展示了结合硬件安全飞地与本地密钥管理兼顾云端大模型算力与隐私持久记忆的技术实现路径。

9月23日周三
  1. Google DeepMind75

    Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音生成模型

    Google DeepMind 正式推出 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持通过自然语言提示词定制角色声音、30 秒音频克隆以及双角色逐行台词编排。

    推荐理由:模型通过自然语言提示词定制角色声音并支持双角色台词编排,为游戏、播客及有声书的长音频生成提供了细粒度表演控制方案。

9月18日周五
  1. Google Research57

    Google Research 探索利用生成式 UI 动态构建教学互动模拟

    Google Research 推出一项基于生成式 UI(GenUI)的研究实验,允许教师根据课程目标动态生成定制化、阶梯式挑战的互动教学模拟课件。系统内嵌教学法护栏与智能体自动化评估自纠错循环,确保课件的教学逻辑与界面交互可用。目前 Google 已发布涵盖中小学物理、化学等 STEM 领域的 30 多个范例库,并面向教育机构开放试点。

9月16日周三
  1. Google Research45

    Google 提出 Retrieve-for-Train:绕过推理瓶颈加速复杂 AI 搜索

    Google 提出 Retrieve-for-Train 框架,通过离线强化学习与扩散模型解决复杂 AI 搜索的查询展开与推理延迟瓶颈。该框架微调 Gemma3-4B 和 Qwen3-4B 离线合成监督数据,再蒸馏到一个 53.9M 参数的轻量扩散检索器。模型通过单次非自回归计算直接生成目标嵌入集合,完全免除测试时 CoT 推理 token 开销。

9月11日周五
9月8日周二
9月4日周五
  1. Google Research44

    Google Research:面向代表性不足人群基因组预测的迁移学习

    Google 研究人员通过评估英国生物样本库(UKB)向日本生物样本库(BBJ)迁移的 8 种临床表型,探索多基因风险评分(PRS)跨人群预测规律。实验显示,当目标人群样本量极小(如 5,000 例)时合并欧洲数据可提升准确率,但样本达 15,000 例或以上时,目标人群专用模型表现反超联合训练。遗传相关性高的保守性状能在大样本下持续获益,而血脂和血糖等群体特异性状获益衰减更快。

9月3日周四