跳到正文
  1. Microsoft Research60

    微软研究院发布生物学 AI 研究系统 Quine

    微软研究院发布面向复杂生物学研究的 AI 系统 Quine,结合生物多模态世界模型与连接科学工具、文献及湿实验的交互框架。在与 Broad Institute 合作的胰腺癌细胞状态转换实验中,该系统用时一个周末即筛选并排序出最有潜力的候选化合物,且最高优先级候选物在多项湿实验检测中获得验证。

    推荐理由:该系统展示了多模态生物世界模型与湿实验闭环协同的范式,有助于评估跨尺度生物表征在药物重定向中的可用性。

  1. Google Research67

    Google Research 提出连贯长视频生成多智能体框架

    Google Research 提出了一套用于自动化连贯长视频生成的 AI 视频协同导演多智能体框架体系,作为运行在 Gemini 和 Veo 之上的编排层,以解决多镜头叙事中的语义漂移与视觉不一致问题。

    推荐理由:原文拆解了长视频生成中角色与场景漂移的成因,提供了一套通过分层智能体解耦创意与时序一致性的系统性方案。

  2. Google DeepMind78

    Google 推出 Gemini 3.8 Live 实时数字人功能 Live Avatar

    Google DeepMind 宣布在 Gemini Enterprise 中推出 Gemini 3.8 Live with Live Avatar,为实时对话模型引入近实时的视觉形象与流式视频生成能力。该功能支持在对话进行的同时于后台异步调用工具并获取数据,具备跨 97 种语言的口型与表情同步,并允许企业基于参考图像定制专属形象。所有音视频输出均直接嵌入 SynthID 水印以确保内容可检测。

    推荐理由:企业级交互通过异步工具调用缓解了生成等待带来的停顿问题,使模型在后台查询数据的同时维持自然对话流。

  1. Google DeepMind75

    Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音生成模型

    Google DeepMind 正式推出 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持通过自然语言提示词定制角色声音、30 秒音频克隆以及双角色逐行台词编排。

    推荐理由:模型通过自然语言提示词定制角色声音并支持双角色台词编排,为游戏、播客及有声书的长音频生成提供了细粒度表演控制方案。

  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 实时对话模型

    Google DeepMind 推出 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款实时对话模型,主打近实时推理与语音智能体能力。

    推荐理由:新模型将并发多步推理融入低延迟语音交互,为开发者构建支持后台工具调用的复杂语音智能体提供了实用基准。

已经到底了