跳到正文
9月29日周二
  1. Microsoft Research60

    微软研究院发布生物学 AI 研究系统 Quine

    微软研究院发布面向复杂生物学研究的 AI 系统 Quine,结合生物多模态世界模型与连接科学工具、文献及湿实验的交互框架。在与 Broad Institute 合作的胰腺癌细胞状态转换实验中,该系统用时一个周末即筛选并排序出最有潜力的候选化合物,且最高优先级候选物在多项湿实验检测中获得验证。

    推荐理由:该系统展示了多模态生物世界模型与湿实验闭环协同的范式,有助于评估跨尺度生物表征在药物重定向中的可用性。

9月25日周五
  1. Google Research67

    Google Research 提出连贯长视频生成多智能体框架

    Google Research 提出了一套用于自动化连贯长视频生成的 AI 视频协同导演多智能体框架体系,作为运行在 Gemini 和 Veo 之上的编排层,以解决多镜头叙事中的语义漂移与视觉不一致问题。

    推荐理由:原文拆解了长视频生成中角色与场景漂移的成因,提供了一套通过分层智能体解耦创意与时序一致性的系统性方案。

  2. Google DeepMind78

    Google 推出 Gemini 3.8 Live 实时数字人功能 Live Avatar

    Google DeepMind 宣布在 Gemini Enterprise 中推出 Gemini 3.8 Live with Live Avatar,为实时对话模型引入近实时的视觉形象与流式视频生成能力。该功能支持在对话进行的同时于后台异步调用工具并获取数据,具备跨 97 种语言的口型与表情同步,并允许企业基于参考图像定制专属形象。所有音视频输出均直接嵌入 SynthID 水印以确保内容可检测。

    推荐理由:企业级交互通过异步工具调用缓解了生成等待带来的停顿问题,使模型在后台查询数据的同时维持自然对话流。

9月24日周四
  1. Hugging Face Blog45

    用 LFM2.5-VL-DSpark 加速视觉语言模型推理

    Liquid AI 发布用于视觉语言模型 LFM2.5-VL-3B 的投机解码草稿模型 LFM2.5-VL-DSpark。该模型仅增加 280M 参数(8.9%),在保持输出质量的同时,使端侧解码速度最高提升 3.13x(端到端提升 2.62x),H100 解码最高加速 2.66x。模型开源权重已在 Hugging Face 发布,首日支持 llama.cpp、MLX-VLM 与 SGLang。

9月23日周三
  1. Google DeepMind75

    Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音生成模型

    Google DeepMind 正式推出 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持通过自然语言提示词定制角色声音、30 秒音频克隆以及双角色逐行台词编排。

    推荐理由:模型通过自然语言提示词定制角色声音并支持双角色台词编排,为游戏、播客及有声书的长音频生成提供了细粒度表演控制方案。

9月16日周三
8月13日周四
  1. Microsoft Research44

    MindTopo 揭示多模态大模型的空间推理能力

    微软推出 AI 拓扑推理基准 MindTopo,从连通、分离、顺序、包围和绳结五大维度评测多模态大模型的空间推理与规划能力。评测显示主流闭源与开源模型在静态识别上的表现均远优于交互式规划,且整体大幅低于人类水平。模型在规划中往往难以随场景变化保持对结构关系的追踪,容易提出违背物理动态约束的动作。