跳到正文
今天10月3日周六3 条
  1. TechCrunch · AI70

    ChatGPT 上线虚拟试穿与商品收藏功能

    OpenAI 宣布在全球范围内为 ChatGPT 推出虚拟试穿与商品收藏两项新购物功能。虚拟试穿基于新发布的 ChatGPT Images 2.5 模型,用户可上传自拍或全身照预览服饰与配件的上身效果,也能通过上传商品截图直接生成试穿图。此外,收藏功能支持将浏览到的商品及对应试穿效果保存至资料库,方便后续回看。

  2. The Verge · AI65

    Google 为 Gemini Live 推出 Guided Vision 功能,支持实时画面语音描述

    Google 在兼容的 Android 设备上为 Gemini Live 推出 Guided Vision 功能,可通过摄像头提供周围环境与物体的实时语音描述。该功能主要面向视障及弱视人群,支持朗读细小文字、识别物品并进行追问交互,未入镜时还会提供对准镜头的音频提示。该功能除 Gemini 外也已接入 Google TalkBack,但官方提示其不可用于导航或替代盲杖。

10月2日周五
  1. The Verge · AI70

    AI 音乐生成平台 Suno 推出语音生成功能 Speech

    AI 音乐生成平台 Suno 在 Web 和移动端开启 Speech 功能公测,支持根据文本脚本或提示词生成语音旁白,并能同步搭配背景音乐。该功能最长支持生成约 8 分钟音频,提供 Simple 描述生成与 Advanced 脚本定制两种模式,用户可调节音色性别与风格,也可关闭背景音乐仅保留纯净人声。

9月29日周二
  1. Microsoft Research60

    微软研究院发布生物学 AI 研究系统 Quine

    微软研究院发布面向复杂生物学研究的 AI 系统 Quine,结合生物多模态世界模型与连接科学工具、文献及湿实验的交互框架。在与 Broad Institute 合作的胰腺癌细胞状态转换实验中,该系统用时一个周末即筛选并排序出最有潜力的候选化合物,且最高优先级候选物在多项湿实验检测中获得验证。

    推荐理由:该系统展示了多模态生物世界模型与湿实验闭环协同的范式,有助于评估跨尺度生物表征在药物重定向中的可用性。

9月25日周五
  1. MIT Technology Review · AI59

    五角大楼拟申请 3000 万美元预算研发 AI 测谎仪

    美国国防部在预算申请中提出,计划在未来 5 年内投入 3030 万美元推进名为 Polygraph+ 的升级版测谎仪项目。该项目重点引入机器学习评分算法与非接触式远距离生理传感技术,拟用于新员工审查和内部威胁检测。多位学者对此表示质疑,指出测谎缺乏客观真实数据作为基准,AI 难以建立生理信号与欺骗行为之间的可靠关联。

  2. Google Research67

    Google Research 提出连贯长视频生成多智能体框架

    Google Research 提出了一套用于自动化连贯长视频生成的 AI 视频协同导演多智能体框架体系,作为运行在 Gemini 和 Veo 之上的编排层,以解决多镜头叙事中的语义漂移与视觉不一致问题。

    推荐理由:原文拆解了长视频生成中角色与场景漂移的成因,提供了一套通过分层智能体解耦创意与时序一致性的系统性方案。

  3. Google DeepMind78

    Google 推出 Gemini 3.8 Live 实时数字人功能 Live Avatar

    Google DeepMind 宣布在 Gemini Enterprise 中推出 Gemini 3.8 Live with Live Avatar,为实时对话模型引入近实时的视觉形象与流式视频生成能力。该功能支持在对话进行的同时于后台异步调用工具并获取数据,具备跨 97 种语言的口型与表情同步,并允许企业基于参考图像定制专属形象。所有音视频输出均直接嵌入 SynthID 水印以确保内容可检测。

    推荐理由:企业级交互通过异步工具调用缓解了生成等待带来的停顿问题,使模型在后台查询数据的同时维持自然对话流。

9月24日周四
  1. Hugging Face Blog45

    用 LFM2.5-VL-DSpark 加速视觉语言模型推理

    Liquid AI 发布用于视觉语言模型 LFM2.5-VL-3B 的投机解码草稿模型 LFM2.5-VL-DSpark。该模型仅增加 280M 参数(8.9%),在保持输出质量的同时,使端侧解码速度最高提升 3.13x(端到端提升 2.62x),H100 解码最高加速 2.66x。模型开源权重已在 Hugging Face 发布,首日支持 llama.cpp、MLX-VLM 与 SGLang。

9月23日周三
  1. Google DeepMind75

    Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音生成模型

    Google DeepMind 正式推出 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持通过自然语言提示词定制角色声音、30 秒音频克隆以及双角色逐行台词编排。

    推荐理由:模型通过自然语言提示词定制角色声音并支持双角色台词编排,为游戏、播客及有声书的长音频生成提供了细粒度表演控制方案。

9月16日周三
8月13日周四
  1. Microsoft Research44

    MindTopo 揭示多模态大模型的空间推理能力

    微软推出 AI 拓扑推理基准 MindTopo,从连通、分离、顺序、包围和绳结五大维度评测多模态大模型的空间推理与规划能力。评测显示主流闭源与开源模型在静态识别上的表现均远优于交互式规划,且整体大幅低于人类水平。模型在规划中往往难以随场景变化保持对结构关系的追踪,容易提出违背物理动态约束的动作。