ChatGPT 上线虚拟试穿与商品收藏功能
OpenAI 宣布在全球范围内为 ChatGPT 推出虚拟试穿与商品收藏两项新购物功能。虚拟试穿基于新发布的 ChatGPT Images 2.5 模型,用户可上传自拍或全身照预览服饰与配件的上身效果,也能通过上传商品截图直接生成试穿图。此外,收藏功能支持将浏览到的商品及对应试穿效果保存至资料库,方便后续回看。
OpenAI 宣布在全球范围内为 ChatGPT 推出虚拟试穿与商品收藏两项新购物功能。虚拟试穿基于新发布的 ChatGPT Images 2.5 模型,用户可上传自拍或全身照预览服饰与配件的上身效果,也能通过上传商品截图直接生成试穿图。此外,收藏功能支持将浏览到的商品及对应试穿效果保存至资料库,方便后续回看。
Google 在兼容的 Android 设备上为 Gemini Live 推出 Guided Vision 功能,可通过摄像头提供周围环境与物体的实时语音描述。该功能主要面向视障及弱视人群,支持朗读细小文字、识别物品并进行追问交互,未入镜时还会提供对准镜头的音频提示。该功能除 Gemini 外也已接入 Google TalkBack,但官方提示其不可用于导航或替代盲杖。
研究团队提出 LEGO-Anything 框架与 LEGO-Bench 基准,让编程智能体通过迭代编写 Blender 代码从单张照片重建 3D 场景,但实验发现模型在判断几何准确度时表现接近随机猜测水平。
AI 音乐生成平台 Suno 在 Web 和移动端开启 Speech 功能公测,支持根据文本脚本或提示词生成语音旁白,并能同步搭配背景音乐。该功能最长支持生成约 8 分钟音频,提供 Simple 描述生成与 Advanced 脚本定制两种模式,用户可调节音色性别与风格,也可关闭背景音乐仅保留纯净人声。
微软研究院发布面向复杂生物学研究的 AI 系统 Quine,结合生物多模态世界模型与连接科学工具、文献及湿实验的交互框架。在与 Broad Institute 合作的胰腺癌细胞状态转换实验中,该系统用时一个周末即筛选并排序出最有潜力的候选化合物,且最高优先级候选物在多项湿实验检测中获得验证。
推荐理由:该系统展示了多模态生物世界模型与湿实验闭环协同的范式,有助于评估跨尺度生物表征在药物重定向中的可用性。
美国国防部在预算申请中提出,计划在未来 5 年内投入 3030 万美元推进名为 Polygraph+ 的升级版测谎仪项目。该项目重点引入机器学习评分算法与非接触式远距离生理传感技术,拟用于新员工审查和内部威胁检测。多位学者对此表示质疑,指出测谎缺乏客观真实数据作为基准,AI 难以建立生理信号与欺骗行为之间的可靠关联。
Google Research 提出了一套用于自动化连贯长视频生成的 AI 视频协同导演多智能体框架体系,作为运行在 Gemini 和 Veo 之上的编排层,以解决多镜头叙事中的语义漂移与视觉不一致问题。
推荐理由:原文拆解了长视频生成中角色与场景漂移的成因,提供了一套通过分层智能体解耦创意与时序一致性的系统性方案。
Google DeepMind 宣布在 Gemini Enterprise 中推出 Gemini 3.8 Live with Live Avatar,为实时对话模型引入近实时的视觉形象与流式视频生成能力。该功能支持在对话进行的同时于后台异步调用工具并获取数据,具备跨 97 种语言的口型与表情同步,并允许企业基于参考图像定制专属形象。所有音视频输出均直接嵌入 SynthID 水印以确保内容可检测。
推荐理由:企业级交互通过异步工具调用缓解了生成等待带来的停顿问题,使模型在后台查询数据的同时维持自然对话流。
Liquid AI 发布用于视觉语言模型 LFM2.5-VL-3B 的投机解码草稿模型 LFM2.5-VL-DSpark。该模型仅增加 280M 参数(8.9%),在保持输出质量的同时,使端侧解码速度最高提升 3.13x(端到端提升 2.62x),H100 解码最高加速 2.66x。模型开源权重已在 Hugging Face 发布,首日支持 llama.cpp、MLX-VLM 与 SGLang。
Google DeepMind 正式推出 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持通过自然语言提示词定制角色声音、30 秒音频克隆以及双角色逐行台词编排。
推荐理由:模型通过自然语言提示词定制角色声音并支持双角色台词编排,为游戏、播客及有声书的长音频生成提供了细粒度表演控制方案。
Google DeepMind 推出 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款实时对话模型,主打近实时推理与语音智能体能力。
推荐理由:新模型将并发多步推理融入低延迟语音交互,为开发者构建支持后台工具调用的复杂语音智能体提供了实用基准。
微软推出 AI 拓扑推理基准 MindTopo,从连通、分离、顺序、包围和绳结五大维度评测多模态大模型的空间推理与规划能力。评测显示主流闭源与开源模型在静态识别上的表现均远优于交互式规划,且整体大幅低于人类水平。模型在规划中往往难以随场景变化保持对结构关系的追踪,容易提出违背物理动态约束的动作。