AI 智能体可通过照片构建 3D 场景,但无法准确判断几何重建是否正确
研究团队提出 LEGO-Anything 框架与 LEGO-Bench 基准,让编程智能体通过迭代编写 Blender 代码从单张照片重建 3D 场景,但实验发现模型在判断几何准确度时表现接近随机猜测水平。
研究团队提出 LEGO-Anything 框架与 LEGO-Bench 基准,让编程智能体通过迭代编写 Blender 代码从单张照片重建 3D 场景,但实验发现模型在判断几何准确度时表现接近随机猜测水平。
微软研究院发布面向复杂生物学研究的 AI 系统 Quine,结合生物多模态世界模型与连接科学工具、文献及湿实验的交互框架。在与 Broad Institute 合作的胰腺癌细胞状态转换实验中,该系统用时一个周末即筛选并排序出最有潜力的候选化合物,且最高优先级候选物在多项湿实验检测中获得验证。
推荐理由:该系统展示了多模态生物世界模型与湿实验闭环协同的范式,有助于评估跨尺度生物表征在药物重定向中的可用性。
Google Research 提出了一套用于自动化连贯长视频生成的 AI 视频协同导演多智能体框架体系,作为运行在 Gemini 和 Veo 之上的编排层,以解决多镜头叙事中的语义漂移与视觉不一致问题。
推荐理由:原文拆解了长视频生成中角色与场景漂移的成因,提供了一套通过分层智能体解耦创意与时序一致性的系统性方案。
微软推出 AI 拓扑推理基准 MindTopo,从连通、分离、顺序、包围和绳结五大维度评测多模态大模型的空间推理与规划能力。评测显示主流闭源与开源模型在静态识别上的表现均远优于交互式规划,且整体大幅低于人类水平。模型在规划中往往难以随场景变化保持对结构关系的追踪,容易提出违背物理动态约束的动作。