Graphite 研究揭示 Claude Opus 5.5 与 Astra 等大模型的写作套话特征
营销机构 Graphite 的对比研究发现,前沿大语言模型在减少破折号等旧破绽的同时催生了新的写作套话,且各模型存在独特惯用语。
营销机构 Graphite 的对比研究发现,前沿大语言模型在减少破折号等旧破绽的同时催生了新的写作套话,且各模型存在独特惯用语。
研究团队提出 LEGO-Anything 框架与 LEGO-Bench 基准,让编程智能体通过迭代编写 Blender 代码从单张照片重建 3D 场景,但实验发现模型在判断几何准确度时表现接近随机猜测水平。
Google 宣布推出下一代联邦学习系统,通过结合可信执行环境(TEE)提供端到端可验证且可审计的数据匿名化隐私保证。该系统将数据访问策略公开发布至 Rekor 透明日志,加密数据仅允许在 TEE 内部限时解密运算,相关代码已在 GitHub 开源并支持可重现构建。目前 Gboard 已率先接入该架构,计算速度较上一代系统大幅提升。
ServiceNow CoreAI 推出 AutoSynthData,用于将企业 AI 智能体的能力差距转化为定向训练数据。该系统结合目标模型的失败记录与更强教师模型的成功轨迹,自动生成并验证包含系统规范、用户提示词及验证器的全新任务。随着模型能力提升,训练课程会动态转向其薄弱环节,并在 EnterpriseOps Gym 中完成了管线演示与验证。
微软研究院开发了一套端到端机器学习系统,可针对美国本土 66,935 座变电站提前 30 至 60 分钟预测空间天气风险。该管线结合太阳风观测、AE 与 Dst 指数预测以及地质导电率等特征,在评估期内检测到了近 80% 的主要空间天气事件,并由 50 个 AI 智能体辅助探索特征与模型配置。
Google 研发出一种为 AI 设计的蛋白质添加水印的技术方法。该研究旨在提升生物安全保障,并能与一款主流的 AI 蛋白质设计工具配合使用。
Google DeepMind 推出合成生物学水印技术 SynthID Bio,能够在保留蛋白质生物学功能的前提下,将不可察觉的水印签名直接嵌入生物代码与结构中。该方案支持在 AlphaFold 3 预测结构中嵌入数字特征,并在实体合成的蛋白质结合物湿实验中保持了与原版相当的结合亲和力。团队正进一步探索基因组层面的水印应用,并宣布将开源相关代码、体外实验数据与模型权重。
推荐理由:原文给出了在不破坏生物活性前提下标记生成分子的完整方案,为生物安全筛查与数据防伪提供了可落地的验证方法。
Anthropic 前沿红队在 100 项随机选取的内部二进制漏洞利用基准任务中发现,GLM-5.3 在 4% 的测试中实现了完全控制流劫持,Claude Mythos Preview 成功率达 6%。
Google 提出 Diffusion Controller 框架,将扩散模型去噪过程重构为连续控制问题,通过轻量附加网络动态校准生成轨迹。该方案提供 PPO 与奖励加权损失两种优化路径,无需改动底层模型即可在保持画质的同时对齐用户意图。评测表明其附加网络表现超越行业标准,全解锁版本相比基线模型取得 90% 的胜率。
微软研究院发布面向复杂生物学研究的 AI 系统 Quine,结合生物多模态世界模型与连接科学工具、文献及湿实验的交互框架。在与 Broad Institute 合作的胰腺癌细胞状态转换实验中,该系统用时一个周末即筛选并排序出最有潜力的候选化合物,且最高优先级候选物在多项湿实验检测中获得验证。
推荐理由:该系统展示了多模态生物世界模型与湿实验闭环协同的范式,有助于评估跨尺度生物表征在药物重定向中的可用性。
Multiverse Computing 针对 MCP 智能体推出后置验证方案 ProvenanceGuard,用于解决事实成立但引用来源错误的跨源混淆问题。该方法在无需重新训练模型的情况下追踪工具输出与来源标识,将回答拆解为独立断言并分别检验支持源与归因一致性。在医疗智能体测试中其拦截 F1 达到 0.802,支持结合修复流程改写错误回答,已被整合至英伟达 NVFlow 等金融智能体工作流。
Google Research 提出了一套用于自动化连贯长视频生成的 AI 视频协同导演多智能体框架体系,作为运行在 Gemini 和 Veo 之上的编排层,以解决多镜头叙事中的语义漂移与视觉不一致问题。
推荐理由:原文拆解了长视频生成中角色与场景漂移的成因,提供了一套通过分层智能体解耦创意与时序一致性的系统性方案。
NVIDIA 联合 Google DeepMind 及 EMBL-EBI 等机构,在 AlphaFold Database 中开放了超过 2800 种病毒的蛋白质复合物预测 3D 结构数据集。
推荐理由:团队利用计算优化将蛋白质结构预测拓展至数千种病毒复合物,并开源了可复现的完整预测工作流。
Google Research 推出一项基于生成式 UI(GenUI)的研究实验,允许教师根据课程目标动态生成定制化、阶梯式挑战的互动教学模拟课件。系统内嵌教学法护栏与智能体自动化评估自纠错循环,确保课件的教学逻辑与界面交互可用。目前 Google 已发布涵盖中小学物理、化学等 STEM 领域的 30 多个范例库,并面向教育机构开放试点。
OpenAI 发布的最新经济研究探讨了员工如何在传统职责之外使用 AI,并分析了哪些新活动正在成为其日常工作的固定组成部分。
Google 提出 Retrieve-for-Train 框架,通过离线强化学习与扩散模型解决复杂 AI 搜索的查询展开与推理延迟瓶颈。该框架微调 Gemma3-4B 和 Qwen3-4B 离线合成监督数据,再蒸馏到一个 53.9M 参数的轻量扩散检索器。模型通过单次非自回归计算直接生成目标嵌入集合,完全免除测试时 CoT 推理 token 开销。
Google Research 提出 ToolGrad 框架,通过先生成工具调用链再标注用户提示词的范式与文本梯度反馈,高效低成本构建复杂工具调用数据集。在基于该数据微调 Gemma-3 后,ToolGrad-12B 在 BFCL 榜单取得 83.1 分,逼近 gemini-2.5-pro(83.2)并超越 claude-4.5 Opus(82.8)与 gpt-5(74.4)。
César de la Fuente 实验室正在利用 Codex 和 ChatGPT 检索现生与已灭绝物种的基因组。该团队旨在从中发掘新型候选抗菌分子,以对抗耐药性感染。
Google 研究人员通过评估英国生物样本库(UKB)向日本生物样本库(BBJ)迁移的 8 种临床表型,探索多基因风险评分(PRS)跨人群预测规律。实验显示,当目标人群样本量极小(如 5,000 例)时合并欧洲数据可提升准确率,但样本达 15,000 例或以上时,目标人群专用模型表现反超联合训练。遗传相关性高的保守性状能在大样本下持续获益,而血脂和血糖等群体特异性状获益衰减更快。
一项覆盖 1,000 多名学生的随机对照研究探讨了 ChatGPT 与批判性思维训练对学生的影响。该研究在真实的大学作业场景中,深入考察了 ChatGPT、批判性思维、原创性以及学生学业表现之间的关联。
METR 研究显示大语言模型在网络漏洞挖掘上实现显著加速,但在数学与 AI 算法优化中提升有限。多所高校联合团队推出 SPADE 框架,让模型通过自博弈交替生成可执行环境与解题,协同演化合成环境与推理能力。在 Qwen3-30B-A3B-Instruct-2507 上通过 GRPO 微调,游戏环境评测平均分达 58.3,较基础模型提升 8.1。
微软推出 AI 拓扑推理基准 MindTopo,从连通、分离、顺序、包围和绳结五大维度评测多模态大模型的空间推理与规划能力。评测显示主流闭源与开源模型在静态识别上的表现均远优于交互式规划,且整体大幅低于人类水平。模型在规划中往往难以随场景变化保持对结构关系的追踪,容易提出违背物理动态约束的动作。
扩展后的内核搜索框架 K-Search 引入结构化 CUDA 到 MLX 转译层,能将成熟的 GPU 内核优化经验自动迁移至 Apple Silicon。该系统由 Gemini 3.5 Pro Preview 执行优化推理并生成代码,在真实硬件上闭环迭代。
ABBEL 框架通过将交互摘要形式化为自然语言信念状态并引入监督评分,解决了大语言模型长周期交互中递归摘要导致的性能损耗问题。在 CollabBench 协同编程测试中,带重构评分的 ABBEL 将与全上下文模型的性能差距缩小约 50%,训练步数从 100 步减半至 50 步。同时该方案大幅削减了峰值上下文 token 长度,兼顾了推理内存效率。
伯克利人工智能研究实验室(BAIR)发表博文,系统综述自适应并行推理(APR)这一推理解析范式。该范式让模型自主决定何时拆分子任务、并发启动多少分支以及如何汇聚结果,以缓解长串行推理带来的上下文腐化与高延迟问题。
推荐理由:文章系统梳理了自适应并行推理的技术路线,比较了引擎修改与客户端编排两种实现方案及奖励设计。
研究团队提出基于梯度的规划器 GRASP,旨在解决世界模型在长时域规划中优化病态与容易陷入局部极小值的问题。GRASP 通过将轨迹提升至虚拟状态实现跨时间并行优化,直接向状态迭代引入随机性以增强探索能力。同时,该方法通过重塑梯度为动作提供清晰信号,有效避开了高维视觉模型中脆弱的状态输入梯度。
针对大语言模型中潜在交互随规模呈指数增长的分析瓶颈,研究人员提出了 SPEX 与 ProxySPEX 交互归因算法。SPEX 基于信号处理与编码理论将交互搜索转化为稀疏恢复问题,在上下文扩展至数千特征时仍能保持高保真度。ProxySPEX 则进一步利用层级结构特性,以减少约 10x 消融计算量的代价实现了与 SPEX 相当的表现。
Berkeley AI Research 在 NeurIPS 2025 提出一种基于互信息评估与优化成像硬件设计的框架。该方法结合噪声物理模型直接从测量数据估计信息量,在彩色摄影、射电天文学、无透镜成像与显微镜四大领域准确预测下游任务性能。其优化设计在无需特定任务解码器的情况下达到 SOTA 端到端方法水平,且降低了计算与显存开销。