跳到正文

技术方向

Agent 智能体 最新动态

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

127 条精选近 30 天 19 条共收录 275 条

更新

精选归档 · 第 5 页

1月28日周三第 81–100 条
  1. Google Research74

    Google Research 探索智能体系统扩展规律:多 Agent 系统何时及为何有效

    Google Research 团队发布智能体系统扩展研究,通过对 180 种配置的对照评测打破了多智能体总是更优的假设,指出其效果高度取决于任务特性。在可并行的任务中,集中式多智能体协调使性能提升 80.9%,但在强顺序推理任务中,多智能体反而导致性能下降 39% 至 70%。研究还发现独立多智能体会将错误放大 17.2 倍,并构建了能以 87% 准确率预测最佳架构的设计模型。

    推荐理由:研究量化了多智能体协作在并行与顺序任务中的表现差异,为开发者设计智能体架构提供了可依据的选型规律。

  2. Hugging Face Blog68

    Hugging Face 推出 upskill 工具:用 Claude 生成 Agent 技能并迁移至开源小模型

    Hugging Face 介绍了新工具 upskill,支持利用 Claude Opus 4.5 等高能力模型生成与评测 Agent Skills,并将专业能力迁移至更便宜或本地开源的模型。

    推荐理由:工具通过将大模型的执行经验固化为标准化技能文件并自动评测,为让低成本小模型攻克垂直复杂任务提供了可复现流程。

1月23日周五
  1. OpenAI News69

    OpenAI 深度拆解 Codex 智能体循环运行机制

    OpenAI 发布技术深度解析,剖析 Codex 智能体循环的内部运作机制。文章详细解释了 Codex CLI 如何借助 Responses API 协同编排模型、工具、提示词与运行性能。

    推荐理由:原文提供了 Codex CLI 借助 Responses API 编排工具与模型的内部机制,有助于理解智能体循环的工程落地架构。

1月15日周四
  1. Hugging Face Blog71

    Hugging Face 详解开源推理标准 Open Responses

    Open Responses 是一项由开源社区构建、Hugging Face 支持并基于 OpenAI Responses API 扩展的开放推理标准,旨在替代传统 Chat Completion 接口以原生适配 AI 智能体工作流。

    推荐理由:文章给出了 Open Responses 的接口规范与流式推理范例,便于开发者对比传统对话接口并评估智能体循环迁移成本。

1月5日周一
12月23日周二
  1. Hugging Face Blog61

    ServiceNow 推出面向智能体系统的安全防护模型 AprielGuard 8B

    ServiceNow 推出面向现代大语言模型与智能体系统的 8B 参数安全防护模型 AprielGuard,用于检测 16 类内容安全风险以及提示词注入、越狱等对抗攻击。

    推荐理由:原文针对智能体工作流设计了统一的安全与对抗检测框架,读者可以参考其在工具调用与长上下文场景下的防护方案。

12月16日周二
  1. Hugging Face Blog69

    IBM 开源可配置智能体框架 CUGA 并上线 Hugging Face Spaces

    IBM Research 开源了可配置通用 AI 智能体框架 CUGA,并在 Hugging Face Spaces 上线交互演示。CUGA 采用 Apache 2.0 协议,结合规划执行架构、动态任务账本与 Computer Use 能力,支持通过 MCP、OpenAPI 和 Langflow 1.7.0 进行多工具编排与可视化搭建。

    推荐理由:框架通过动态任务账本拆解多步骤调用并支持工具标准扩展,为复杂任务的低代码编排与执行提供了参考实现。

12月11日周四
  1. OpenAI News86

    OpenAI 发布 GPT-5.2 前沿模型

    OpenAI 推出面向日常专业工作的前沿模型 GPT-5.2,在推理、长上下文理解、编码和视觉能力上达到领先水平。该模型已接入 ChatGPT 与 OpenAI API,旨在支持更快、更可靠的智能体工作流。

    推荐理由:官方公布了面向日常专业工作的新模型定位,读者可据此了解其在复杂推理与智能体工作流中的能力侧重。

12月9日周二
11月25日周二
11月24日周一
  1. Google DeepMind70

    Google DeepMind 宣布支持美国能源部 Genesis 任务,向 17 个国家实验室开放科学 AI 工具

    Google DeepMind 宣布支持美国能源部发起的 Genesis 任务,向全美 17 个国家实验室加速开放前沿科学 AI 模型与智能体工具。科研人员即日起可通过 Google Cloud 使用基于 Gemini 的多智能体科研协作系统 AI co-scientist,以加速假说生成与实验验证。

    推荐理由:原文展示了前沿科学计算模型向国家级实验室开放的落地细节,读者可以据此了解前沿 AI 融入基础科学研究的推进路径。

11月19日周三
  1. OpenAI News60

    OpenAI 发布 GPT-5.1-Codex-Max 系统卡

    OpenAI 发布 GPT-5.1-Codex-Max 系统卡,系统阐述了该模型采取的综合安全措施。内容涵盖模型层面针对有害任务与提示词注入的专项安全训练,以及产品层面实行的智能体沙盒和可配置网络访问权限。

    推荐理由:原文梳理了针对恶意任务与提示词注入的模型层防护,读者可以据此参考代码智能体在沙盒与网络访问上的安全设计规范。

  2. OpenAI News71

    OpenAI 推出面向 Codex 的 GPT-5.1-Codex-Max 编程模型

    OpenAI 推出面向 Codex 的智能体编程模型 GPT-5.1-Codex-Max,具备更快的速度与更高的智能水平。该模型专为长时运行的项目级任务设计,增强了推理能力并提升了 token 效率。

    推荐理由:该模型针对长时项目级任务强化了推理与token效率,读者可据此评估复杂开发流的选型。

  3. Google Research78

    Google Research 推出 Generative UI 技术,支持按提示词动态生成可交互界面

    Google Research 发布 Generative UI 技术及相关论文,使大模型能够根据任意提示词动态设计并编写网页、工具与小游戏等完整定制的可交互界面。该系统基于 Gemini 3 Pro 配合工具调用、系统提示词与后处理管线实现,人工评测偏好度远超标准文本输出。目前该能力已在 Gemini 应用的动态视图实验以及 Google Search 的 AI Mode 中开启上线。

    推荐理由:该研究展示了大模型按需实时生成可交互界面的系统范式,为传统对话与静态内容展示提供了新的交互演进方向。

11月13日周四
  1. Google DeepMind73

    Google DeepMind 推出 SIMA 2:集成 Gemini 的 3D 虚拟世界具身智能体

    Google DeepMind 推出 SIMA 2 研究预览版,将 Gemini 模型作为智能体核心,实现在 3D 虚拟环境中进行高级目标推理与对话协作。该模型通过人类演示与 Gemini 生成标签混合训练,具备跨未见游戏迁移概念的能力,并可在 Genie 3 生成的全新 3D 模拟世界中自主探索与试错自进化。

    推荐理由:Google DeepMind 将 Gemini 推理核心融入 3D 虚拟世界智能体,展示了结合试错与自反馈实现跨游戏泛化及自进化的路径。

10月30日周四
  1. Hugging Face Blog68

    MiniMax 复盘 M2 智能体泛化与对齐经验:从基准测试走向真实场景

    MiniMax 团队复盘了 M2 模型的智能体后训练对齐经验,提出智能体需要交错思考与全轨迹扰动适应才能在真实场景中有效泛化。团队指出仅靠扩充工具数量无法应对脚手架和环境变化导致的性能下滑,因此引入可在任务任意阶段触发的交错思考机制,并构建了覆盖全操作空间的抗扰动训练数据管线。使用 M2 时需要完整保留包含思考步骤的会话历史上下文,避免因丢弃思考过程而影响模型效果。

    推荐理由:文章总结了智能体从基准测试走向真实场景的对齐经验,指出交错思考与全轨迹扰动适应是保持泛化能力的关键。