跳到正文

技术方向

Agent 智能体 最新动态

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

127 条精选近 30 天 19 条共收录 275 条

更新

精选归档 · 第 6 页

10月23日周四第 101–120 条
9月29日周一
9月25日周四
  1. OpenAI News68

    OpenAI 推出 ChatGPT Pulse 移动端预览版

    OpenAI 正式面向移动端 Pro 用户推出 ChatGPT Pulse 预览版。Pulse 能够根据用户的历史聊天、反馈以及日历等已连接应用主动开展调研,并向用户推送个性化更新。

    推荐理由:功能展示了 ChatGPT 从被动对话向主动调研推送的转变,读者可据此观察个人助手结合应用上下文的落地形态。

9月23日周二
  1. Hugging Face Blog72

    Hugging Face 开源 Smol2Operator:轻量级 GUI 智能体后训练方案与模型

    Hugging Face 开源了 Smol2Operator,提供将轻量级视觉语言模型后训练为图形界面操作智能体的完整方案、模型权重与工具链。该方法先通过统一动作空间建立基础元素定位能力,再通过引入显式推理的多轮微调增强决策规划,使 SmolVLM2-2.2B 在 ScreenSpot-v2 基准上的准确率提升至 61.71%。项目同步开源了转换后的数据集、动作空间适配工具以及在线交互演示。

    推荐理由:原文完整开源了从异构动作空间归一化到感知与推理两阶段微调的配方,读者可参考其在小参数模型上构建界面操作能力。

9月22日周一
  1. Hugging Face Blog71

    Gaia2 智能体评测基准与 ARE 环境发布

    Hugging Face 联合 Meta 推出新一代智能体评测基准 Gaia2 及开源测试环境 ARE,用于评估 AI 智能体在真实交互环境中的复杂行为。Gaia2 从只读搜索转向读写交互,通过 1000 个模拟手机应用场景考察歧义处理、时间推理和抗干扰等能力。ARE 框架支持通过 MCP 连接外部工具并记录执行轨迹,评测结果显示当前大模型在时间敏感与环境适应性任务上仍面临明显瓶颈。

    推荐理由:相比只读的信息检索评测,该基准引入读写操作和不可预测的环境干扰,有助于检验智能体在复杂交互下的鲁棒性。

9月15日周一
  1. OpenAI News77

    OpenAI 发布 GPT-5-Codex 系统卡附录

    OpenAI 发布 GPT-5 系统卡附录并推出新模型 GPT-5-Codex,该版本专为 Codex 中的智能体编程进一步优化。模型可根据任务复杂度动态调整思考投入,面对简单对话或小任务快速响应,遇到复杂任务则会自主延长思考时间。

    推荐理由:该模型展示了针对智能体编程场景动态分配思考时长的机制,有助于了解复杂代码任务的推理优化方向。

9月10日周三
7月17日周四
  1. OpenAI News77

    OpenAI 推出 ChatGPT agent

    OpenAI 推出 ChatGPT agent,具备思考与行动能力。该智能体可在用户指导下调用工具,协助完成调研、预订以及制作演示文稿等任务。

    推荐理由:官方给出了其思考与调用工具完成任务的定位,读者可据此了解其在调研与办公任务中的应用方向。

6月6日周五
6月3日周二
5月28日周三
  1. Hugging Face Blog73

    Hugging Face 提出结构化代码智能体:结合 JSON 约束与可执行代码提升任务成功率

    Hugging Face 提出将结构化生成引入代码智能体(CodeAgent),通过强制模型输出包含思考与代码的 JSON 格式,在 GAIA、MATH 等基准上比传统方案平均提升 2 至 7 个百分点。

    推荐理由:原文阐明了结构化输出如何消除代码智能体的解析错误并强制规划,同时指出了小模型面临的结构税,适合智能体开发者参考。

5月23日周五
  1. Hugging Face Blog72

    Python 版 Tiny Agents:用约 70 行代码构建基于 MCP 的智能体

    Hugging Face 介绍了 Python 版 Tiny Agents,通过将 huggingface_hub 扩展为 MCP 客户端,仅用约 70 行代码即可构建具备工具调用能力的轻量智能体。

    推荐理由:原文拆解了仅用底层客户端和简单循环连接 MCP 服务的实现逻辑,读者可以借此掌握极简智能体架构的设计方法。

5月16日周五
  1. OpenAI News74

    OpenAI 发布 o3 与 o4-mini 系统卡片补遗:介绍云端编程智能体 Codex

    OpenAI 在 o3 和 o4-mini 系统卡片补遗中介绍了云端编程智能体 Codex。Codex 由针对软件工程优化的 OpenAI o3 版本 codex-1 驱动。该模型在多种环境的真实编程任务中通过强化学习训练,能够贴合人类风格和 PR 偏好,严格遵循指令并反复运行测试直至通过。

    推荐理由:官方披露了云端编程智能体 Codex 及其专用模型 codex-1 的训练细节,有助于了解针对工程任务优化的思路。

5月12日周一
  1. Hugging Face Blog71

    Hugging Face 发布视觉语言模型年度综述:架构演进与多模态趋势盘点

    Hugging Face 官方博客发文全面盘点了过去一年开源视觉语言模型的技术演进与核心趋势。文章系统总结了任意模态互转、长链推理、轻量端侧部署、MoE 解码器以及结合物理环境的 VLA 模型等新架构,并深入探讨了多模态 RAG、GUI 智能体及对齐微调等工程实践的落地现状。

    推荐理由:文章系统梳理了视觉语言模型在任意模态交互、端侧小型化及智能体应用上的演进路径,便于快速把握开源多模态技术版图。

4月25日周五
2月4日周二
2月3日周一
  1. OpenAI News80

    OpenAI 推出 deep research 智能体

    OpenAI 推出 deep research 智能体,利用推理能力综合海量网络信息以完成多步骤研究任务。该功能即日起面向 Pro 用户开放,后续将逐步推向 Plus 和 Team 用户。

    推荐理由:关注该功能如何利用推理能力自动化完成多步网络检索与综合分析,便于了解各订阅层级的上线规划。

1月24日周五
  1. Hugging Face Blog72

    Hugging Face 开源智能体框架 smolagents 正式支持视觉多模态模型

    Hugging Face 宣布其开源智能体框架 smolagents 正式支持视觉语言模型(VLM),让智能体能够在执行管线中原生处理图像。框架支持在启动时通过 run 方法直接传入图像列表,也支持通过每步回调函数将网页截图等动态图像写入记忆观察。官方提供了结合 helium 浏览器自动化工具与 Qwen2-VL 等模型构建自主网页浏览 Agent 的完整示例。

    推荐理由:原文给出了静态传入与动态回调两种图像输入方案及完整代码,读者可据此为轻量智能体工作流增加多模态感知能力。