跳到正文

技术方向

Agent 智能体 最新动态

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

149 条精选近 30 天 18 条共收录 342 条

更新

精选归档 · 第 8 页

7月24日周一第 141–149 条
6月23日周四
  1. OpenAI News74

    OpenAI 提出视频预训练模型 VPT:利用未标注人类视频学会玩 Minecraft

    OpenAI 提出视频预训练方法 VPT,通过在海量未标注的人类游戏视频上预训练神经网络,让模型学会玩 Minecraft。结合少量标注数据进行微调后,该模型可直接通过键盘和鼠标原生接口完成制作钻石工具等长周期复杂任务,向通用计算机操作智能体迈出重要一步。

    推荐理由:该研究展示了利用无标注人类操作视频预训练模型完成长序列任务的可行性,为通用计算机操作智能体提供了新的训练路径。

9月17日周二
  1. OpenAI News74

    OpenAI 研究发现多智能体交互中涌现出复杂工具使用能力

    OpenAI 观察到多智能体在模拟捉迷藏游戏中能自发发现并使用越来越复杂的工具。智能体通过自监督训练构建了 6 种截然不同的策略与反制策略,其中部分策略甚至超出了研究团队对环境支持能力的既有认知。研究表明,简单环境下的多智能体协同适应未来可能演化出极度复杂的智能行为。

    推荐理由:多智能体在简单博弈环境中自发演化出多阶段攻防策略,为利用多智能体协同适应探索复杂智能行为提供了实验参考。

4月15日周一
  1. OpenAI News89

    OpenAI Five 击败 Dota 2 世界冠军 OG

    OpenAI Five 在周末的比赛中连胜两局击败 Dota 2 世界冠军战队 OG,成为首个在电竞比赛中击败世界冠军的 AI。此前 OpenAI Five 与 DeepMind 的 AlphaStar 虽曾在线下私下战胜过职业选手,但在公开直播比赛中均告负,这也是 AI 第一次在现场直播中战胜电竞职业选手。

    推荐理由:OpenAI 记录了系统在复杂电子竞技实机对战中击败职业战队的过程,展现了强化学习在长周期即时博弈中的能力边界。

8月23日周四
  1. OpenAI News72

    OpenAI Five 在 The International 2018 对阵顶尖 Dota 2 选手两局皆负

    OpenAI Five 在温哥华举行的 The International 赛事中对阵顶尖 Dota 2 选手,两场比赛均告负。在两局比赛的前 20 至 35 分钟内,OpenAI Five 均保持着良好的取胜机会。

    推荐理由:比赛结果记录了强化学习模型在复杂长线博弈中的实际对抗表现,为评估智能体决策能力提供了参考。

7月4日周三
  1. OpenAI News61

    OpenAI 仅凭单次人类演示在《蒙特祖玛的复仇》中取得 74500 分

    OpenAI 训练的智能体仅凭借单次人类演示就在游戏《蒙特祖玛的复仇》中取得 74,500 分的高分,优于此前已发表的所有结果。该方法让智能体从演示中精心挑选的状态序列开始游玩,并采用与 OpenAI Five 相同的 PPO 强化学习算法优化游戏得分。

    推荐理由:研究展示了从单个人类演示状态序列切入并结合 PPO 训练的思路,为稀疏奖励任务提供了极简的学习范式。

6月25日周一
5月3日周四
8月11日周五
  1. OpenAI News78

    OpenAI 推出 Dota 2 机器人并在 1v1 比赛中击败顶尖职业选手

    OpenAI 打造了一款在标准比赛规则下于 Dota 2 1v1 对战中击败世界顶级职业选手的机器人。该机器人完全通过自我对弈从零开始学习游戏策略,没有使用模仿学习或树搜索。这一进展旨在探索 AI 系统在涉及人类真实互动的复杂环境中完成明确目标的能力。

    推荐理由:原文展示了仅靠自我对弈训练的强化学习智能体,在不依赖模仿学习或树搜索的情况下应对复杂竞技博弈的可行路径。