在 Amazon SageMaker AI 上使用多轮强化学习微调搜索智能体
AWS 展示了如何在 Amazon SageMaker AI 上使用多轮强化学习(MTRL)微调 Qwen3.6-27B 模型,以打造高效的企业搜索智能体。SageMaker AI MTRL 支持 Serverless 执行并内置 PPO、GRPO 等算法,使模型在受限轮次内自主调用 BM25 与向量检索工具,直接优化跨多轮交互决策。
AWS 展示了如何在 Amazon SageMaker AI 上使用多轮强化学习(MTRL)微调 Qwen3.6-27B 模型,以打造高效的企业搜索智能体。SageMaker AI MTRL 支持 Serverless 执行并内置 PPO、GRPO 等算法,使模型在受限轮次内自主调用 BM25 与向量检索工具,直接优化跨多轮交互决策。
Ai2 开源了基于 Qwen3-8B 打造的科学报告生成模型 AstaBrief 8B 及其训练数据与工作流,该模型已作为快速模式上线科学智能体平台 Asta。
推荐理由:原文展示了用引文密度过滤搭配简单微调替代复杂强化学习的训练实践,为垂直领域报告生成提供了轻量高效的参考范式。
ServiceNow CoreAI 推出 AutoSynthData,用于将企业 AI 智能体的能力差距转化为定向训练数据。该系统结合目标模型的失败记录与更强教师模型的成功轨迹,自动生成并验证包含系统规范、用户提示词及验证器的全新任务。随着模型能力提升,训练课程会动态转向其薄弱环节,并在 EnterpriseOps Gym 中完成了管线演示与验证。
NVIDIA 阐明其 AI 工厂通过高生产力、耐用性和通用性最大化投资回报率。SemiAnalysis AgentX 数据显示,在 DeepSeek V4 Pro 模型上,Vera Rubin NVL72 每兆瓦吞吐量是 GB300 NVL72 的 30 倍以上,每百万 token 成本降低达 45 倍。
Google Research 提出 ToolGrad 框架,通过先生成工具调用链再标注用户提示词的范式与文本梯度反馈,高效低成本构建复杂工具调用数据集。在基于该数据微调 Gemma-3 后,ToolGrad-12B 在 BFCL 榜单取得 83.1 分,逼近 gemini-2.5-pro(83.2)并超越 claude-4.5 Opus(82.8)与 gpt-5(74.4)。
Google 研究人员通过评估英国生物样本库(UKB)向日本生物样本库(BBJ)迁移的 8 种临床表型,探索多基因风险评分(PRS)跨人群预测规律。实验显示,当目标人群样本量极小(如 5,000 例)时合并欧洲数据可提升准确率,但样本达 15,000 例或以上时,目标人群专用模型表现反超联合训练。遗传相关性高的保守性状能在大样本下持续获益,而血脂和血糖等群体特异性状获益衰减更快。