GPT-6 系列模型指南
OpenAI 面向初创企业推出 GPT-6 系列模型指南,指导如何选择合适的模型并调节推理力度(reasoning effort)。指南还详细介绍了优化提示词与技能(skills)、协同调度工具,以及将工作流推进至生产环境的实践方法。
OpenAI 面向初创企业推出 GPT-6 系列模型指南,指导如何选择合适的模型并调节推理力度(reasoning effort)。指南还详细介绍了优化提示词与技能(skills)、协同调度工具,以及将工作流推进至生产环境的实践方法。
AWS 推出名为 Adjudicated Query 的架构设计模式,利用 Amazon Quick 聊天界面与确定性规则引擎,对海量租约等合规数据进行可证明完整性且具备法律可抗辩性的审查。
AWS 展示了如何在 Amazon SageMaker AI 上使用多轮强化学习(MTRL)微调 Qwen3.6-27B 模型,以打造高效的企业搜索智能体。SageMaker AI MTRL 支持 Serverless 执行并内置 PPO、GRPO 等算法,使模型在受限轮次内自主调用 BM25 与向量检索工具,直接优化跨多轮交互决策。
GitHub 建议开发者重点提升指挥 AI 智能体、审查模型输出以及专注复杂决策三项核心技能。随着代码编写逐步由 AI 承担,开发者的职责正转向定义任务上下文、协调多智能体协作并把关交付质量。开发者还可借助第二模型(如 GitHub Copilot 的 Rubber Duck 智能体)交叉复核输出,并将精力投入架构权衡与深层技术决策。
ServiceNow CoreAI 推出 AutoSynthData,用于将企业 AI 智能体的能力差距转化为定向训练数据。该系统结合目标模型的失败记录与更强教师模型的成功轨迹,自动生成并验证包含系统规范、用户提示词及验证器的全新任务。随着模型能力提升,训练课程会动态转向其薄弱环节,并在 EnterpriseOps Gym 中完成了管线演示与验证。
AWS 展示了基于 Amazon Bedrock AgentCore 的四智能体架构,在 300+ 应用的企业项目中将单个应用的 IaC 开发时间从 3 至 4 周缩短至数分钟。该方案基于 Strands Agents SDK 构建并通过 MCP 工具调用连接系统,与 AWS Transform 及 AWS DMS 协同,覆盖从架构摄取、内部 IaC 生成到割接后 SRE 运维的全流程。
Amazon Quick 推出 Live Data in Apps 功能,允许 AI 构建的应用实时查询受治理的 Quick Sight 数据集,不再依赖构建时的静态快照。构建者通过自然语言提示词即可生成应用,系统会在用户每次打开时按其身份动态执行 SQL。该功能支持 SPICE 与 Direct Query 模式,并自动继承已有的行级(RLS)与列级(CLS)权限控制。
AWS 发布技术指南,详解如何将 Amazon S3 Vectors 作为持久化记忆后端接入开源框架 NVIDIA NeMo Agent Toolkit(NAT),并在 Amazon EKS 上进行容器化部署。
AWS 发布了基于 Amazon Bedrock AgentCore 构建环境智能体(ambient agents)的端到端参考实现,实现从被动对话向事件驱动主动响应的转变。
微软研究院开发了一套端到端机器学习系统,可针对美国本土 66,935 座变电站提前 30 至 60 分钟预测空间天气风险。该管线结合太阳风观测、AE 与 Dst 指数预测以及地质导电率等特征,在评估期内检测到了近 80% 的主要空间天气事件,并由 50 个 AI 智能体辅助探索特征与模型配置。
CoreWeave 宣布在云端提供搭载 Spectrum-X 102.4T 网络的 NVIDIA Vera Rubin NVL72 系统以及专为智能体打造的 Vera CPU。
Multiverse Computing 针对 MCP 智能体推出后置验证方案 ProvenanceGuard,用于解决事实成立但引用来源错误的跨源混淆问题。该方法在无需重新训练模型的情况下追踪工具输出与来源标识,将回答拆解为独立断言并分别检验支持源与归因一致性。在医疗智能体测试中其拦截 F1 达到 0.802,支持结合修复流程改写错误回答,已被整合至英伟达 NVFlow 等金融智能体工作流。
OpenAI 推出主动型助手 dots。dots 能够在复杂项目和日常任务中持续工作,帮助用户在推进工作进展的同时保持掌控。
H公司发布专为通用计算机操作打造的 Holo4 智能体模型系列,包含 27B Dense 与 35B-A3B MoE 两种规格,并同步推出轻量级模型 Holotron4 Nano。
推荐理由:展示了开源中等规模模型如何通过混合 GUI 与 API 接口调用,在桌面控制长流程任务中降低落地成本。
GitHub 介绍了在 Copilot app 中利用 canvases 构建自定义交互界面的方法。用户无需编写代码或手动设计布局,在 Agent 会话中输入 /create-canvas 技能并用自然语言描述工作流需求,即可生成看板、发布清单或仪表板等右侧面板。
GitHub 团队发文指出单一的对话框界面限制了用户与大语言模型的协作效率,并提出通过 GitHub Copilot 应用内的 Canvas 功能构建定制化交互界面。
Google Research 提出了一套用于自动化连贯长视频生成的 AI 视频协同导演多智能体框架体系,作为运行在 Gemini 和 Veo 之上的编排层,以解决多镜头叙事中的语义漂移与视觉不一致问题。
推荐理由:原文拆解了长视频生成中角色与场景漂移的成因,提供了一套通过分层智能体解耦创意与时序一致性的系统性方案。
GitHub Security Lab 发布并开源了面向 C/C++ 项目的自主模糊测试管道 Fuzzing Taskflow,可通过 LLM 智能体全流程自动完成入口识别、测试桩编写、执行与漏洞排查。
推荐理由:该工具把模糊测试的测试桩编写、覆盖率反馈与崩溃分类解构成由 MCP 工具配合的智能体循环,为代码安全自动化提供了可参考的端到端方案。
Ringg 借助 OpenAI 使其 AI 智能体能够解决高达 65% 的客户来电。通过采用 GPT-5.6,Ringg 在语音、聊天、WhatsApp 及网页端驱动多语言智能体,运行成本相比 GPT-4.1 降低了 90%。
Parallel 借助 GPT-6 Astra 驱动其 AI 智能体调研与综合劳动力市场数据。与此前模型相比,GPT-6 Astra 帮助其将数据研究与综合的时间和成本均缩减了一半。
NVIDIA 发文指出 AI 安全本质是工程问题,必须在 Agent 技术栈的模型、框架和运行时各层建立可执行的强制控制边界。系统需独立于 Agent 自身的推理逻辑来限制文件、网络与系统资源,重大操作及权限变更仍须人工审批,并配合审计日志与可复现的安全测试。同时介绍了开源安全运行时 NVIDIA OpenShell 以及与生态伙伴构建的防御验证工具。
GitHub 在最新播客中梳理并回应了 AI 开发中的五个核心争议,指出开发者仍须对生成的代码负责、Skills 与 MCP 是互补协作而非替代关系,且 RAG 仍是注入外部上下文的关键架构。
GitHub 工程团队借助 Copilot CLI 与 Copilot 应用的多智能体协同,由单名核心开发者在数月内将 Copilot agent 运行时从 TypeScript 彻底重写为超 80 万行生产级 Rust 代码。
推荐理由:文章完整公开了单人驱动多智能体舰队重写数十万行核心运行时的协作机制与防退化方案,为大规模智能体工程实践提供了参考路径。
GitHub 市场运营团队展示了如何结合 GitHub Copilot、Actions 与 Issue 表单实现“Marketing ops as code”,完成活动筹备、物料生成、报名名单筛选及会后 CRM 上传的全流程自动化。
推荐理由:文章拆解了将运营手册沉淀为 Markdown 规程并由 Copilot 执行的方案,为非纯研发团队落地智能体工作流提供了可复用的工程化模板。
Cognition 借助 GPT-6 Astra 提升了 Devin 测试软件并证明其正常运行的能力。该改进旨在帮助工程师减少代码审查工作量,从而更快交付更多代码。
Google Research 提出 ToolGrad 框架,通过先生成工具调用链再标注用户提示词的范式与文本梯度反馈,高效低成本构建复杂工具调用数据集。在基于该数据微调 Gemma-3 后,ToolGrad-12B 在 BFCL 榜单取得 83.1 分,逼近 gemini-2.5-pro(83.2)并超越 claude-4.5 Opus(82.8)与 gpt-5(74.4)。
OpenAI 在 ChatGPT Work 中推出数据智能体 Data agent。用户可通过自然语言连接企业数据、挖掘业务洞察,并借助 AI 构建交互式仪表板。
OpenAI 推出 Agents API 托管服务,支持开发者在云端构建并运行 AI 智能体。该服务基于 Codex harness 提供编排能力,支持长时间运行的会话与工具调用。
推荐理由:该 API 依托 Codex 工具链提供编排、长程会话与工具调用能力,便于开发者在云端直接部署自主智能体。
Mistral 协助欧洲能源运营商将 40,000 行 Fortran 77 遗留代码迁移至 C++,并总结了一套基于 AI 智能体的现代化改造流程。团队先搭建了以数值一致性为核心的测试框架,通过解析调用树并结合 OCR 补齐文档,最终采用包含规划、编码、测试与人类审查的结构化工作流替代完全自主运行。该实践指出数值对齐验证、前置文档整理和人机协同卡点是大规模遗留系统迁移的关键要素。
推荐理由:文章总结了遗留代码迁移的工程框架,为利用智能体改造老旧代码库提供了可复用的流程参考。
Mistral AI 推出 Agentic Search 检索层,通过多步检索循环帮助企业模型在长文档与复杂数据中定位并核验信息,已接入 Mistral Search Toolkit 及相关库。
推荐理由:针对传统单次检索处理长篇和表格易丢失上下文的问题,原文展示了借助文件系统式工具循环检索提升复杂文档精度的方案。
ABBEL 框架通过将交互摘要形式化为自然语言信念状态并引入监督评分,解决了大语言模型长周期交互中递归摘要导致的性能损耗问题。在 CollabBench 协同编程测试中,带重构评分的 ABBEL 将与全上下文模型的性能差距缩小约 50%,训练步数从 100 步减半至 50 步。同时该方案大幅削减了峰值上下文 token 长度,兼顾了推理内存效率。
伯克利 AI 研究院团队发文指出,随着大模型推理成本大幅下降,数据系统将迎来由智能体主导的范式重塑。文章梳理了面向智能体的高频推测查询优化、支撑海量智能体协同与结构化记忆的状态底座,以及由智能体全自动按需合成定制数据系统三大方向。未来数据系统将从被动查询执行器转变为与智能体深度共生且具备主动反馈能力的协作架构。
推荐理由:文章梳理了推理成本骤降后数据系统在推测执行交互、多智能体协同状态底座及专用引擎合成三方面的架构重塑路径。