AWS 推出 Adjudicated Query 设计模式:结合 Amazon Quick 与 MCP 实现可审计合规审查
AWS 推出名为 Adjudicated Query 的架构设计模式,利用 Amazon Quick 聊天界面与确定性规则引擎,对海量租约等合规数据进行可证明完整性且具备法律可抗辩性的审查。
AWS 推出名为 Adjudicated Query 的架构设计模式,利用 Amazon Quick 聊天界面与确定性规则引擎,对海量租约等合规数据进行可证明完整性且具备法律可抗辩性的审查。
NVIDIA 宣布 DGX Spark 个人 AI 超算推出 64GB 统一内存版本,起售价 4,999 美元,将于 10 月 23 日通过宏碁、华硕、戴尔、技嘉、惠普和微星等合作伙伴发售。
推荐理由:该硬件配置降低了本地运行百亿参数智能体的部署门槛,两台直连组网扩展的设计为端侧算力扩容提供了参考。
OpenAI 的 GPT-6 Astra Ultrafast 正式在 API 以及符合条件的 ChatGPT Work 和 Codex 中上线,基于 NVIDIA Blackwell GPU 运行。该模式相比 Astra Standard 的 token 生成速度最高提升 8 倍,显著缩短了编码智能体在编辑、测试与调试循环以及工具调用之间的响应等待时间。
推荐理由:文章介绍了基于硬件架构的推理优化细节,有助于读者评估生成加速对编码智能体与工具调用延迟的具体影响。
AWS 展示了基于 Amazon Bedrock AgentCore 的四智能体架构,在 300+ 应用的企业项目中将单个应用的 IaC 开发时间从 3 至 4 周缩短至数分钟。该方案基于 Strands Agents SDK 构建并通过 MCP 工具调用连接系统,与 AWS Transform 及 AWS DMS 协同,覆盖从架构摄取、内部 IaC 生成到割接后 SRE 运维的全流程。
AWS 发布技术指南,详解如何将 Amazon S3 Vectors 作为持久化记忆后端接入开源框架 NVIDIA NeMo Agent Toolkit(NAT),并在 Amazon EKS 上进行容器化部署。
Amazon Payments 团队分享了在 Amazon SageMaker AI 上基于多目标上下文多臂老虎机(LinUCB)优化获客转化漏斗的落地实践。该方案为开始、提交与审批三个阶段分别构建模型并通过加权线性组合打分,有效避免了单一阶段优化引发的转化率跷跷板问题。
AWS 发布了基于 Amazon Bedrock AgentCore 构建环境智能体(ambient agents)的端到端参考实现,实现从被动对话向事件驱动主动响应的转变。
NVIDIA 阐明其 AI 工厂通过高生产力、耐用性和通用性最大化投资回报率。SemiAnalysis AgentX 数据显示,在 DeepSeek V4 Pro 模型上,Vera Rubin NVL72 每兆瓦吞吐量是 GB300 NVL72 的 30 倍以上,每百万 token 成本降低达 45 倍。
CoreWeave 宣布在云端提供搭载 Spectrum-X 102.4T 网络的 NVIDIA Vera Rubin NVL72 系统以及专为智能体打造的 Vera CPU。
Liquid AI 发布用于视觉语言模型 LFM2.5-VL-3B 的投机解码草稿模型 LFM2.5-VL-DSpark。该模型仅增加 280M 参数(8.9%),在保持输出质量的同时,使端侧解码速度最高提升 3.13x(端到端提升 2.62x),H100 解码最高加速 2.66x。模型开源权重已在 Hugging Face 发布,首日支持 llama.cpp、MLX-VLM 与 SGLang。
微软研究院发布具身智能推理卸载系统研究,指出将物理 AI 推理从机器人板载 GPU 卸载至边缘或云端能显著改善任务表现并大幅延长续航。实测显示,较小算力的板载 GPU 会使建图规划变慢高达 383% 并导致 VLA 模型准确率下降 50%,而换用轻量硬件加远程卸载可避免大功率 GPU 对电池的损耗。
推荐理由:微软通过实测对比了板载与云边协同推理的性能与功耗,为具身智能系统打破全板载硬件依赖提供了工程参考。
Google 宣布升级 Private AI Compute 架构,引入安全的服务端持久记忆层,在保持端侧隐私标准的同时为 AI 助手提供跨设备的连续记忆能力。该方案结合硬件安全飞地与端到端加密通道,解密密钥完全保留在用户个人设备上,数据在隔离内存处理并即时加密,确保包括 Google 在内的外部各方皆无法访问。团队同步公开了防篡改服务端软件记录与第三方安全审计结果,供社区独立验证。
推荐理由:该方案展示了结合硬件安全飞地与本地密钥管理兼顾云端大模型算力与隐私持久记忆的技术实现路径。
NVIDIA 验证工程师 Sakeena Fiza 负责数据中心系统验证,确保硬件在量产和部署至 AI 工厂前具备系统级可靠性。她曾参与 NVIDIA Rubin GPU 的系统级首次启动调试,验证流程涵盖从托盘、机架到集群的极限压力测试。团队需针对单机架近 50 万个组件排查高速信号、散热及固件等软硬件故障,在交付客户前排除隐患。
NVIDIA 发文指出 AI 安全本质是工程问题,必须在 Agent 技术栈的模型、框架和运行时各层建立可执行的强制控制边界。系统需独立于 Agent 自身的推理逻辑来限制文件、网络与系统资源,重大操作及权限变更仍须人工审批,并配合审计日志与可复现的安全测试。同时介绍了开源安全运行时 NVIDIA OpenShell 以及与生态伙伴构建的防御验证工具。
GitHub 工程团队借助 Copilot CLI 与 Copilot 应用的多智能体协同,由单名核心开发者在数月内将 Copilot agent 运行时从 TypeScript 彻底重写为超 80 万行生产级 Rust 代码。
推荐理由:文章完整公开了单人驱动多智能体舰队重写数十万行核心运行时的协作机制与防退化方案,为大规模智能体工程实践提供了参考路径。
NVIDIA 在 MLPerf Inference v6.1 评测中首次展示 Vera Rubin NVL72 系统性能,在 Qwen3-VL 基准测试中吞吐量最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高提升 2.5 倍。
GitHub 市场运营团队展示了如何结合 GitHub Copilot、Actions 与 Issue 表单实现“Marketing ops as code”,完成活动筹备、物料生成、报名名单筛选及会后 CRM 上传的全流程自动化。
推荐理由:文章拆解了将运营手册沉淀为 Markdown 规程并由 Copilot 执行的方案,为非纯研发团队落地智能体工作流提供了可复用的工程化模板。
OpenAI 介绍了如何将其存储平台 Habitat 从一个 Python 库演进为全球分布式存储架构。该平台目前支撑着超过 10 亿 ChatGPT 用户,并能处理每秒 2200 万次请求。
Mistral 与 Cloudera 宣布达成合作,将 Mistral 模型集成至 Cloudera 混合数据平台,为企业提供主权 AI 解决方案。企业可在公有云、私有云、本地及完全物理隔离(air-gapped)环境中部署模型推理,并利用自有专有数据训练定制模型。该合作覆盖 Cloudera 平台上管理的 30 exabytes 客户数据,确保企业全面掌控数据与智能资产所有权。
Mistral正式上线区域端点(Regional Endpoints)并开启优先层(Priority Tier)公测,支持客户自主选择在欧洲或美国运行推理,以满足数据驻留与合规要求。平台同时开始托管第三方开源模型(首发支持 Z.ai 的 GLM-5.2),并联合多家企业组建算力联盟,通过欧洲算力单元(ECUs)模式推进至2030年建设最高 1 GW 算力基础设施的长期计划。
扩展后的内核搜索框架 K-Search 引入结构化 CUDA 到 MLX 转译层,能将成熟的 GPU 内核优化经验自动迁移至 Apple Silicon。该系统由 Gemini 3.5 Pro Preview 执行优化推理并生成代码,在真实硬件上闭环迭代。
伯克利 AI 研究院团队发文指出,随着大模型推理成本大幅下降,数据系统将迎来由智能体主导的范式重塑。文章梳理了面向智能体的高频推测查询优化、支撑海量智能体协同与结构化记忆的状态底座,以及由智能体全自动按需合成定制数据系统三大方向。未来数据系统将从被动查询执行器转变为与智能体深度共生且具备主动反馈能力的协作架构。
推荐理由:文章梳理了推理成本骤降后数据系统在推测执行交互、多智能体协同状态底座及专用引擎合成三方面的架构重塑路径。
伯克利人工智能研究实验室(BAIR)发表博文,系统综述自适应并行推理(APR)这一推理解析范式。该范式让模型自主决定何时拆分子任务、并发启动多少分支以及如何汇聚结果,以缓解长串行推理带来的上下文腐化与高延迟问题。
推荐理由:文章系统梳理了自适应并行推理的技术路线,比较了引擎修改与客户端编排两种实现方案及奖励设计。