跳到正文
今天10月3日周六1 条
10月2日周五
  1. NVIDIA Blog79

    NVIDIA GPU 如何加速 OpenAI 的 GPT-6 Astra Ultrafast

    OpenAI 的 GPT-6 Astra Ultrafast 正式在 API 以及符合条件的 ChatGPT Work 和 Codex 中上线,基于 NVIDIA Blackwell GPU 运行。该模式相比 Astra Standard 的 token 生成速度最高提升 8 倍,显著缩短了编码智能体在编辑、测试与调试循环以及工具调用之间的响应等待时间。

    推荐理由:文章介绍了基于硬件架构的推理优化细节,有助于读者评估生成加速对编码智能体与工具调用延迟的具体影响。

  2. AWS Machine Learning Blog43

    基于 Amazon Bedrock AgentCore 智能体 AI 规模化扩展云迁移

    AWS 展示了基于 Amazon Bedrock AgentCore 的四智能体架构,在 300+ 应用的企业项目中将单个应用的 IaC 开发时间从 3 至 4 周缩短至数分钟。该方案基于 Strands Agents SDK 构建并通过 MCP 工具调用连接系统,与 AWS Transform 及 AWS DMS 协同,覆盖从架构摄取、内部 IaC 生成到割接后 SRE 运维的全流程。

10月1日周四
9月30日周三
9月29日周二
  1. MIT Technology Review · AI25

    让 AI 成为资产而非支出

    随着企业 AI 从零散试验转向常态化生产,按 token 调用的弹性计费正面临成本预测难题,促使企业评估投资自主算力的可行性。德勤调查显示,至少 40% 的 AI 项目进入生产的企业比例预计在六个月内翻倍,智能体与知识检索等常驻工作流带来了持续需求。企业须结合实际负载测算利用率临界点,通过保障算力高效运转将 AI 转化为可控的战略资产。

9月24日周四
  1. Hugging Face Blog45

    用 LFM2.5-VL-DSpark 加速视觉语言模型推理

    Liquid AI 发布用于视觉语言模型 LFM2.5-VL-3B 的投机解码草稿模型 LFM2.5-VL-DSpark。该模型仅增加 280M 参数(8.9%),在保持输出质量的同时,使端侧解码速度最高提升 3.13x(端到端提升 2.62x),H100 解码最高加速 2.66x。模型开源权重已在 Hugging Face 发布,首日支持 llama.cpp、MLX-VLM 与 SGLang。

  2. Microsoft Research60

    微软研究院提出物理 AI 机器人推理卸载架构,大幅提升任务表现与续航

    微软研究院发布具身智能推理卸载系统研究,指出将物理 AI 推理从机器人板载 GPU 卸载至边缘或云端能显著改善任务表现并大幅延长续航。实测显示,较小算力的板载 GPU 会使建图规划变慢高达 383% 并导致 VLA 模型准确率下降 50%,而换用轻量硬件加远程卸载可避免大功率 GPU 对电池的损耗。

    推荐理由:微软通过实测对比了板载与云边协同推理的性能与功耗,为具身智能系统打破全板载硬件依赖提供了工程参考。

  3. Google DeepMind61

    Google 升级 Private AI Compute 架构,引入服务端安全持久记忆

    Google 宣布升级 Private AI Compute 架构,引入安全的服务端持久记忆层,在保持端侧隐私标准的同时为 AI 助手提供跨设备的连续记忆能力。该方案结合硬件安全飞地与端到端加密通道,解密密钥完全保留在用户个人设备上,数据在隔离内存处理并即时加密,确保包括 Google 在内的外部各方皆无法访问。团队同步公开了防篡改服务端软件记录与第三方安全审计结果,供社区独立验证。

    推荐理由:该方案展示了结合硬件安全飞地与本地密钥管理兼顾云端大模型算力与隐私持久记忆的技术实现路径。

9月23日周三
  1. NVIDIA Blog25

    Sakeena Fiza 助力 NVIDIA 硬件实现规模化成功

    NVIDIA 验证工程师 Sakeena Fiza 负责数据中心系统验证,确保硬件在量产和部署至 AI 工厂前具备系统级可靠性。她曾参与 NVIDIA Rubin GPU 的系统级首次启动调试,验证流程涵盖从托盘、机架到集群的极限压力测试。团队需针对单机架近 50 万个组件排查高速信号、散热及固件等软硬件故障,在交付客户前排除隐患。

9月21日周一
  1. NVIDIA Blog54

    NVIDIA 阐述如何解决 Agent 全栈安全工程问题

    NVIDIA 发文指出 AI 安全本质是工程问题,必须在 Agent 技术栈的模型、框架和运行时各层建立可执行的强制控制边界。系统需独立于 Agent 自身的推理逻辑来限制文件、网络与系统资源,重大操作及权限变更仍须人工审批,并配合审计日志与可复现的安全测试。同时介绍了开源安全运行时 NVIDIA OpenShell 以及与生态伙伴构建的防御验证工具。

9月17日周四
  1. GitHub Blog · AI & ML81

    GitHub 如何用 Copilot 将 Copilot 运行时重写为 Rust

    GitHub 工程团队借助 Copilot CLI 与 Copilot 应用的多智能体协同,由单名核心开发者在数月内将 Copilot agent 运行时从 TypeScript 彻底重写为超 80 万行生产级 Rust 代码。

    推荐理由:文章完整公开了单人驱动多智能体舰队重写数十万行核心运行时的协作机制与防退化方案,为大规模智能体工程实践提供了参考路径。

9月16日周三
9月12日周六
  1. GitHub Blog · AI & ML63

    GitHub 团队实践:结合 Copilot 与 Actions 将市场活动运营自动化

    GitHub 市场运营团队展示了如何结合 GitHub Copilot、Actions 与 Issue 表单实现“Marketing ops as code”,完成活动筹备、物料生成、报名名单筛选及会后 CRM 上传的全流程自动化。

    推荐理由:文章拆解了将运营手册沉淀为 Markdown 规程并由 Copilot 执行的方案,为非纯研发团队落地智能体工作流提供了可复用的工程化模板。

9月11日周五
9月10日周四
  1. Mistral AI39

    Cloudera 与 Mistral 达成合作,为企业数据引入专业主权智能

    Mistral 与 Cloudera 宣布达成合作,将 Mistral 模型集成至 Cloudera 混合数据平台,为企业提供主权 AI 解决方案。企业可在公有云、私有云、本地及完全物理隔离(air-gapped)环境中部署模型推理,并利用自有专有数据训练定制模型。该合作覆盖 Cloudera 平台上管理的 30 exabytes 客户数据,确保企业全面掌控数据与智能资产所有权。

8月11日周二
  1. Mistral AI51

    Mistral推出区域推理端点与优先层,构建欧洲主权AI基础设施

    Mistral正式上线区域端点(Regional Endpoints)并开启优先层(Priority Tier)公测,支持客户自主选择在欧洲或美国运行推理,以满足数据驻留与合规要求。平台同时开始托管第三方开源模型(首发支持 Z.ai 的 GLM-5.2),并联合多家企业组建算力联盟,通过欧洲算力单元(ECUs)模式推进至2030年建设最高 1 GW 算力基础设施的长期计划。

7月29日周三
7月7日周二
  1. Berkeley AI Research64

    伯克利 BAIR 探讨近乎免费智能时代下数据系统的三大演进方向

    伯克利 AI 研究院团队发文指出,随着大模型推理成本大幅下降,数据系统将迎来由智能体主导的范式重塑。文章梳理了面向智能体的高频推测查询优化、支撑海量智能体协同与结构化记忆的状态底座,以及由智能体全自动按需合成定制数据系统三大方向。未来数据系统将从被动查询执行器转变为与智能体深度共生且具备主动反馈能力的协作架构。

    推荐理由:文章梳理了推理成本骤降后数据系统在推测执行交互、多智能体协同状态底座及专用引擎合成三方面的架构重塑路径。

5月8日周五
  1. Berkeley AI Research64

    BAIR 综述自适应并行推理:推理解析与扩展新范式

    伯克利人工智能研究实验室(BAIR)发表博文,系统综述自适应并行推理(APR)这一推理解析范式。该范式让模型自主决定何时拆分子任务、并发启动多少分支以及如何汇聚结果,以缓解长串行推理带来的上下文腐化与高延迟问题。

    推荐理由:文章系统梳理了自适应并行推理的技术路线,比较了引擎修改与客户端编排两种实现方案及奖励设计。