OpenAI 推出 GPT-5.4 mini 与 nano
OpenAI 推出 GPT-5.4 mini 和 nano 模型,作为 GPT-5.4 的轻量高速版本。两款模型针对编码、工具调用、多模态推理以及大吞吐量 API 和子智能体工作负载进行了专门优化。
公司与模型
OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。
33 条精选近 30 天 14 条共收录 130 条
OpenAI 推出 GPT-5.4 mini 和 nano 模型,作为 GPT-5.4 的轻量高速版本。两款模型针对编码、工具调用、多模态推理以及大吞吐量 API 和子智能体工作负载进行了专门优化。
OpenAI 阐述了如何利用 Responses API、shell 工具及托管容器构建 Agent 运行环境。该方案支持运行具备文件、工具和状态的安全且可扩展的智能体,实现从单纯模型向执行环境的扩展。
推荐理由:文章给出了结合托管容器与命令行工具构建运行环境的方案,为开发者实现带状态的智能体架构提供了参考。
OpenAI 宣布以 $730B 的投前估值获得 $110B 新一轮投资。这笔资金包括来自 Amazon 的 $50B、来自 SoftBank 的 $30B 以及来自 NVIDIA 的 $30B。
推荐理由:原文披露了高额估值与具体的战略投资方构成,读者可据此了解头部云厂商和算力巨头对前沿大模型机构的资金注入规模。
OpenAI 公布了心理健康安全工作的最新进展,涵盖家长控制、受信联系人、改进情绪困境检测以及近期的诉讼动态。
OpenAI 与 Figma 联合推出全新的 Codex 集成,打通代码实现与设计画布之间的无缝衔接。该功能允许团队在具体代码实现与 Figma 画布之间自由切换,以加快产品迭代和交付节奏。
推荐理由:该集成打通了代码实现与设计画布的双向衔接,有助于产研团队缩短从前端代码到设计原型的往返周期。
OpenAI 宣布停止使用 SWE-bench Verified 评估模型,指出该基准日益严重的数据污染导致其无法准确衡量前沿编码进展。内部分析显示该基准存在测试缺陷与训练数据泄漏问题,官方建议改用 SWE-bench Pro 进行评测。
推荐理由:OpenAI 分析了 SWE-bench Verified 的数据污染与测试缺陷,并转向推荐 SWE-bench Pro 作为前沿编程能力的评估参考。
OpenAI 宣布使用 GPT-4 自动编写大语言模型中神经元行为的解释并对解释进行打分。同时,官方公开发布了针对 GPT-2 每个神经元的解释与评分数据集。
推荐理由:OpenAI 尝试用 GPT-4 自动化解释和评估网络内部神经元,为利用大模型开展可解释性研究提供了具体落地思路。
OpenAI 训练并推出了对话模型 ChatGPT,该模型采用对话形式与用户交互。对话格式使其能够回答后续追问、承认自身错误、质疑不正确的前提,并拒绝不合理的请求。
推荐理由:官方介绍了对话交互机制的核心特性,读者可以了解模型在处理追问、承认错误与拒绝不当请求上的交互设计。
OpenAI 为 DALL·E 推出 Outpainting 功能。该功能允许用户在原有画面基础上向外延伸扩展,生成任意尺寸的图像以展现更宏大的视觉内容。
OpenAI 研究表明 CNN、ResNet 和 Transformer 架构中普遍存在双重下降现象,模型性能随着模型尺寸、数据量或训练时间的增加,会呈现先提升、后恶化、再重新提升的变化趋势。该效应通常可通过精细的正则化手段来避免。团队指出这一现象虽然普遍存在,但底层机制尚未完全明确,仍是重要的研究方向。
推荐理由:原文展示了模型规模与泛化性能之间非单调变化的规律,为理解深度学习训练机制与正则化调优提供了理论参考。
OpenAI 宣布其由五个神经网络组成的 AI 团队 OpenAI Five 已开始在 Dota 2 比赛中击败业余人类战队。
OpenAI 发布关于 AI 与算力的分析指出,自 2012 年以来最大 AI 训练运行所使用的算力呈指数级增长,翻倍周期约为 3.4 个月。相比摩尔定律 2 年的翻倍周期,该指标自 2012 年起已增长超过 300,000 倍,而 2 年翻倍仅能带来 7 倍增幅。OpenAI 表示算力提升是 AI 进步的关键动力,行业需为能力远超当前水平的系统做好准备。
推荐理由:该分析量化了训练算力以 3.4 个月为周期的翻倍速度,为理解前沿模型演进提供了基准参照。
OpenAI 宣布作为一家非营利人工智能研究机构成立,其核心目标是在不受财务回报约束的前提下推进数字智能,从而造福全人类。该机构表示,摆脱财务义务能让其研究团队更专注于对人类产生积极影响。
推荐理由:原文说明了机构创立初期的非营利属性,有助于读者了解其摆脱财务约束以专注人类福祉的背景设定。