OpenAI 通过过程监督提升数学推理能力
OpenAI 训练了一个在数学问题解决上达到新 SOTA 的模型,其核心方法是对推理的每个正确步骤进行奖励(过程监督),而非仅奖励最终正确答案(结果监督)。除了性能优于结果监督外,过程监督还能直接训练模型生成符合人类认可的链式推理(chain-of-thought),具备重要的对齐价值。
推荐理由:研究对比了过程监督与结果监督在数学推理上的表现,为链式推理的对齐与模型准确率优化提供了参考路径。
公司与模型
OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。
258 条精选近 30 天 18 条共收录 963 条
OpenAI 训练了一个在数学问题解决上达到新 SOTA 的模型,其核心方法是对推理的每个正确步骤进行奖励(过程监督),而非仅奖励最终正确答案(结果监督)。除了性能优于结果监督外,过程监督还能直接训练模型生成符合人类认可的链式推理(chain-of-thought),具备重要的对齐价值。
推荐理由:研究对比了过程监督与结果监督在数学推理上的表现,为链式推理的对齐与模型准确率优化提供了参考路径。
OpenAI 正式推出 iOS 版 ChatGPT 官方应用。该应用支持跨设备同步对话历史,支持语音输入,并将最新的模型改进直接带到移动端。
推荐理由:官方推出了 ChatGPT 的 iOS 应用,支持跨设备同步对话与语音输入,方便用户在移动端直接调用最新模型。
OpenAI 宣布使用 GPT-4 自动编写大语言模型中神经元行为的解释并对解释进行打分。同时,官方公开发布了针对 GPT-2 每个神经元的解释与评分数据集。
推荐理由:OpenAI 尝试用 GPT-4 自动化解释和评估网络内部神经元,为利用大模型开展可解释性研究提供了具体落地思路。
ChatGPT 用户现可关闭聊天历史记录。该功能允许用户自主选择哪些对话可以被用于训练 OpenAI 的模型。
推荐理由:用户可以直接掌控自身会话数据是否用于模型训练,为重视隐私与数据安全的使用场景提供了基础控制选项。
OpenAI 发布 3 月 20 日 ChatGPT 服务中断事件的调查更新,说明了团队目前的排查发现、已采取的应对措施以及导致该漏洞的技术细节。
OpenAI 宣布在 ChatGPT 中初步支持插件功能。该插件是专为语言模型设计的工具,以安全为核心原则,可帮助 ChatGPT 获取最新信息、运行计算或调用第三方服务。
推荐理由:插件机制让大语言模型能够调用外部服务与实时数据,为扩展对话系统的应用场景与功能边界提供了实践参考。
OpenAI 正式发布大型多模态模型 GPT-4,支持图像和文本输入并生成文本输出。官方表示该模型虽然在许多现实场景中仍逊于人类,但在多项专业和学术基准测试中展现出了人类水平的表现。
推荐理由:官方说明了模型支持图像与文本双模态输入,读者可以据此了解其能力形态和基准测试定位。
OpenAI 宣布为 ChatGPT 推出名为 ChatGPT Plus 的试运行订阅计划。ChatGPT 作为对话式 AI,支持与用户交流、回答追问并指出错误的前提假设。
OpenAI 宣布推出一款经过训练的全新分类器,旨在区分 AI 编写的文本与人类撰写的文本。
OpenAI 官方宣布与微软延长合作伙伴关系。目前简报仅确认双方将继续推进合作,未公布更多具体细节。
OpenAI 训练并推出了对话模型 ChatGPT,该模型采用对话形式与用户交互。对话格式使其能够回答后续追问、承认自身错误、质疑不正确的前提,并拒绝不合理的请求。
推荐理由:官方介绍了对话交互机制的核心特性,读者可以了解模型在处理追问、承认错误与拒绝不当请求上的交互设计。
OpenAI 宣布 DALL·E API 即日起正式进入公开测试阶段(public beta)。开发者现已可以通过该 API 将图像生成能力接入并构建自己的应用程序。
OpenAI 宣布 DALL·E 正式取消候补名单限制,新用户无需排队即可直接开始创作。官方表示,实际部署中积累的经验以及安全系统的改进使得更大范围的开放成为可能。
OpenAI 训练并开源了一款名为 Whisper 的神经网络模型。该模型在英语语音识别任务上的鲁棒性和准确率接近人类水平。
推荐理由:原文给出了官方开源语音识别模型的核心能力定位,读者可借此了解其在英语语音识别鲁棒性上的基准表现。
OpenAI 为 DALL·E 推出 Outpainting 功能。该功能允许用户在原有画面基础上向外延伸扩展,生成任意尺寸的图像以展现更宏大的视觉内容。
OpenAI 推出全新升级的内容审核工具 Moderation 端点。该端点改进了此前的审核过滤器,现已面向 OpenAI API 开发者免费开放。
OpenAI 宣布 DALL·E 进入 Beta 测试阶段,将在未来数周内向等待名单中的 100 万名用户发放邀请。用户每月可使用自动补充的免费积分进行生成,也可以按 15 美元购买 115 次生成额度的额外积分。
推荐理由:原文明确了测试版的放量规模与计费规则,读者可以据此了解其早期商业化尝试与使用门槛。
OpenAI 发布了 GPT-3 和 Codex 的新版本,新增在现有文本中编辑或插入内容的能力。以往模型仅支持单向补全已有文本,此次更新允许直接对现有内容进行修改与填充。
推荐理由:新版本将能力从单纯续写补全扩展到对已有文本进行编辑与插入,改变了以往只能单向生成内容的方式。
OpenAI 为交互式定理证明器 Lean 构建了一个神经定理证明器,能够求解多种具有挑战性的高中奥数题目。该系统涵盖了来自 AMC12 和 AIME 竞赛的题目,并成功求解了两道改编自国际数学奥林匹克(IMO)的题目。
推荐理由:原文给出了形式化数学证明器的解题范围,展示了神经网络在奥数级定理证明中的可行性。
OpenAI 推出 InstructGPT 模型并将其部署为 API 的默认语言模型,相比 GPT-3 能够更好遵循用户意图。该模型结合了对齐研究成果并引入人类在回路训练,在提升内容真实性的同时降低了输出毒性。
推荐理由:说明了 InstructGPT 如何通过对齐技术改善指令遵循能力,并直接替代原有基础模型成为接口默认选项。