OpenAI News·· 2023-05-31精选AI 评分80
OpenAI 通过过程监督提升数学推理能力
Improving mathematical reasoning with process supervision
AI 导读
OpenAI 训练了一个在数学问题解决上达到新 SOTA 的模型,其核心方法是对推理的每个正确步骤进行奖励(过程监督),而非仅奖励最终正确答案(结果监督)。除了性能优于结果监督外,过程监督还能直接训练模型生成符合人类认可的链式推理(chain-of-thought),具备重要的对齐价值。
推荐理由
研究对比了过程监督与结果监督在数学推理上的表现,为链式推理的对齐与模型准确率优化提供了参考路径。
来源:OpenAI News · openai.com