OpenAI News·· 2024-12-20精选AI 评分65
OpenAI 推出审慎对齐策略:利用推理能力打造更安全的语言模型
Deliberative alignment: reasoning enables safer language models
AI 导读
OpenAI 推出面向 o1 模型的全新对齐策略“审慎对齐”(deliberative alignment),利用推理能力提升语言模型的安全性。该策略直接向模型传授安全规范,并训练其在应对潜在风险时基于这些规范进行链式推理。
推荐理由
OpenAI 阐明了面向思考型模型的新对齐机制,展示了如何借助模型自身的推理能力来理解并遵循安全规范。
来源:OpenAI News · openai.com