跳到正文
OpenAI News·· 2024-12-20精选AI 评分65

OpenAI 推出审慎对齐策略:利用推理能力打造更安全的语言模型

Deliberative alignment: reasoning enables safer language models

AI 导读

OpenAI 推出面向 o1 模型的全新对齐策略“审慎对齐”(deliberative alignment),利用推理能力提升语言模型的安全性。该策略直接向模型传授安全规范,并训练其在应对潜在风险时基于这些规范进行链式推理。

推荐理由

OpenAI 阐明了面向思考型模型的新对齐机制,展示了如何借助模型自身的推理能力来理解并遵循安全规范。

来源:OpenAI News · openai.com