跳到正文
OpenAI News·· 2025-08-07精选AI 评分63

OpenAI 探讨 GPT-5 安全补全机制,从直接拒答转向以输出为中心的安全训练

From hard refusals to safe-completions: toward output-centric safety training

AI 导读

OpenAI 介绍了在 GPT-5 中采用的全新安全补全(safe-completions)方法,旨在同时提升 AI 回复的安全性与可用性。该方案改变了过去面对双重用途提示词时直接硬性拒答的模式,转向更加细致且以输出为中心的安全训练。

推荐理由

原文介绍了针对双重用途提示词的安全训练思路,展示了从直接硬性拒答转向兼顾安全性与可用性的细粒度补全路径。

来源:OpenAI News · openai.com