OpenAI News·· 2025-08-07精选AI 评分63
OpenAI 探讨 GPT-5 安全补全机制,从直接拒答转向以输出为中心的安全训练
From hard refusals to safe-completions: toward output-centric safety training
AI 导读
OpenAI 介绍了在 GPT-5 中采用的全新安全补全(safe-completions)方法,旨在同时提升 AI 回复的安全性与可用性。该方案改变了过去面对双重用途提示词时直接硬性拒答的模式,转向更加细致且以输出为中心的安全训练。
推荐理由
原文介绍了针对双重用途提示词的安全训练思路,展示了从直接硬性拒答转向兼顾安全性与可用性的细粒度补全路径。
来源:OpenAI News · openai.com