OpenAI News·· 2019-09-19精选AI 评分74
OpenAI 基于人类偏好微调 GPT-2 语言模型
Fine-tuning GPT-2 from human preferences
AI 导读
OpenAI 使用人类反馈微调了 774M 参数的 GPT-2 语言模型,成功契合了外部人类标注者的偏好。在文本摘要任务中,因标注者偏好准确性而倾向选择原句,模型最终学会直接复制原文,该任务共使用了 60k 条人类标注,而文本风格续写任务仅需 5k 条。此项研究旨在推进面向人机交互通用任务的安全技术,以更好地提取人类价值偏好。
推荐理由
这项研究展示了利用人类反馈微调模型的早期实验,揭示了标注者偏好偏差对模型生成行为的直接影响。
来源:OpenAI News · openai.com