跳到正文

技术方向

安全对齐 最新动态

AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。

23 条精选近 30 天 4 条共收录 94 条

更新

精选归档 · 第 2 页

10月1日周二第 21–23 条
  1. OpenAI News61

    OpenAI 封禁涉嫌关联伊朗黑客组织 CyberAv3ngers 的账号

    OpenAI 封禁了疑似属于与伊朗相关黑客组织 CyberAv3ngers 的账号。调查发现,相关账号利用 AI 技术研究工业控制系统、默认凭据以及潜在攻击目标。

    推荐理由:原文通报了针对工业控制系统等目标的恶意利用行为与处置,读者可据此了解大模型在网络侦察中的潜在风险。

5月9日周二
9月19日周四
  1. OpenAI News74

    OpenAI 基于人类偏好微调 GPT-2 语言模型

    OpenAI 使用人类反馈微调了 774M 参数的 GPT-2 语言模型,成功契合了外部人类标注者的偏好。在文本摘要任务中,因标注者偏好准确性而倾向选择原句,模型最终学会直接复制原文,该任务共使用了 60k 条人类标注,而文本风格续写任务仅需 5k 条。此项研究旨在推进面向人机交互通用任务的安全技术,以更好地提取人类价值偏好。

    推荐理由:这项研究展示了利用人类反馈微调模型的早期实验,揭示了标注者偏好偏差对模型生成行为的直接影响。