OpenAI 封禁涉嫌关联伊朗黑客组织 CyberAv3ngers 的账号
OpenAI 封禁了疑似属于与伊朗相关黑客组织 CyberAv3ngers 的账号。调查发现,相关账号利用 AI 技术研究工业控制系统、默认凭据以及潜在攻击目标。
推荐理由:原文通报了针对工业控制系统等目标的恶意利用行为与处置,读者可据此了解大模型在网络侦察中的潜在风险。
技术方向
AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。
23 条精选近 30 天 4 条共收录 94 条
OpenAI 封禁了疑似属于与伊朗相关黑客组织 CyberAv3ngers 的账号。调查发现,相关账号利用 AI 技术研究工业控制系统、默认凭据以及潜在攻击目标。
推荐理由:原文通报了针对工业控制系统等目标的恶意利用行为与处置,读者可据此了解大模型在网络侦察中的潜在风险。
OpenAI 宣布使用 GPT-4 自动编写大语言模型中神经元行为的解释并对解释进行打分。同时,官方公开发布了针对 GPT-2 每个神经元的解释与评分数据集。
推荐理由:OpenAI 尝试用 GPT-4 自动化解释和评估网络内部神经元,为利用大模型开展可解释性研究提供了具体落地思路。
OpenAI 使用人类反馈微调了 774M 参数的 GPT-2 语言模型,成功契合了外部人类标注者的偏好。在文本摘要任务中,因标注者偏好准确性而倾向选择原句,模型最终学会直接复制原文,该任务共使用了 60k 条人类标注,而文本风格续写任务仅需 5k 条。此项研究旨在推进面向人机交互通用任务的安全技术,以更好地提取人类价值偏好。
推荐理由:这项研究展示了利用人类反馈微调模型的早期实验,揭示了标注者偏好偏差对模型生成行为的直接影响。