跳到正文
Hugging Face Blog·· 2024-05-24精选AI 评分60

CyberSecEval 2:大语言模型网络安全风险与能力综合评估框架

CyberSecEval 2 - A Comprehensive Evaluation Framework for Cybersecurity Risks and Capabilities of Large Language Models

AI 导读

Meta 与 Hugging Face 推出大语言模型网络安全评估框架 CyberSecEval 2 并上线排行榜,全面测试模型在生成不安全代码、提示词注入、代码解释器滥用以及自动化进攻等维度的风险表现。最新评测显示行业模型协助网络攻击的平均合规率从初版的 52% 降至 28%,但提示词注入防御仍属未解难题。目前评测代码已全部开源,支持开发者提交模型输出参与排行。

推荐理由

该框架从提示注入和代码解释器滥用等多维度量化安全风险,为开发者评估大语言模型的安全防御边界提供了具体参考。

来源:Hugging Face Blog · huggingface.co