跳到正文
Hugging Face Blog·· 2024-04-16精选AI 评分70

Hugging Face 上线 LiveCodeBench 代码模型评测榜单

Introducing the LiveCodeBench Leaderboard - Holistic and Contamination-Free Evaluation of Code LLMs

AI 导读

Hugging Face 上线基于 LiveCodeBench 的代码模型评测榜单,通过按时间窗口评估竞赛平台新题来检测并防止数据污染。评测题目收集自 LeetCode、AtCoder 和 CodeForces,涵盖代码生成、自我修复、代码执行与测试输出预测四个场景,统一使用 Pass@1 指标评估。

推荐理由

榜单按题目发布时间过滤以规避训练集污染,并加入自我修复与执行预测,为考察编程模型的泛化表现提供了更全面的参照。

来源:Hugging Face Blog · huggingface.co