跳到正文
Hugging Face Blog·· 2025-02-14精选AI 评分69

Hugging Face 使用 Math-Verify 修复 Open LLM 榜单数学评测并重跑全部模型

Fixing Open LLM Leaderboard with Math-Verify

AI 导读

Hugging Face 宣布在 Open LLM Leaderboard 中引入 Math-Verify 验证工具,彻底重新评测了此前提交的全部 3,751 款大语言模型,解决了旧评测流程因格式匹配脆弱和 SymPy 符号解析缺陷导致的误判低估问题。

推荐理由

原文展示了因答案提取和符号解析缺陷导致的评分失真,为大模型数学评测实践和榜单排名修正提供了具体参考。

来源:Hugging Face Blog · huggingface.co