Hugging Face Blog·· 2025-02-14精选AI 评分69
Hugging Face 使用 Math-Verify 修复 Open LLM 榜单数学评测并重跑全部模型
Fixing Open LLM Leaderboard with Math-Verify
AI 导读
Hugging Face 宣布在 Open LLM Leaderboard 中引入 Math-Verify 验证工具,彻底重新评测了此前提交的全部 3,751 款大语言模型,解决了旧评测流程因格式匹配脆弱和 SymPy 符号解析缺陷导致的误判低估问题。
推荐理由
原文展示了因答案提取和符号解析缺陷导致的评分失真,为大模型数学评测实践和榜单排名修正提供了具体参考。
来源:Hugging Face Blog · huggingface.co