Hugging Face Blog·· 2023-06-23精选AI 评分68
Hugging Face 详解 Open LLM Leaderboard 的 MMLU 评测差异与实现细节
What's going on with the Open LLM Leaderboard?
AI 导读
Hugging Face 发文解释了 Open LLM Leaderboard 榜单上 LLaMA 等模型的 MMLU 得分显著低于原论文报告数据的原因。核心差异来自原始代码、Stanford HELM 与 EleutherAI Harness 三种评测实现之间在提示词格式及概率提取逻辑上的不同,导致同一模型在同一数据集上的绝对得分可产生近 30% 的差距并改变排名。
推荐理由
文章通过对比三套实现揭示了提示词与概率提取机制对基准评测的剧烈影响,为读者解读大模型论文和榜单指标提供了校准参考。
来源:Hugging Face Blog · huggingface.co