跳到正文
Hugging Face Blog·· 2024-06-18精选AI 评分62

BigCodeBench 代码评测基准发布:面向多样化函数调用与复杂指令

BigCodeBench: The Next Generation of HumanEval

AI 导读

BigCodeBench 代码评测基准正式发布,包含 1,140 个函数级编程任务,要求大模型调用来自 139 个库的函数解决复杂问题,平均分支覆盖率达 99%。

推荐理由

针对 HumanEval 过于简单和数据污染问题,BigCodeBench 引入了 139 个 Python 库的函数调用任务以反映真实编程能力。

来源:Hugging Face Blog · huggingface.co