跳到正文
Hugging Face Blog·· 2023-06-12精选AI 评分71

Hugging Face 评测基础模型标注能力:GPT-4 评估存在显著偏见

Can foundation models label data like humans?

AI 导读

Hugging Face 联合 Scale AI 开展实验,测试基础模型能否像人类一样评估大模型输出偏好,发现 GPT-4 存在明显的位置偏见与偏爱长回复的长度偏见,甚至将人类示范样本排在多个开源模型之后。实验显示 GPT-4 与人类标注在头脑风暴等创意任务上相关性达 0.60,但在代码生成与事实问答等任务上相关性显著降低。

推荐理由

原文对比了人类与 GPT-4 对开源模型的偏好打分,指出了位置与长度偏见对评估有效性的实际干扰。

来源:Hugging Face Blog · huggingface.co