Google DeepMind·· 2026-08-27精选AI 评分62
Google DeepMind 试点双盲 AI 评测机制
Piloting the world's first double-blind AI evaluations
AI 导读
Google DeepMind 联合新加坡 AI 安全局、OpenMined、AVERI 和 MLCommons 启动双盲 AI 评测试点,利用密码学安全环境评估专有前沿模型。该试点将 Gemini Flash Lite 置于隐私保护环境中进行机密基准测试,防止模型提前接触测试题目导致基准污染和分数虚高。技术上通过密码学隔离补充现有的零日志与合同保护,提升模型能力与安全性评测的公信力。
推荐理由
原文通过密码学隔离环境测试 Gemini Flash Lite,展示了如何在防止基准污染的同时提升专有模型评测公信力。
来源:Google DeepMind · deepmind.google