← 返回信息流

精选Google DeepMind Blog新闻

全球首次双盲AI评估试点启动

deepmind.google评测行业AI评分:70/100

某机构启动了全球首个双盲AI评估试点,旨在通过隐藏模型身份减少评估偏差,提升AI性能比较的客观性。此举有望为AI评测设立新标准,影响行业评估方法。

A translucent blue-green cube with keyholes and a padlock symbol, with glowing yellow and green light beams passing thr…
A translucent blue-green cube with keyholes and a padlock symbol, with glowing yellow and green light beams passing thr…

设想一名学生即将参加一场至关重要的考试。如果他们不小心提前看到了试题,那么取得满分就会受到这种知情的影响,使这一成就失去意义。要真正衡量他们掌握的知识,他们必须在考试开始前对试题一无所知。这正是业界在评估先进AI模型时所面临的挑战。如果模型已经看过测试题目——这个问题被称为基准污染——那么结果的可信度就会大打折扣。

今天,我们推出全球首个针对专有前沿级AI模型的双盲评估,该评估将外部评估限制在一个加密的“盒子”中,使模型无法在测试前利用这些评估来优化性能。我们与新加坡AI安全研究所、OpenMined、AVERI和MLCommons合作,在隐私保护环境中对Gemini Flash Lite模型进行保密基准测试,从而提高评估的完整性。

在Google,我们在模型开发和部署的整个过程中使用广泛的评估体系来评估AI系统,但我们并不只依赖内部测试。为了发现潜在的盲点,我们与多元化的外部合作伙伴合作,包括专业研究实验室、民间社会以及各国AI安全与安保研究所(AISI),利用他们独特的专业知识对我们的模型进行压力测试。

随着AI模型能力的不断增强,确保模型没有提前看到测试问题或提示词变得至关重要,因为这可能会扭曲结果。政策制定者、研究人员和企业需要相信AI基准能够准确反映模型的真实能力和安全性,但如果模型能够提前“偷看”评估问题,就可能会人为抬高分数,破坏这种信任。

尽管零日志协议和严格的合同保障措施长期以来一直确保外部测试提示词的机密性,但加入技术和加密保障措施标志着安全模型评估迈出了重要一步。

双盲评估的工作原理

从历史上看,高风险的外部评估需要做出取舍。要么评估方交出他们的测试提示词(冒着模型提供商提前看到测试问题的风险),要么模型提供商交出他们的模型权重(冒着知识产权泄露的风险)。

双盲评估消除了这种妥协。通过使用Google Cloud机密计算产品组合中的Confidential Space,我们可以在密码学上验证外部评估数据和专有模型对各自所有者都保持私密。评估方无法看到Gemini模型权重,Google也无法看到评估方的测试提示词。

一种建立模型评估信任的新方法

这种加密证据有助于防止基准污染并保护敏感数据。随着模型能力的增强,这对于高度敏感的评估尤为重要,例如用于网络安全或政府机构的评估。双盲评估使独立组织能够在不影响数据主权或安全性的情况下严格测试先进模型。

我们希望这一试点能够为模型监管开辟新前沿,帮助更广泛的行业构建更安全、更可靠、更值得信赖的AI系统。如需了解更多关于我们方法和发现的信息,请阅读我们的技术报告。

译文已达到本站中文翻译的字数上限,剩余内容请查看原文。

阅读原文