想象一个学生要参加一场决定命运的高风险考试。如果他在考前不小心看到了试题,那考出来的满分还能证明他真实水平吗?显然不能。今天的大模型评估正面临同样的尴尬:如果模型在训练或调优阶段已经见过测试题,那么它在基准测试上的高分就可能是“作弊”的结果,而不是真实能力的体现。这个问题有个专门的名字——benchmark contamination(基准污染,指测试数据提前泄露给模型,导致评估结果虚高)。
Google 最近联合新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons,做了一个很有意思的尝试:对 Gemini Flash Lite 模型进行了一次全球首个“双盲”评估。所谓双盲,就是评估方和模型提供方互相看不到对方的秘密——评估方看不到模型的权重,Google 也看不到评估方的测试题。这样一来,模型在测试前不可能“偷看”题目,评估结果的可信度就大大提高了。
这个机制是怎么实现的?核心是 Google Cloud 的 Confidential Computing(机密计算,一种在硬件层面加密内存数据、让云服务商也无法窥探计算过程的技术)产品线中的 Confidential Space。简单说,它创建了一个加密的“黑箱”环境,外部评估方把保密测试题放进去,Google 把模型权重也放进去,双方都在这个可信执行环境里运行评估,但任何一方都无法从外部读取另一方的数据。整个过程通过密码学证据来验证,而不是仅仅依赖合同承诺。
为什么这件事重要?过去做高风险的第三方评估,往往要做一个痛苦的取舍:要么评估方把测试题交给模型提供方,冒着题目提前泄露的风险;要么模型提供方把模型权重交给评估方,冒着知识产权被泄露的风险。双盲评估把这两个风险同时消掉了。对于网络安全、政府机构这类高度敏感的评估场景,这种技术保障尤其关键——独立机构可以在不牺牲数据主权和商业机密的前提下,对前沿模型做严格的压力测试。
最让我意外的是,这个方案没有引入什么全新的复杂协议,而是把已有的云上机密计算能力用在了模型评估这个具体问题上。它相当于给“模型考试”建了一个防作弊考场:题目和答卷都被锁在加密保险箱里,监考老师只能看到最终分数,却碰不到试卷本身。这种思路其实可以推广到更多需要互信的 AI 协作场景,比如多个机构联合训练模型、跨公司做安全审计、或者让外部研究者验证模型的合规性。
当然,这个试点还只是第一步。双盲评估并不能解决所有评估问题——比如模型可能通过其他途径间接学到类似分布的数据,或者评估本身的样本量不够导致统计偏差。但至少,它把“模型是否提前见过题”这个变量从评估方程里剔除了,让基准测试重新变得有意义。对于任何依赖第三方评估结果来做决策的团队来说,这是一个值得关注的信号:技术手段可以比合同约束更硬核地建立信任。如果你正在设计 AI 产品的评测流程,或者需要向客户证明模型能力的真实性,这套“加密黑箱”的思路可以直接借鉴。
内容与图片版权归原作者所有 · 原文: https://deepmind.google/blog/piloting-the-worlds-first-double-blind-ai-evaluations/