DeepMind双盲评测Gemini 2.5 Flash Lite是什么:2026加密飞地全解析

DeepMind用机密飞地跑Gemini 2.5 Flash Lite的双盲评测。关键不是分数,而是双方都不必交出自己的秘密。

2026年8月27日,Google DeepMind宣布与新加坡AISI、OpenMined、MLCommons和AVERI合作,在加密硬件飞地里评测Gemini 2.5 Flash Lite:厂商看不到考题,评测方也看不到权重。

这不是又一张排行榜。TechTimes与The New Stack转述的技术报告强调:双盲评测要解决的是结构问题——谁来跑测试,谁就必须看见对方的秘密。

污染问题 飞地怎么跑 还信谁

为什么零日志仍然不够

公开基准一旦漏进训练语料,分数测的是检索而不是能力。一份DeepMind引用的较早分析称,31个模型中约半数出现泄漏迹象;2026年另有研究指出污染会抬高分数,大模型更敏感。

走厂商API,出题方等于把题目交给被测方。交出权重则暴露训练成本极高的资产。零日志多半是合同,不是硬件强制。2026年7月《新加坡全球AI安全研究优先事项共识》把“评测方看不到参数、开发方不知道具体考题”列为优先课题。

01

API评测

提示会经过厂商基础设施,对方可以看见题目。

02

交出权重

评测方获得可复现性,厂商则失去对核心资产的控制。

03

合同式零日志

善意合规仍可能因缓存、误操作或后续训练把题目吃进去。

飞地里实际发生了什么

  1. 1

    远程证明

    双方先确认飞地跑的是事先约定的软件,而不是带外泄通道的改版。

  2. 2

    加密装载

    DeepMind装入Gemini 2.5 Flash Lite权重与推理代码;评测方装入保密提示与评分代码。权重落在H100加密显存,提示落在Intel TDX加密主机内存。

  3. 3

    只交出约定结果

    评测结束只返回允许的分数或判定,临时环境销毁。报告称密码学层开销低于约5%。

27 Aug
DeepMind宣布日
<5 %
报告中的性能开销
1 GPU
当前硬件上限

软件层与残余信任

硬件加密不够。飞地若能随意外连,仍可能把数据送出去。OpenMined的PySyft要求双方预审代码并阻断敏感外连。2024年12月,OpenMined曾与英国AISI、Anthropic用H100安全飞地对开源代理模型评测CAMEL-bio;2026年3月,NIST的AI标准与创新中心与OpenMined签署合作,把PySyft用于安全评测。

信任没有消失,只是搬家:从双边合同搬到NVIDIA与Intel芯片,以及签署证明报告的Google Cloud服务。

角色 传统做法 这次试点
模型方 看见API提示,或签零日志 看不到飞地内考题
评测方 要权重或只能信厂商 看不到权重,只拿约定结果
适用模型 任意规模(流程上) 先限单卡可放下的系统

MLCommons也提醒:保护题目不等于基准本身设计得好。分数可以对照原报告,本文不转述未核实的排行数字。

法律摩擦
DeepMind自己的报告把跨组织协议与代码联审列为规模化的更大障碍,往往难于算力账单。
多卡缺口
研究人员在推进H100/B200加密互联,以便评测需要分布式推理的系统,但那还不是现成工具。

和同事对齐报告时

读完技术细节后,小组通常需要同一张图:谁提供证明、谁提供芯片、哪一层仍是信任。不必再装一套会议套件。可在tidemeet创建短时空间,或先看无账号协作如何创建空间

# 对照清单
attestation → weights-in → prompts-in → bounded-results

还有疑问?

这次证明基准分数现在都可以信吗?

不能。它只堵住“出题方与模型方必须看见对方秘密”这一条。基准质量、题库事后管理、以及最大旗舰模型仍不在这次单卡试点里。

Gemini在这次评测里得了多少分?

公开报道强调流程而非分数。请以DeepMind与合作方的技术报告为准,不要把未核实的排行数字当结论。

其他实验室能立刻复制吗?

机密计算并不绑定单一云。但协议、联审和证明根仍依赖云厂商与芯片厂。别的实验室要在非Google基础设施上规模化,摩擦会更大。

和临时协作工具有什么关系?

没有产品绑定。若你只是要对照报告画一张信任边界图,临时会议工具对比说明何时用短时浏览器空间即可。

免费创建空间