DeepMind雙盲評測Gemini 2.5 Flash Lite是什麼:2026加密飛地解析
DeepMind用機密飛地跑Gemini 2.5 Flash Lite的雙盲評測。重點不是分數,而是雙方都不必交出自己的秘密。
2026年8月27日,Google DeepMind宣布與新加坡AISI、OpenMined、MLCommons和AVERI合作,在加密硬體飛地裡評測Gemini 2.5 Flash Lite:廠商看不到考題,評測方也看不到權重。
這不是又一張排行榜。TechTimes與The New Stack轉述的技術報告強調:雙盲評測要解決的是結構問題——誰來跑測試,誰就必須看見對方的秘密。
為什麼零日誌仍然不夠
公開基準一旦漏進訓練語料,分數測的是檢索而不是能力。一份DeepMind引用的較早分析稱,31個模型中約半數出現洩漏跡象;2026年另有研究指出污染會抬高分數,大模型更敏感。
走廠商API,出題方等於把題目交給被測方。交出權重則暴露訓練成本極高的資產。零日誌多半是合約,不是硬體強制。2026年7月《新加坡全球AI安全研究優先事項共識》把「評測方看不到參數、開發方不知道具體考題」列為優先課題。
API評測
提示會經過廠商基礎設施,對方可以看見題目。
交出權重
評測方獲得可重現性,廠商則失去對核心資產的控制。
合約式零日誌
善意合規仍可能因快取、誤操作或後續訓練把題目吃進去。
飛地裡實際發生了什麼
-
1
遠端證明
雙方先確認飛地跑的是事先約定的軟體,而不是帶外洩通道的改版。
-
2
加密裝載
DeepMind裝入Gemini 2.5 Flash Lite權重與推論程式;評測方裝入保密提示與評分程式。權重落在H100加密顯示記憶體,提示落在Intel TDX加密主機記憶體。
-
3
只交出約定結果
評測結束只回傳允許的分數或判定,臨時環境銷毀。報告稱密碼學層開銷低於約5%。
軟體層與殘餘信任
硬體加密不夠。飛地若能隨意外連,仍可能把資料送出去。OpenMined的PySyft要求雙方預審程式並阻斷敏感外連。2024年12月,OpenMined曾與英國AISI、Anthropic用H100安全飛地對開源代理模型評測CAMEL-bio;2026年3月,NIST的AI標準與創新中心與OpenMined簽署合作,把PySyft用於安全評測。
信任沒有消失,只是搬家:從雙邊合約搬到NVIDIA與Intel晶片,以及簽署證明報告的Google Cloud服務。
| 角色 | 傳統做法 | 這次試點 |
|---|---|---|
| 模型方 | 看見API提示,或簽零日誌 | 看不到飛地內考題 |
| 評測方 | 要權重或只能信廠商 | 看不到權重,只拿約定結果 |
| 適用模型 | 任意規模(流程上) | 先限單卡放得下的系統 |
MLCommons也提醒:保護題目不等於基準本身設計得好。分數可以對照原報告,本文不轉述未核實的排行數字。
- 法律摩擦
- DeepMind自己的報告把跨組織協議與程式聯審列為規模化的更大障礙,往往難於算力帳單。
- 多卡缺口
- 研究人員在推進H100/B200加密互連,以便評測需要分散式推論的系統,但那還不是現成工具。
和同事對齊報告時
讀完技術細節後,小組通常需要同一張圖:誰提供證明、誰提供晶片、哪一層仍是信任。不必再裝一套會議套件。可在tidemeet建立短時空間,或先看無帳號協作與如何建立空間。
# 對照清單
attestation → weights-in → prompts-in → bounded-results
還有疑問?
這次證明基準分數現在都可以信嗎?
不能。它只堵住「出題方與模型方必須看見對方秘密」這一條。基準品質、題庫事後管理,以及最大旗艦模型仍不在這次單卡試點裡。
Gemini在這次評測裡得了多少分?
公開報導強調流程而非分數。請以DeepMind與合作方的技術報告為準,不要把未核實的排行數字當結論。
其他實驗室能立刻複製嗎?
機密運算並不綁定單一雲。但協議、聯審和證明根仍依賴雲廠商與晶片廠。別的實驗室要在非Google基礎設施上規模化,摩擦會更大。
和臨時協作工具有什麼關係?
沒有產品綁定。若你只是要對照報告畫一張信任邊界圖,臨時會議工具對比說明何時用短時瀏覽器空間即可。