DeepMind雙盲評測Gemini 2.5 Flash Lite是什麼:2026加密飛地解析

DeepMind用機密飛地跑Gemini 2.5 Flash Lite的雙盲評測。重點不是分數,而是雙方都不必交出自己的秘密。

2026年8月27日,Google DeepMind宣布與新加坡AISI、OpenMined、MLCommons和AVERI合作,在加密硬體飛地裡評測Gemini 2.5 Flash Lite:廠商看不到考題,評測方也看不到權重。

這不是又一張排行榜。TechTimes與The New Stack轉述的技術報告強調:雙盲評測要解決的是結構問題——誰來跑測試,誰就必須看見對方的秘密。

污染問題 飛地怎麼跑 還信誰

為什麼零日誌仍然不夠

公開基準一旦漏進訓練語料,分數測的是檢索而不是能力。一份DeepMind引用的較早分析稱,31個模型中約半數出現洩漏跡象;2026年另有研究指出污染會抬高分數,大模型更敏感。

走廠商API,出題方等於把題目交給被測方。交出權重則暴露訓練成本極高的資產。零日誌多半是合約,不是硬體強制。2026年7月《新加坡全球AI安全研究優先事項共識》把「評測方看不到參數、開發方不知道具體考題」列為優先課題。

01

API評測

提示會經過廠商基礎設施,對方可以看見題目。

02

交出權重

評測方獲得可重現性,廠商則失去對核心資產的控制。

03

合約式零日誌

善意合規仍可能因快取、誤操作或後續訓練把題目吃進去。

飛地裡實際發生了什麼

  1. 1

    遠端證明

    雙方先確認飛地跑的是事先約定的軟體,而不是帶外洩通道的改版。

  2. 2

    加密裝載

    DeepMind裝入Gemini 2.5 Flash Lite權重與推論程式;評測方裝入保密提示與評分程式。權重落在H100加密顯示記憶體,提示落在Intel TDX加密主機記憶體。

  3. 3

    只交出約定結果

    評測結束只回傳允許的分數或判定,臨時環境銷毀。報告稱密碼學層開銷低於約5%。

27 Aug
DeepMind宣布日
<5 %
報告中的效能開銷
1 GPU
目前硬體上限

軟體層與殘餘信任

硬體加密不夠。飛地若能隨意外連,仍可能把資料送出去。OpenMined的PySyft要求雙方預審程式並阻斷敏感外連。2024年12月,OpenMined曾與英國AISI、Anthropic用H100安全飛地對開源代理模型評測CAMEL-bio;2026年3月,NIST的AI標準與創新中心與OpenMined簽署合作,把PySyft用於安全評測。

信任沒有消失,只是搬家:從雙邊合約搬到NVIDIA與Intel晶片,以及簽署證明報告的Google Cloud服務。

角色 傳統做法 這次試點
模型方 看見API提示,或簽零日誌 看不到飛地內考題
評測方 要權重或只能信廠商 看不到權重,只拿約定結果
適用模型 任意規模(流程上) 先限單卡放得下的系統

MLCommons也提醒:保護題目不等於基準本身設計得好。分數可以對照原報告,本文不轉述未核實的排行數字。

法律摩擦
DeepMind自己的報告把跨組織協議與程式聯審列為規模化的更大障礙,往往難於算力帳單。
多卡缺口
研究人員在推進H100/B200加密互連,以便評測需要分散式推論的系統,但那還不是現成工具。

和同事對齊報告時

讀完技術細節後,小組通常需要同一張圖:誰提供證明、誰提供晶片、哪一層仍是信任。不必再裝一套會議套件。可在tidemeet建立短時空間,或先看無帳號協作如何建立空間

# 對照清單
attestation → weights-in → prompts-in → bounded-results

還有疑問?

這次證明基準分數現在都可以信嗎?

不能。它只堵住「出題方與模型方必須看見對方秘密」這一條。基準品質、題庫事後管理,以及最大旗艦模型仍不在這次單卡試點裡。

Gemini在這次評測裡得了多少分?

公開報導強調流程而非分數。請以DeepMind與合作方的技術報告為準,不要把未核實的排行數字當結論。

其他實驗室能立刻複製嗎?

機密運算並不綁定單一雲。但協議、聯審和證明根仍依賴雲廠商與晶片廠。別的實驗室要在非Google基礎設施上規模化,摩擦會更大。

和臨時協作工具有什麼關係?

沒有產品綁定。若你只是要對照報告畫一張信任邊界圖,臨時會議工具對比說明何時用短時瀏覽器空間即可。

免費建立空間