DeepMindのGemini二重盲検評価とは:2026年エンクレーブ試験
DeepMindはGemini 2.5 Flash Liteを封印環境で評価した。話題は点数ではなく、双方が秘密を渡さずに済む手順だ。
2026年8月27日、Google DeepMindはシンガポールAISI、OpenMined、MLCommons、AVERIと共同で、Gemini 2.5 Flash Liteを封印エンクレーブ内で評価したと発表した。ラボは設問を見ず、評価側は重みを見ない。
これは新たな順位表ではない。TechTimesとThe New Stackが技術報告を踏まえて伝える通り、二重盲検評価は信頼の行き詰まりを構造で解く試みだ。
ゼロログでは足りなかった理由
公開ベンチが学習コーパスに漏れれば、得点は検索になる。DeepMindが引用した分析では31モデルの約半数に漏洩の兆候があり、2026年の別研究は汚染が得点を押し上げ、大規模ほど影響しやすいと述べる。
ベンダーAPIはプロンプトを見せる。重みの共有は資産を晒す。ゼロログは約束だ。2026年7月のシンガポール合意は、評価側がパラメータを見ず開発側が正確な設問を知らない基盤を優先課題に挙げた。
API評価
設問がベンダー基盤を通るため、ラボ側が見られる。
重みの引き渡し
再現性は得られるが、高コストの成果物の管理を失う。
契約上のゼロログ
善意でもキャッシュ、ミス、後続学習で設問が混入し得る。
エンクレーブ内の手順
-
1
リモート証明
合意したソフトであること、持ち出し経路がないことを双方が確認する。
-
2
暗号化ロード
DeepMindがGemini 2.5 Flash Liteの重みと推論コードを入れ、評価側が秘匿設問と採点コードを入れる。重みはH100の暗号化GPUメモリ、設問はIntel TDXのホストメモリに置かれる。
-
3
許可された結果だけ
評価側は合意した出力だけを受け取り、環境は破棄される。報告では暗号層のオーバーヘッドは約5%未満。
ソフト制御と残る信頼
外向き通信ができれば暗号化だけでは足りない。PySyftは共同レビューと機微な送信の遮断を求める。2024年12月、OpenMinedは英AISIとAnthropicとともにH100エンクレーブでオープンソース代理モデルをCAMEL-bioに対して評価した。2026年3月、NISTのAI標準・イノベーションセンターはOpenMinedとPySyft利用の研究協定を結んだ。
信頼は消えない。二社間契約から、NVIDIAとIntelのチップ、証明報告に署名するGoogle Cloudへ移る。
| 役割 | 従来 | 今回の試験 |
|---|---|---|
| モデル側 | APIの設問を見るかゼロログに署名 | ゲスト内の設問は読めない |
| 評価側 | 重みが要るかラボを信じる | 重みなし、合意結果のみ |
| 対象規模 | 手順上は任意 | まず1GPUに収まる系 |
MLCommonsは、設問を隠してもベンチ自体の質は保証されないと注記する。点数は一次資料で確認し、未検証の順位はここでは繰り返さない。
- 法務の摩擦
- DeepMindの報告は、組織間契約と共同コードレビューをGPU代より大きな障壁としている。
- 複数GPUの空白
- H100/B200の暗号化相互接続は研究中で、分散推論向けの完成した評価ツールではない。
チームで一枚の図が要るとき
論文の後に必要なのは、誰が証明し、誰がチップを出し、どこがまだ信頼かを同じ絵にすることだ。別の会議スイートは要らない。tidemeetで短時間スペースを開くか、アカウントなしのセッションとスペースの作り方を読む。
# 確認順
attestation → weights-in → prompts-in → bounded-results
よくある質問
これでベンチの点数は信じられるか?
いいえ。片方の秘密を相手に見せねばならない、という失敗だけを塞ぐ。ベンチの質、実施後の問題管理、最大級モデルはこの1GPU試験の外にある。
Geminiの得点は?
公開記事は手法を強調し、数字を主にしていない。DeepMindと共同者の技術報告を見て、未検証の順位を結果にしないこと。
他ラボは明日コピーできるか?
機密計算はGoogle専用ではない。契約、共同レビュー、証明の根はなおクラウドとチップベンダーに依存する。Google以外の基盤で規模化する摩擦は残る。
一時キャンバスの話はなぜ?
評価との製品的結びつきはない。信頼境界を図にするだけなら、一時的な会議ツールが、短いブラウザ空間で足りる場合を説明する。