Éval Gemini en double aveugle DeepMind 2026 : le pilote enclave

DeepMind a évalué Gemini 2.5 Flash Lite dans une enclave scellée. L’actualité, c’est la procédure, pas une ligne de classement.

Le 27 août 2026, Google DeepMind a indiqué avoir évalué Gemini 2.5 Flash Lite avec l’AISI de Singapour, OpenMined, MLCommons et AVERI dans une enclave scellée : le labo ne voit pas les items, les testeurs ne voient pas les poids.

Ce n’est pas un nouveau classement. TechTimes et The New Stack, d’après le rapport technique, traitent l’évaluation en double aveugle comme une issue structurelle à une impasse de confiance.

Contamination Déroulement en enclave À qui l’on fait encore confiance

Pourquoi le zéro journal n’a jamais suffi

Si un benchmark public fuit dans le corpus, le score mesure la récupération. DeepMind cite des travaux où près de la moitié de 31 modèles montraient des signes de fuite, et des recherches 2026 selon lesquelles la contamination gonfle les scores, surtout pour les grands systèmes.

Les API exposent les invites. Partager les poids expose l’actif. Le zéro journal est une promesse. Le consensus de Singapour de juillet 2026 a classé comme priorité une infrastructure en double aveugle : l’évaluateur ne voit pas les paramètres, le développeur ne connaît pas les items exacts.

01

Évals API

Les invites traversent l’infrastructure du fournisseur ; le labo peut voir les questions.

02

Remise des poids

Les évaluateurs gagnent la reproductibilité ; le labo perd le contrôle d’un artefact coûteux.

03

Zéro journal contractuel

Même de bonne foi, caches, erreurs ou un run d’entraînement ultérieur peuvent avaler les items.

Ce qui se passe dans l’enclave

  1. 1

    Attestation distante

    Les deux côtés vérifient que le guest est le logiciel convenu, pas un build avec une voie d’exfiltration.

  2. 2

    Chargement chiffré

    DeepMind charge les poids et le code d’inférence de Gemini 2.5 Flash Lite ; les évaluateurs chargent invites cachées et code de score. Les poids restent en mémoire GPU H100 chiffrée ; les invites en mémoire hôte Intel TDX.

  3. 3

    Résultats bornés seulement

    L’évaluateur ne reçoit que les sorties autorisées. Le guest est détruit. Le rapport place le surcoût crypto sous environ cinq pour cent.

27 Aug
Annonce DeepMind
<5 %
Surcoût rapporté
1 GPU
Plafond matériel actuel

Contrôles logiciels et confiance restante

Le chiffrement ne suffit pas si le guest peut appeler l’extérieur. PySyft impose une revue conjointe et bloque les sorties sensibles. En décembre 2024, OpenMined a mené un pilote H100 avec l’AISI britannique et Anthropic sur un proxy open source face à CAMEL-bio. En mars 2026, le centre NIST pour les normes et l’innovation IA a signé un accord de recherche avec OpenMined autour de PySyft.

La confiance se déplace plutôt qu’elle ne disparaît : du contrat bilatéral vers les puces NVIDIA et Intel, et vers les services Google Cloud qui signent les rapports d’attestation.

Rôle Voie habituelle Ce pilote
Propriétaire du modèle Voit les invites API ou signe un zéro journal Ne peut pas lire les items dans le guest
Évaluateur A besoin des poids ou doit croire le labo Pas de poids ; résultats bornés seulement
Classe de modèle Toute taille en principe D’abord les systèmes qui tiennent sur un GPU

MLCommons rappelle que cacher les items ne rend pas un benchmark bien conçu. Les scores sont dans le rapport primaire ; cet article ne recopie pas de rangs non vérifiés.

Friction juridique
Le rapport DeepMind place les accords inter-organisations et la revue de code conjointe au-dessus de la facture GPU comme freins à l’échelle.
Trou multi-GPU
Des tissus H100/B200 chiffrés pour l’inférence distribuée sont en cours ; ce n’est pas encore un outil d’éval livré.

Quand l’équipe a besoin d’un schéma

Après le papier, il faut souvent un croquis partagé : qui atteste, qui fournit le silicium, quelle couche reste de la confiance. Pas besoin d’une autre suite. Ouvrez un espace court sur tidemeet, ou lisez sessions sans compte et créer un espace.

# parcours
attestation → weights-in → prompts-in → bounded-results

Questions

Cela rend-il les scores de benchmark fiables ?

Non. Cela ferme un mode de défaillance : chaque partie devait voir le secret de l’autre. Qualité du benchmark, hygiène des items après coup et plus gros flagships restent hors de ce pilote à un GPU.

Quel score pour Gemini ?

Les textes publics insistent sur la méthode, pas un chiffre. S’en tenir au rapport technique DeepMind et partenaires ; ne pas traiter des rangs non vérifiés comme résultat.

D’autres labs peuvent-ils copier demain ?

Le calcul confidentiel n’est pas réservé à Google. Contrats, revue conjointe et racines d’attestation s’appuient encore sur un cloud et deux fondeurs. Monter en charge hors Google ajoute de la friction.

Pourquoi un canevas temporaire ?

Aucun lien produit avec l’éval. Pour un schéma de frontière de confiance, outils de réunion temporaires dit quand un espace navigateur bref suffit.

Créer un espace gratuit