Двойное слепое оценивание Gemini от DeepMind 2026: пилот в анклаве
DeepMind прогнала Gemini 2.5 Flash Lite в запечатанном анклаве. Новость — процедура, а не строка рейтинга.
27 августа 2026 года Google DeepMind сообщила, что оценила Gemini 2.5 Flash Lite вместе с AISI Сингапура, OpenMined, MLCommons и AVERI в запечатанном анклаве: лаборатория не видит задания, оценщики не видят веса.
Это не ещё одна таблица лидеров. TechTimes и The New Stack, опираясь на технический отчёт, трактуют двойное слепое оценивание как структурный выход из тупика доверия.
Почему zero-logging никогда не хватало
Если публичный бенчмарк утекает в обучающий корпус, балл измеряет поиск. DeepMind цитирует более раннюю работу с признаками утечки примерно у половины из 31 модели и исследования 2026 года о том, что загрязнение раздувает оценки, особенно у крупных систем.
API вендора открывает промпты. Передача весов открывает актив. Zero-logging — обещание. Сингапурский консенсус июля 2026 года назвал приоритетом инфраструктуру двойной слепоты: оценщик не видит параметры, разработчик не знает точных заданий.
Оценка по API
Промпты идут через стек вендора, лаборатория может видеть вопросы.
Передача весов
Оценщики получают воспроизводимость; лаборатория теряет контроль над дорогим артефактом.
Договорной zero-log
Даже при добросовестности кэш, ошибка или поздний прогон обучения могут проглотить задания.
Что происходит внутри анклава
-
1
Удалённая аттестация
Обе стороны проверяют, что гость — согласованное ПО, а не сборка с каналом утечки.
-
2
Шифрованная загрузка
DeepMind загружает веса и код инференса Gemini 2.5 Flash Lite; оценщики — скрытые промпты и код скоринга. Веса лежат в зашифрованной GPU-памяти H100, промпты — в хост-памяти Intel TDX.
-
3
Только ограниченные результаты
Оценщик получает лишь разрешённые выходы. Гость уничтожается. Отчёт оценивает криптонакладные расходы ниже примерно пяти процентов.
Программный контроль и остаточное доверие
Шифрования мало, если гость может звонить наружу. PySyft требует совместного обзора кода и блокирует чувствительный исходящий трафик. В декабре 2024 OpenMined провела пилот на H100 с UK AISI и Anthropic по открытой прокси-модели против CAMEL-bio. В марте 2026 центр NIST по стандартам и инновациям ИИ подписал с OpenMined исследовательское соглашение по PySyft.
Доверие не исчезает, а переезжает: с двустороннего договора на чипы NVIDIA и Intel и на сервисы Google Cloud, которые подписывают отчёты аттестации.
| Роль | Обычный путь | Этот пилот |
|---|---|---|
| Владелец модели | Видит API-промпты или подписывает zero-log | Не читает задания внутри гостя |
| Оценщик | Нужны веса или вера лаборатории | Без весов; только ограниченные результаты |
| Класс модели | Любой размер в принципе | Сначала системы, которые помещаются на один GPU |
MLCommons также отмечает: скрыть задания — не значит сделать бенчмарк хорошо спроектированным. Баллы смотрите в первичном отчёте; здесь нет непроверенных мест в рейтинге.
- Юридическое трение
- Отчёт DeepMind называет межорганизационные соглашения и совместный обзор кода более тяжёлыми барьерами масштаба, чем счёт за GPU.
- Пробел multi-GPU
- Шифрованные ткани H100/B200 для распределённого инференса в работе; это ещё не поставляемый инструмент оценки.
Когда команде нужна одна схема
После статьи обычно нужна общая зарисовка: кто аттестует, кто даёт кремний, какой слой всё ещё доверие. Другой пакет для совещаний не нужен. Откройте короткое пространство на tidemeet или читайте сессии без аккаунта и как создать пространство.
# порядок
attestation → weights-in → prompts-in → bounded-results
Вопросы
Теперь баллам бенчмарков можно верить?
Нет. Закрыт один сбой: каждая сторона должна была видеть секрет другой. Качество бенчмарка, гигиена заданий после прогона и крупнейшие флагманы вне этого одно-GPU пилота.
Какой балл у Gemini?
Публичные тексты делают упор на метод, не на число. Смотрите технический отчёт DeepMind и партнёров; непроверенные места в рейтинге не считайте результатом.
Другие лаборатории скопируют это завтра?
Конфиденциальные вычисления не только у Google. Договоры, совместный обзор и корни аттестации по-прежнему опираются на облако и двух производителей чипов. Масштаб вне Google добавит трения.
Зачем временный холст?
Продуктовой связки с оценкой нет. Если нужна только схема границы доверия, временные инструменты встреч объясняет, когда хватает короткого пространства в браузере.