Двойное слепое оценивание Gemini от DeepMind 2026: пилот в анклаве

DeepMind прогнала Gemini 2.5 Flash Lite в запечатанном анклаве. Новость — процедура, а не строка рейтинга.

27 августа 2026 года Google DeepMind сообщила, что оценила Gemini 2.5 Flash Lite вместе с AISI Сингапура, OpenMined, MLCommons и AVERI в запечатанном анклаве: лаборатория не видит задания, оценщики не видят веса.

Это не ещё одна таблица лидеров. TechTimes и The New Stack, опираясь на технический отчёт, трактуют двойное слепое оценивание как структурный выход из тупика доверия.

Загрязнение Ход в анклаве Кому ещё верят

Почему zero-logging никогда не хватало

Если публичный бенчмарк утекает в обучающий корпус, балл измеряет поиск. DeepMind цитирует более раннюю работу с признаками утечки примерно у половины из 31 модели и исследования 2026 года о том, что загрязнение раздувает оценки, особенно у крупных систем.

API вендора открывает промпты. Передача весов открывает актив. Zero-logging — обещание. Сингапурский консенсус июля 2026 года назвал приоритетом инфраструктуру двойной слепоты: оценщик не видит параметры, разработчик не знает точных заданий.

01

Оценка по API

Промпты идут через стек вендора, лаборатория может видеть вопросы.

02

Передача весов

Оценщики получают воспроизводимость; лаборатория теряет контроль над дорогим артефактом.

03

Договорной zero-log

Даже при добросовестности кэш, ошибка или поздний прогон обучения могут проглотить задания.

Что происходит внутри анклава

  1. 1

    Удалённая аттестация

    Обе стороны проверяют, что гость — согласованное ПО, а не сборка с каналом утечки.

  2. 2

    Шифрованная загрузка

    DeepMind загружает веса и код инференса Gemini 2.5 Flash Lite; оценщики — скрытые промпты и код скоринга. Веса лежат в зашифрованной GPU-памяти H100, промпты — в хост-памяти Intel TDX.

  3. 3

    Только ограниченные результаты

    Оценщик получает лишь разрешённые выходы. Гость уничтожается. Отчёт оценивает криптонакладные расходы ниже примерно пяти процентов.

27 Aug
Анонс DeepMind
<5 %
Заявленные накладные
1 GPU
Текущий аппаратный потолок

Программный контроль и остаточное доверие

Шифрования мало, если гость может звонить наружу. PySyft требует совместного обзора кода и блокирует чувствительный исходящий трафик. В декабре 2024 OpenMined провела пилот на H100 с UK AISI и Anthropic по открытой прокси-модели против CAMEL-bio. В марте 2026 центр NIST по стандартам и инновациям ИИ подписал с OpenMined исследовательское соглашение по PySyft.

Доверие не исчезает, а переезжает: с двустороннего договора на чипы NVIDIA и Intel и на сервисы Google Cloud, которые подписывают отчёты аттестации.

Роль Обычный путь Этот пилот
Владелец модели Видит API-промпты или подписывает zero-log Не читает задания внутри гостя
Оценщик Нужны веса или вера лаборатории Без весов; только ограниченные результаты
Класс модели Любой размер в принципе Сначала системы, которые помещаются на один GPU

MLCommons также отмечает: скрыть задания — не значит сделать бенчмарк хорошо спроектированным. Баллы смотрите в первичном отчёте; здесь нет непроверенных мест в рейтинге.

Юридическое трение
Отчёт DeepMind называет межорганизационные соглашения и совместный обзор кода более тяжёлыми барьерами масштаба, чем счёт за GPU.
Пробел multi-GPU
Шифрованные ткани H100/B200 для распределённого инференса в работе; это ещё не поставляемый инструмент оценки.

Когда команде нужна одна схема

После статьи обычно нужна общая зарисовка: кто аттестует, кто даёт кремний, какой слой всё ещё доверие. Другой пакет для совещаний не нужен. Откройте короткое пространство на tidemeet или читайте сессии без аккаунта и как создать пространство.

# порядок
attestation → weights-in → prompts-in → bounded-results

Вопросы

Теперь баллам бенчмарков можно верить?

Нет. Закрыт один сбой: каждая сторона должна была видеть секрет другой. Качество бенчмарка, гигиена заданий после прогона и крупнейшие флагманы вне этого одно-GPU пилота.

Какой балл у Gemini?

Публичные тексты делают упор на метод, не на число. Смотрите технический отчёт DeepMind и партнёров; непроверенные места в рейтинге не считайте результатом.

Другие лаборатории скопируют это завтра?

Конфиденциальные вычисления не только у Google. Договоры, совместный обзор и корни аттестации по-прежнему опираются на облако и двух производителей чипов. Масштаб вне Google добавит трения.

Зачем временный холст?

Продуктовой связки с оценкой нет. Если нужна только схема границы доверия, временные инструменты встреч объясняет, когда хватает короткого пространства в браузере.

Создать пространство