ARC-AGI-3 два балла: Astra Standard и Adapter 2026 полный разбор

ARC Prize 3 сентября выложил 62,7% и 99,9% Astra на ARC-AGI-3. Сюжет — два харнеса, а не пересказ запуска.

3 сентября 2026 фонд ARC Prize опубликовал два балла ARC-AGI-3 Semi-Private для GPT-6 Astra: 62,7% на Standard harness и 99,9% на Provider Adapter. Та же модель, тот же стенд, разрыв больше тридцати пунктов.

Это не ещё один пересказ запуска флагмана. OpenAI в тот же день поэтапно выкатывала Astra. Здесь только два харнеса, которые выложил сам ARC Prize, и правило фонда: Standard — чтобы сравнивать модели, Adapter — чтобы видеть управление контекстом провайдера.

Что измерили Два харнеса Как читать баллы

Два харнеса, два вопроса

ARC-AGI-3 — интерактивный стенд рассуждения: агент исследует незнакомые пошаговые среды, выводит цели и строит внутреннюю модель без инструкции. Фонд пишет, что люди решают все среды; при запуске каждая проверенная фронтирная система была ниже 1%.

01

Standard harness

Минимальный, нейтральный к провайдеру интерфейс. Модель уносит только видимые заметки, которые сама выбирает. Astra (max): 62,7% на Semi-Private за 26 098 $. Фонд считает, что будущий AGI должен пройти стенд в этих условиях; межпровайдерное сравнение идёт здесь.

02

Provider Adapter

Сохраняет непрозрачное состояние рассуждения между запросами и сжимает длинные диалоги, чтобы повторно использовать прежнюю работу. Astra (high): 99,9% за 18 817 $. Балл выше, счёт ниже.

03

Оба на доску

ARC Prize пишет, что дальше будет публиковать оба условия на таблице ARC-AGI, каждое с меткой. Открытый репозиторий тестов и политика тестирования покрывают оба.

Как читать две цифры

  1. 1

    Сначала Standard

    62,7% — цифра, которую можно ставить рядом с другими моделями. R&D World и поздние разборы считают её цифрой покупателя. Страница запуска OpenAI ставит вперёд 99,9%.

  2. 2

    Затем вопрос Adapter

    Adapter спрашивает, как далеко модель уходит с управлением контекстом, которое провайдер сделал для неё. По Public и Semi-Private и всем уровням рассуждения прогоны Adapter были примерно в 3,66 раза быстрее по записанному времени и потратили на 49% меньше токенов на 167 парах игра–рассуждение, которые решили оба харнеса.

  3. 3

    Затем эффективность действий

    На Provider Adapter Astra (max) сделала меньше действий, чем человеческая медиана, на 96,0% уровней и в среднем на 51,7% меньше действий на уровень. Фонд называет это вехой паритета с людьми по эффективности действий, а не баллом одного лишь завершения.

62.7%
Standard Semi-Private (max)
99.9%
Provider Adapter (high)
96%
Уровни ниже человеческой медианы

Где фонд проводит черту

В повторах Astra модель сжимает незнакомую механику в компактную символьную модель мира и изобретает стенографию для состояния и планов. В краснокомандном харнесе PRO-LONG она также писала парсеры и планировщики под игры; фонд предупреждает: это модель плюс инструменты, несравнимо с контролируемым человеческим тестом.

Пункт Публичная цифра Как читать
Standard / max 62,7%, 26 098 $ Для сравнения провайдеров
Adapter / high 99,9%, 18 817 $ С управлением контекстом провайдера
Adapter / max 98,6%, 17 332 $ Больший effort не всегда больший балл

Формулировка ARC Prize: насытить ARC-AGI-3 — не «доказательство AGI». Среды ограничены, механика детерминирована, цели закрыты — это не открытый мир.

Что оставляет Standard
Модель сама решает, что оставить в видимых заметках. Интерфейс минимален, чтобы баллы стояли рядом.
Что оставляет Adapter
Непрозрачное состояние рассуждения живёт между запросами; длинные чаты сжимаются. Балл и время сдвигаются.
Откуда человеческая база
Около 500 человек из публики до запуска; база на уровень — медиана числа действий среди завершивших. Участникам платили за сессию, их не набирали как специалистов по головоломкам.

Когда команде нужна одна схема

После текста обычно нужна одна картинка: Standard 62,7%, Adapter 99,9%, черта «не AGI». Лишний пакет для встреч не нужен. Откройте tidemeet или как создать пространство. Другая независимая оценка той же недели: отчёт METR по OpenAI / Hugging Face; другой лабораторный протокол: двойной слепой анклав DeepMind.

# ось
standard-62.7 → adapter-99.9 → not-agi

Вопросы

Это пересказ запуска GPT-6 Astra?

Нет. Astra начала поэтапный доступ 3 сентября. Здесь только два балла ARC-AGI-3, которые в тот день выложил ARC Prize, и почему харнесы разные.

Какой балл сравнивать с другими моделями?

Фонд считает Standard сопоставимым условием между провайдерами. Балл Adapter — верхняя граница с управлением контекстом этого провайдера; не прижимать его к моделям без того же адаптера.

99,9% — это AGI?

Фонд пишет, что нет. Среды ARC-AGI-3 ограничены и закрыты. Astra — существенный шаг к обобщению, и на этом претензия останавливается.

Какое отношение к временному инструменту встреч?

Продуктовой связки нет. Если нужна одна схема двух харнесов, см. временные инструменты встреч.

Создать пространство