FrontierMath Erdős 2026: Lean-оценка Epoch по 68 задачам

Epoch выложила FrontierMath Erdős 1 сентября: 68 открытых задач, проверка Lean. Тема — протокол, не очередной флагман.

1 сентября 2026 года Epoch AI опубликовала FrontierMath Erdős: 68 всё ещё открытых задач Эрдёша, которые куратор счёл математически весомыми, записанных в Lean. Балл ставится только за машинопроверяемое доказательство или опровержение в фиксированном бюджете.

Это не очередной обзор флагмана. Текст держится набора, протокола и первой таблицы Epoch: предрелизная GPT-6 Astra набрала 3% (2 из 68); четыре другие системы на том же бюджете — 0%.

Кто опубликовал Что мерили Как читать

Что бенчмарк реально меряет

«Задача Эрдёша» — не один класс сложности. Сайт Thomas Bloom erdosproblems.com тогда содержал около 1217 задач, 652 ещё открыты. Epoch попросила Bloom выбрать 68, которые он счёл и важными, и трудными — примерно 10% нерешённых, все открыты на август 2026.

01

Отбор, а не весь каталог

Bloom грубо оценил, что к августу 2026 ИИ решила лишь 3–5 задач Эрдёша такого калибра. Список субъективен; Epoch пишет, что отбор удался, если одни включения спорны, а другие кажутся очевидными.

02

Проверка Lean, а не статья словами

Зачёт — доказательство или опровержение на Lean, прошедшее верификацию. 50 из 68 уже были формализованы в Formal Conjectures Google; остальные 18 формализовали с ИИ. Epoch пишет, что это не команда экспертов Lean, и ищет дополнительное рецензирование. Проверка также использует Comparator от Lean FRO против мошеннических сдач.

03

Открытый каркас, фиксированный бюджет

Код оценки открыт. По умолчанию: одна попытка на задачу, 300 долларов на вывод, 72 часа работы. У моделей нет интернета; им дают офлайн-сборник математических статей и инструменты вроде системы компьютерной алгебры.

Как считали первый прогон

  1. 1

    Сначала фиксированный протокол

    Прогнали пять систем: предрелиз GPT-6 Astra, GPT-5.6 Sol, GPT-5.5, Claude Fable 5.1 и Claude Fable 5. По одной попытке. Задача засчитывается только при прохождении Lean.

  2. 2

    Затем официальные баллы

    Что-то решила только Astra: 2 из 68, то есть 3%. Задачу 74 опровергли контрпримером (218 долларов, 15 часов), задачу 126 доказали (247 долларов, 16 часов). Остальные 66 попыток Astra и все попытки четырёх других систем исчерпали бюджет без проверенного доказательства.

  3. 3

    Дополнительные попытки — не этот балл

    Отдельно Epoch гоняла ту же предрелизную Astra с большим бюджетом и другими каркасами, менее систематично. Эти прогоны хотя бы раз решили 5 задач (ещё 1, 548 и 571), более чем на 220 000 долларов против примерно 20 000 у официального прогона. Epoch прямо пишет: балл FrontierMath Erdős остаётся 3%.

68
Открытые задачи Эрдёша
$300
Бюджет по умолчанию / задача
72 h
Лимит рабочего времени

Что говорит и не говорит 3%

Собственное чтение Epoch: в этом каркасе, при этом бюджете, Astra решила около 3% списка весомых открытых задач. Это реальная точка данных о математических прорывах ИИ — и о том, что произвольная задача этого класса всё ещё маловероятно падёт, по крайней мере если результат нужно формализовать за 300 долларов.

Система Официальный балл Как читать
GPT-6 Astra 3% (2/68) Предрелиз; единственные официальные решения
GPT-5.6 Sol / GPT-5.5 0% Нет проверенного доказательства в бюджете
Claude Fable 5.1 / 5 0% Тот же протокол, не второй набор

Epoch пишет, что самые заметные ИИ-результаты в математике приходили из лабораторий, почти без публичного метода. FrontierMath Erdős должна назвать задачи, каркас и бюджет в одном месте.

Формализация — второй проект
Прорыв на естественном языке и формализация в Lean — почти разные работы. Epoch приводит гипотезу единичных расстояний: 18 страниц текста против поздней Lean-работы примерно на 1,2 млн строк, в основном чтобы вывести глубокий результат, которого ещё не было в библиотеке.
Загрязнение будет расти
Пока бенч гоняют как классический открытый набор, без жёсткой защиты от загрязнения. Ни у одной из 68 не было известного решения на август 2026, так что модель с отсечкой обучения раньше этой даты не могла заучить ответ. Поздние модели можно сравнивать по ещё открытому остатку.
Эрдёш — не вся математика
Список не выборка всех областей. Epoch ожидает некоторую корреляцию с общим прогрессом в математике и пишет, что вывод не герметичен.

Когда команде нужна одна таблица

После поста обычно не хватает одной схемы: официальные колонки 3% и 0% и почему лишние траты не переписывают балл. Отдельный переговорный пакет не нужен. Откройте короткое пространство на tidemeet или смотрите как создать пространство. Про аудит на уровне заданий — BenchMIRT; про то, как каркас меняет опубликованный балл, — два балла ARC-AGI-3.

# protocol
lean-proof | $300 | 72h
official = 2/68
extras ≠ score

Вопросы

Это текст про запуск Astra?

Нет. Тема — новый протокол оценки Epoch. Astra — одна из пяти систем первого прогона, и оценённая копия была предрелизной.

Почему три дополнительных решения не входят в балл?

У тех попыток были больше бюджеты, другие каркасы и разное число повторов. Epoch исключает их из балла FrontierMath Erdős.

Значит ли 0%, что другие модели не умеют математику?

Нет. 0% значит: при 300 долларах, 72 часах и одной попытке они не вернули Lean-проверенное доказательство. Большинство попыток исчерпали бюджет, а не сдали ошибочное доказательство.

Какое отношение это имеет к временному инструменту встреч?

Никакой продуктовой связки. Если нужна только схема официальной таблицы против неформальных доппрогонов, сравнение временных инструментов встреч показывает, когда хватает короткого пространства в браузере.

Создать пространство