FrontierMath Erdős 2026: Lean-оценка Epoch по 68 задачам
Epoch выложила FrontierMath Erdős 1 сентября: 68 открытых задач, проверка Lean. Тема — протокол, не очередной флагман.
1 сентября 2026 года Epoch AI опубликовала FrontierMath Erdős: 68 всё ещё открытых задач Эрдёша, которые куратор счёл математически весомыми, записанных в Lean. Балл ставится только за машинопроверяемое доказательство или опровержение в фиксированном бюджете.
Это не очередной обзор флагмана. Текст держится набора, протокола и первой таблицы Epoch: предрелизная GPT-6 Astra набрала 3% (2 из 68); четыре другие системы на том же бюджете — 0%.
Что бенчмарк реально меряет
«Задача Эрдёша» — не один класс сложности. Сайт Thomas Bloom erdosproblems.com тогда содержал около 1217 задач, 652 ещё открыты. Epoch попросила Bloom выбрать 68, которые он счёл и важными, и трудными — примерно 10% нерешённых, все открыты на август 2026.
Отбор, а не весь каталог
Bloom грубо оценил, что к августу 2026 ИИ решила лишь 3–5 задач Эрдёша такого калибра. Список субъективен; Epoch пишет, что отбор удался, если одни включения спорны, а другие кажутся очевидными.
Проверка Lean, а не статья словами
Зачёт — доказательство или опровержение на Lean, прошедшее верификацию. 50 из 68 уже были формализованы в Formal Conjectures Google; остальные 18 формализовали с ИИ. Epoch пишет, что это не команда экспертов Lean, и ищет дополнительное рецензирование. Проверка также использует Comparator от Lean FRO против мошеннических сдач.
Открытый каркас, фиксированный бюджет
Код оценки открыт. По умолчанию: одна попытка на задачу, 300 долларов на вывод, 72 часа работы. У моделей нет интернета; им дают офлайн-сборник математических статей и инструменты вроде системы компьютерной алгебры.
Как считали первый прогон
-
1
Сначала фиксированный протокол
Прогнали пять систем: предрелиз GPT-6 Astra, GPT-5.6 Sol, GPT-5.5, Claude Fable 5.1 и Claude Fable 5. По одной попытке. Задача засчитывается только при прохождении Lean.
-
2
Затем официальные баллы
Что-то решила только Astra: 2 из 68, то есть 3%. Задачу 74 опровергли контрпримером (218 долларов, 15 часов), задачу 126 доказали (247 долларов, 16 часов). Остальные 66 попыток Astra и все попытки четырёх других систем исчерпали бюджет без проверенного доказательства.
-
3
Дополнительные попытки — не этот балл
Отдельно Epoch гоняла ту же предрелизную Astra с большим бюджетом и другими каркасами, менее систематично. Эти прогоны хотя бы раз решили 5 задач (ещё 1, 548 и 571), более чем на 220 000 долларов против примерно 20 000 у официального прогона. Epoch прямо пишет: балл FrontierMath Erdős остаётся 3%.
Что говорит и не говорит 3%
Собственное чтение Epoch: в этом каркасе, при этом бюджете, Astra решила около 3% списка весомых открытых задач. Это реальная точка данных о математических прорывах ИИ — и о том, что произвольная задача этого класса всё ещё маловероятно падёт, по крайней мере если результат нужно формализовать за 300 долларов.
| Система | Официальный балл | Как читать |
|---|---|---|
| GPT-6 Astra | 3% (2/68) | Предрелиз; единственные официальные решения |
| GPT-5.6 Sol / GPT-5.5 | 0% | Нет проверенного доказательства в бюджете |
| Claude Fable 5.1 / 5 | 0% | Тот же протокол, не второй набор |
Epoch пишет, что самые заметные ИИ-результаты в математике приходили из лабораторий, почти без публичного метода. FrontierMath Erdős должна назвать задачи, каркас и бюджет в одном месте.
- Формализация — второй проект
- Прорыв на естественном языке и формализация в Lean — почти разные работы. Epoch приводит гипотезу единичных расстояний: 18 страниц текста против поздней Lean-работы примерно на 1,2 млн строк, в основном чтобы вывести глубокий результат, которого ещё не было в библиотеке.
- Загрязнение будет расти
- Пока бенч гоняют как классический открытый набор, без жёсткой защиты от загрязнения. Ни у одной из 68 не было известного решения на август 2026, так что модель с отсечкой обучения раньше этой даты не могла заучить ответ. Поздние модели можно сравнивать по ещё открытому остатку.
- Эрдёш — не вся математика
- Список не выборка всех областей. Epoch ожидает некоторую корреляцию с общим прогрессом в математике и пишет, что вывод не герметичен.
Когда команде нужна одна таблица
После поста обычно не хватает одной схемы: официальные колонки 3% и 0% и почему лишние траты не переписывают балл. Отдельный переговорный пакет не нужен. Откройте короткое пространство на tidemeet или смотрите как создать пространство. Про аудит на уровне заданий — BenchMIRT; про то, как каркас меняет опубликованный балл, — два балла ARC-AGI-3.
# protocol
lean-proof | $300 | 72h
official = 2/68
extras ≠ score
Вопросы
Это текст про запуск Astra?
Нет. Тема — новый протокол оценки Epoch. Astra — одна из пяти систем первого прогона, и оценённая копия была предрелизной.
Почему три дополнительных решения не входят в балл?
У тех попыток были больше бюджеты, другие каркасы и разное число повторов. Epoch исключает их из балла FrontierMath Erdős.
Значит ли 0%, что другие модели не умеют математику?
Нет. 0% значит: при 300 долларах, 72 часах и одной попытке они не вернули Lean-проверенное доказательство. Большинство попыток исчерпали бюджет, а не сдали ошибочное доказательство.
Какое отношение это имеет к временному инструменту встреч?
Никакой продуктовой связки. Если нужна только схема официальной таблицы против неформальных доппрогонов, сравнение временных инструментов встреч показывает, когда хватает короткого пространства в браузере.