FrontierMath Erdős 2026 : l’éval Lean Epoch de 68 problèmes
Epoch a publié FrontierMath Erdős le 1er septembre : 68 problèmes ouverts, Lean. L’histoire est le protocole, pas un autre phare.
Le 1er septembre 2026, Epoch AI a publié FrontierMath Erdős : 68 problèmes d’Erdős encore ouverts, jugés mathématiquement sérieux, énoncés en Lean. Un système ne marque que s’il rend une preuve ou une réfutation vérifiée par machine dans un budget fixe.
Ce n’est pas un autre recap de modèle phare. Le texte s’en tient au jeu, au protocole et au premier tableau d’Epoch : une préversion de GPT-6 Astra a marqué 3 % (2 sur 68) ; quatre autres systèmes ont marqué 0 % au même budget.
Ce que le banc mesure vraiment
« Un problème d’Erdős » n’est pas une seule classe de difficulté. Le site erdosproblems.com de Thomas Bloom recensait alors environ 1 217 problèmes, dont 652 encore ouverts. Epoch a demandé à Bloom les 68 qu’il jugeait à la fois importants et durs — environ 10 % des non résolus, tous ouverts en août 2026.
Une curation, pas tout le catalogue
Bloom estimait grossièrement que seules 3 à 5 questions de ce calibre avaient été résolues par l’IA en août 2026. La liste est subjective ; Epoch écrit que le travail est fait si certains lecteurs contestent quelques choix et en reconnaissent d’autres comme évidents.
Vérification Lean, pas un article en prose
Une résolution est une preuve ou une réfutation Lean qui passe la vérification. Cinquante des 68 étaient déjà formalisées dans Formal Conjectures de Google ; les 18 restantes l’ont été avec de l’IA. Epoch dit n’être pas un atelier d’experts Lean et cherche d’autres relectures. La vérification utilise aussi Comparator du Lean FRO, conçu pour résister aux soumissions tricheuses.
Harnais ouvert, budget fixe
Le code d’évaluation est open source. Par défaut : une tentative par problème, 300 $ d’inférence, 72 heures de travail. Les modèles n’ont pas Internet ; ils reçoivent un corpus hors ligne d’articles mathématiques plus des outils comme un système de calcul formel.
Comment le premier passage a été noté
-
1
D’abord le protocole fixe
Cinq systèmes ont tourné : une préversion de GPT-6 Astra, GPT-5.6 Sol, GPT-5.5, Claude Fable 5.1 et Claude Fable 5. Une tentative chacun. Un problème ne compte que si Lean valide.
-
2
Ensuite les scores officiels
Seul Astra a résolu quoi que ce soit : 2 sur 68, soit 3 %. Le problème 74 a été réfuté par contre-exemple (218 $, 15 h) ; le 126 a été prouvé (247 $, 16 h). Les 66 autres tentatives d’Astra et toutes celles des quatre autres systèmes ont épuisé le budget sans preuve vérifiée.
-
3
Les essais extra ne sont pas ce score
À part, Epoch a fait des essais moins systématiques sur la même préversion d’Astra, avec des budgets plus grands et des échafaudages variés. Ces passages ont résolu 5 problèmes au moins une fois (aussi 1, 548 et 571), pour plus de 220 000 $ contre environ 20 000 $ pour le run officiel. Epoch est explicite : le score FrontierMath Erdős reste 3 %.
Ce que 3 % dit et ne dit pas
La lecture d’Epoch : dans cet échafaudage, à ce budget, Astra a résolu environ 3 % d’une liste de problèmes ouverts sérieux. C’est un vrai point de donnée sur les percées mathématiques de l’IA — et aussi qu’un problème arbitraire de cette classe a encore peu de chances de tomber, du moins s’il faut formaliser le résultat dans 300 $.
| Système | Score officiel | Lecture |
|---|---|---|
| GPT-6 Astra | 3% (2/68) | Préversion ; seules résolutions officielles |
| GPT-5.6 Sol / GPT-5.5 | 0% | Aucune preuve vérifiée dans le budget |
| Claude Fable 5.1 / 5 | 0% | Même protocole, pas un second jeu |
Epoch écrit que les résultats IA les plus voyants en maths viennent des labos, avec peu de méthode publique. FrontierMath Erdős vise à nommer les problèmes, le harnais et le budget au même endroit.
- La formalisation est un second projet
- Une percée en langue naturelle et une formalisation Lean sont presque deux métiers. Epoch cite la conjecture de la distance unité : 18 pages contre ensuite environ 1,2 million de lignes Lean, surtout pour reconstruire un résultat profond encore absent de la bibliothèque.
- La contamination va croître
- Pour l’instant le banc tourne comme un jeu public classique, sans garde-fous forts. Aucun des 68 n’avait de solution connue en août 2026 ; un modèle dont l’entraînement s’arrête avant ne peut pas l’avoir mémorisée. Les modèles suivants se compareront sur le reste encore ouvert.
- Erdős n’est pas toutes les maths
- La liste n’est pas un échantillon de tous les champs. Epoch attend une certaine corrélation avec le progrès mathématique général et dit que l’inférence n’est pas étanche.
Quand l’équipe veut un tableau
Après le billet, il manque souvent une image : les colonnes officielles 3 % et 0 %, et pourquoi un surcoût de calcul ne réécrit pas le score. Pas de suite de réunion en plus. Ouvrir un espace court sur tidemeet ou voir comment créer un espace. Pour un audit au niveau des items, lire BenchMIRT ; pour un harnais qui change un score publié, les deux scores ARC-AGI-3.
# protocol
lean-proof | $300 | 72h
official = 2/68
extras ≠ score
Questions
Est-ce un article de lancement d’Astra ?
Non. Le sujet est le nouveau protocole d’éval d’Epoch. Astra est l’un des cinq systèmes du premier passage, et la copie notée était une préversion.
Pourquoi les trois résolutions extra ne comptent-elles pas ?
Ces essais avaient des budgets plus grands, des échafaudages variés et des nombres de tentatives inégaux. Epoch les exclut du score FrontierMath Erdős.
0 % veut-il dire que les autres modèles ne font pas de maths ?
Non. 0 % signifie que, sous 300 $, 72 heures et une tentative, ils n’ont pas rendu de preuve Lean vérifiée. La plupart des essais ont épuisé le budget plutôt que de déposer une preuve fausse.
Quel rapport avec un outil de réunion temporaire ?
Aucun lien produit. S’il s’agit seulement d’esquisser le tableau officiel face aux runs informels, outils de réunion temporaires dit quand un court espace navigateur suffit.