FrontierMath Erdős是什么:2026年Epoch开放题Lean基准全解析
Epoch在9月1日放出FrontierMath Erdős:68道开放题、Lean核验。故事是评测协议,不是又一篇旗舰稿。
2026年9月1日,Epoch AI 发布 FrontierMath Erdős:把 68 道仍开放、且被认定有数学分量的 Erdős 问题写成 Lean 命题,模型必须在固定预算内给出可核验的证明或反驳。
这不是又一篇旗舰发布稿。本篇只读 Epoch 自己写明的题库、协议和首轮分数:预发布 GPT-6 Astra 得 3%(2/68),另外四套系统在同一预算下为 0%。
基准实际在测什么
“Erdős 问题”并不是同一难度的一套题。Thomas Bloom 维护的 erdosproblems.com 当时收录约 1217 道,其中 652 道仍开放。Epoch 请 Bloom 从仍开放的题里挑出他认为既重要又难的 68 道,约占当时未解题的 10%,且截至 2026年8月仍无解。
选题,而不是题库全收
Bloom 估计,到 2026年8月,这一档次的 Erdős 题被 AI 解出的大约只有 3–5 道。名单是主观的;Epoch 写明:只要别人既觉得有些题不该进、又觉得另一些题必须进,选题就算及格。
Lean 核验,而不是自然语言论文
算分条件是产出通过核验的 Lean 证明或反驳。68 道里有 50 道已在 Google 的 Formal Conjectures 项目中形式化;其余 18 道由 AI 形式化,Epoch 写明自己不是 Lean 专家,正在寻求额外审阅。核验还用了 Lean FRO 的 Comparator,用来抵御作弊提交。
公开脚手架,固定预算
评测代码开源。默认每题一次尝试、推理预算 300 美元、工作时间 72 小时。模型没有联网,只能用离线数学论文集和计算机代数系统一类工具。
首轮怎么跑、怎么记分
-
1
先看固定协议
已跑五套系统:预发布 GPT-6 Astra、GPT-5.6 Sol、GPT-5.5、Claude Fable 5.1、Claude Fable 5。每题一次尝试。只有 Lean 核验通过才算解出。
-
2
再看官方分数
只有 Astra 解出任何题:68 道中的 2 道,即 3%。第 74 题用反例推翻,花费 218 美元、15 小时;第 126 题给出证明,花费 247 美元、16 小时。Astra 其余 66 次尝试,以及其他四套系统的全部尝试,都在预算内没有交出可核验证明。
-
3
额外尝试不是这项分数
Epoch 另用同一预发布 Astra、更大预算和变动脚手架做了不系统的尝试。那些尝试至少解出 5 道(另含第 1、548、571 题),全部尝试花费超过 22 万美元,官方跑大约 2 万美元。Epoch 写明:官方分仍是上面的 3%。
3% 说明什么、不说明什么
Epoch 自己的读法是:在这个脚手架、这个预算下,Astra 解出这份“有分量开放题”名单的约 3%。这说明 AI 做出这类突破已经真实发生,但还远谈不上对任意一题都有高胜率——至少在必须于 300 美元内完成形式化时是如此。
| 系统 | 官方分 | 怎么读 |
|---|---|---|
| GPT-6 Astra | 3% (2/68) | 预发布版本;协议内唯二解 |
| GPT-5.6 Sol / GPT-5.5 | 0% | 预算内零核验证明 |
| Claude Fable 5.1 / 5 | 0% | 同协议,不是另一套题 |
Epoch 写明:最醒目的 AI 数学结果多来自公司内部、过程不透明。FrontierMath Erdős 想把题、脚手架和预算一次写清。
- 形式化是额外负担
- 用自然语言做出突破,和把它写成 Lean,几乎是两件事。Epoch 举过单位距离猜想:自然语言约 18 页,后续 Lean 形式化约 120 万行,因为要补标准库里还没有的深层结果。
- 污染会随时间变重
- 现阶段按公开基准跑、不强防污染。这 68 道在 2026年8月尚无解,训练截止早于该日的模型不可能背过答案。以后可按训练截止过滤已解题。
- Erdős 不是全部数学
- 名单覆盖不了数学各分支。Epoch 预期进展会与一般数学能力有相关,但写明推断并不严密。
和同事对齐分数时
读完通常缺一张图:官方 3%、0% 列,以及“多花算力多解几道”为什么不能写进总分。不必再装会议套件。可在tidemeet开短时空间,或看如何创建空间。同站对题目级审计,见BenchMIRT;对测试架怎么改分,见ARC-AGI-3 双分数。
# protocol
lean-proof | $300 | 72h
official = 2/68
extras ≠ score
还有疑问?
这是在写 Astra 发布吗?
不是。主题是 Epoch 的新评测协议。Astra 只是首轮五个被测系统之一,而且是预发布版本。
另外解出的三道为什么不算分?
那些尝试预算更大、脚手架有变、尝试次数也不固定。Epoch 明确把它们排除在 FrontierMath Erdős 分数之外。
0% 是不是说明其他模型完全不会数学?
不是。0% 表示在每题 300 美元、72 小时、一次尝试的协议下,没有交出通过 Lean 核验的证明。多数尝试是预算耗尽,而不是交了错证。
和临时协作工具有什么关系?
没有产品绑定。若只是要把官方分和“非正式加跑”画在一张表上,临时会议工具对比说明何时用短时浏览器空间即可。