FrontierMath Erdős是什么:2026年Epoch开放题Lean基准全解析

Epoch在9月1日放出FrontierMath Erdős:68道开放题、Lean核验。故事是评测协议,不是又一篇旗舰稿。

2026年9月1日,Epoch AI 发布 FrontierMath Erdős:把 68 道仍开放、且被认定有数学分量的 Erdős 问题写成 Lean 命题,模型必须在固定预算内给出可核验的证明或反驳。

这不是又一篇旗舰发布稿。本篇只读 Epoch 自己写明的题库、协议和首轮分数:预发布 GPT-6 Astra 得 3%(2/68),另外四套系统在同一预算下为 0%。

谁发布 测了什么 怎么读分

基准实际在测什么

“Erdős 问题”并不是同一难度的一套题。Thomas Bloom 维护的 erdosproblems.com 当时收录约 1217 道,其中 652 道仍开放。Epoch 请 Bloom 从仍开放的题里挑出他认为既重要又难的 68 道,约占当时未解题的 10%,且截至 2026年8月仍无解。

01

选题,而不是题库全收

Bloom 估计,到 2026年8月,这一档次的 Erdős 题被 AI 解出的大约只有 3–5 道。名单是主观的;Epoch 写明:只要别人既觉得有些题不该进、又觉得另一些题必须进,选题就算及格。

02

Lean 核验,而不是自然语言论文

算分条件是产出通过核验的 Lean 证明或反驳。68 道里有 50 道已在 Google 的 Formal Conjectures 项目中形式化;其余 18 道由 AI 形式化,Epoch 写明自己不是 Lean 专家,正在寻求额外审阅。核验还用了 Lean FRO 的 Comparator,用来抵御作弊提交。

03

公开脚手架,固定预算

评测代码开源。默认每题一次尝试、推理预算 300 美元、工作时间 72 小时。模型没有联网,只能用离线数学论文集和计算机代数系统一类工具。

首轮怎么跑、怎么记分

  1. 1

    先看固定协议

    已跑五套系统:预发布 GPT-6 Astra、GPT-5.6 Sol、GPT-5.5、Claude Fable 5.1、Claude Fable 5。每题一次尝试。只有 Lean 核验通过才算解出。

  2. 2

    再看官方分数

    只有 Astra 解出任何题:68 道中的 2 道,即 3%。第 74 题用反例推翻,花费 218 美元、15 小时;第 126 题给出证明,花费 247 美元、16 小时。Astra 其余 66 次尝试,以及其他四套系统的全部尝试,都在预算内没有交出可核验证明。

  3. 3

    额外尝试不是这项分数

    Epoch 另用同一预发布 Astra、更大预算和变动脚手架做了不系统的尝试。那些尝试至少解出 5 道(另含第 1、548、571 题),全部尝试花费超过 22 万美元,官方跑大约 2 万美元。Epoch 写明:官方分仍是上面的 3%。

68
仍开放的 Erdős 题
$300
每题默认预算
72 h
每题工作时限

3% 说明什么、不说明什么

Epoch 自己的读法是:在这个脚手架、这个预算下,Astra 解出这份“有分量开放题”名单的约 3%。这说明 AI 做出这类突破已经真实发生,但还远谈不上对任意一题都有高胜率——至少在必须于 300 美元内完成形式化时是如此。

系统 官方分 怎么读
GPT-6 Astra 3% (2/68) 预发布版本;协议内唯二解
GPT-5.6 Sol / GPT-5.5 0% 预算内零核验证明
Claude Fable 5.1 / 5 0% 同协议,不是另一套题

Epoch 写明:最醒目的 AI 数学结果多来自公司内部、过程不透明。FrontierMath Erdős 想把题、脚手架和预算一次写清。

形式化是额外负担
用自然语言做出突破,和把它写成 Lean,几乎是两件事。Epoch 举过单位距离猜想:自然语言约 18 页,后续 Lean 形式化约 120 万行,因为要补标准库里还没有的深层结果。
污染会随时间变重
现阶段按公开基准跑、不强防污染。这 68 道在 2026年8月尚无解,训练截止早于该日的模型不可能背过答案。以后可按训练截止过滤已解题。
Erdős 不是全部数学
名单覆盖不了数学各分支。Epoch 预期进展会与一般数学能力有相关,但写明推断并不严密。

和同事对齐分数时

读完通常缺一张图:官方 3%、0% 列,以及“多花算力多解几道”为什么不能写进总分。不必再装会议套件。可在tidemeet开短时空间,或看如何创建空间。同站对题目级审计,见BenchMIRT;对测试架怎么改分,见ARC-AGI-3 双分数

# protocol
lean-proof | $300 | 72h
official = 2/68
extras ≠ score

还有疑问?

这是在写 Astra 发布吗?

不是。主题是 Epoch 的新评测协议。Astra 只是首轮五个被测系统之一,而且是预发布版本。

另外解出的三道为什么不算分?

那些尝试预算更大、脚手架有变、尝试次数也不固定。Epoch 明确把它们排除在 FrontierMath Erdős 分数之外。

0% 是不是说明其他模型完全不会数学?

不是。0% 表示在每题 300 美元、72 小时、一次尝试的协议下,没有交出通过 Lean 核验的证明。多数尝试是预算耗尽,而不是交了错证。

和临时协作工具有什么关系?

没有产品绑定。若只是要把官方分和“非正式加跑”画在一张表上,临时会议工具对比说明何时用短时浏览器空间即可。

免费创建空间