FrontierMath Erdős是什麼:2026年Epoch開放題Lean基準全解析
Epoch在9月1日放出FrontierMath Erdős:68道開放題、Lean核驗。故事是評測協議,不是又一篇旗艦稿。
2026年9月1日,Epoch AI 發布 FrontierMath Erdős:把 68 道仍開放、且被認定有數學分量的 Erdős 問題寫成 Lean 命題,模型必須在固定預算內給出可核驗的證明或反駁。
這不是又一篇旗艦發布稿。本篇只讀 Epoch 自己寫明的題庫、協議和首輪分數:預發布 GPT-6 Astra 得 3%(2/68),另外四套系統在同一預算下為 0%。
基準實際在測什麼
「Erdős 問題」並不是同一難度的一套題。Thomas Bloom 維護的 erdosproblems.com 當時收錄約 1217 道,其中 652 道仍開放。Epoch 請 Bloom 從仍開放的題裡挑出他認為既重要又難的 68 道,約佔當時未解題的 10%,且截至 2026年8月仍無解。
選題,而不是題庫全收
Bloom 估計,到 2026年8月,這一檔次的 Erdős 題被 AI 解出的大約只有 3–5 道。名單是主觀的;Epoch 寫明:只要別人既覺得有些題不該進、又覺得另一些題必須進,選題就算及格。
Lean 核驗,而不是自然語言論文
算分條件是產出通過核驗的 Lean 證明或反駁。68 道裡有 50 道已在 Google 的 Formal Conjectures 專案中形式化;其餘 18 道由 AI 形式化,Epoch 寫明自己不是 Lean 專家,正在尋求額外審閱。核驗還用了 Lean FRO 的 Comparator,用來抵禦作弊提交。
公開鷹架,固定預算
評測程式碼開源。預設每題一次嘗試、推理預算 300 美元、工作時間 72 小時。模型沒有連網,只能用離線數學論文集和電腦代數系統一類工具。
首輪怎麼跑、怎麼計分
-
1
先看固定協議
已跑五套系統:預發布 GPT-6 Astra、GPT-5.6 Sol、GPT-5.5、Claude Fable 5.1、Claude Fable 5。每題一次嘗試。只有 Lean 核驗通過才算解出。
-
2
再看官方分數
只有 Astra 解出任何題:68 道中的 2 道,即 3%。第 74 題用反例推翻,花費 218 美元、15 小時;第 126 題給出證明,花費 247 美元、16 小時。Astra 其餘 66 次嘗試,以及其他四套系統的全部嘗試,都在預算內沒有交出可核驗證明。
-
3
額外嘗試不是這項分數
Epoch 另用同一預發布 Astra、更大預算和變動鷹架做了不系統的嘗試。那些嘗試至少解出 5 道(另含第 1、548、571 題),全部嘗試花費超過 22 萬美元,官方跑大約 2 萬美元。Epoch 寫明:官方分仍是上面的 3%。
3% 說明什麼、不說明什麼
Epoch 自己的讀法是:在這個鷹架、這個預算下,Astra 解出這份「有分量開放題」名單的約 3%。這說明 AI 做出這類突破已經真實發生,但還遠談不上對任意一題都有高勝率——至少在必須於 300 美元內完成形式化時是如此。
| 系統 | 官方分 | 怎麼讀 |
|---|---|---|
| GPT-6 Astra | 3% (2/68) | 預發布版本;協議內唯二解 |
| GPT-5.6 Sol / GPT-5.5 | 0% | 預算內零核驗證明 |
| Claude Fable 5.1 / 5 | 0% | 同協議,不是另一套題 |
Epoch 寫明:最醒目的 AI 數學結果多來自公司內部、過程不透明。FrontierMath Erdős 想把題、鷹架和預算一次寫清。
- 形式化是額外負擔
- 用自然語言做出突破,和把它寫成 Lean,幾乎是兩件事。Epoch 舉過單位距離猜想:自然語言約 18 頁,後續 Lean 形式化約 120 萬行,因為要補標準庫裡還沒有的深層結果。
- 污染會隨時間變重
- 現階段按公開基準跑、不強防污染。這 68 道在 2026年8月尚無解,訓練截止早於該日的模型不可能背過答案。以後可按訓練截止過濾已解題。
- Erdős 不是全部數學
- 名單覆蓋不了數學各分支。Epoch 預期進展會與一般數學能力有相關,但寫明推斷並不嚴密。
和同事對齊分數時
讀完通常缺一張圖:官方 3%、0% 列,以及「多花算力多解幾道」為什麼不能寫進總分。不必再裝會議套件。可在tidemeet開短時空間,或看如何建立空間。同站對題目級審計,見BenchMIRT;對測試架怎麼改分,見ARC-AGI-3 雙分數。
# protocol
lean-proof | $300 | 72h
official = 2/68
extras ≠ score
還有疑問?
這是在寫 Astra 發布嗎?
不是。主題是 Epoch 的新評測協議。Astra 只是首輪五個被測系統之一,而且是預發布版本。
另外解出的三道為什麼不算分?
那些嘗試預算更大、鷹架有變、嘗試次數也不固定。Epoch 明確把它們排除在 FrontierMath Erdős 分數之外。
0% 是不是表示其他模型完全不會數學?
不是。0% 表示在每題 300 美元、72 小時、一次嘗試的協議下,沒有交出通過 Lean 核驗的證明。多數嘗試是預算耗盡,而不是交了錯證。
和臨時協作工具有什麼關係?
沒有產品綁定。若只是要把官方分和「非正式加跑」畫在一張表上,臨時會議工具對比說明何時用短時瀏覽器空間即可。