FrontierMath Erdős是什麼:2026年Epoch開放題Lean基準全解析

Epoch在9月1日放出FrontierMath Erdős:68道開放題、Lean核驗。故事是評測協議,不是又一篇旗艦稿。

2026年9月1日,Epoch AI 發布 FrontierMath Erdős:把 68 道仍開放、且被認定有數學分量的 Erdős 問題寫成 Lean 命題,模型必須在固定預算內給出可核驗的證明或反駁。

這不是又一篇旗艦發布稿。本篇只讀 Epoch 自己寫明的題庫、協議和首輪分數:預發布 GPT-6 Astra 得 3%(2/68),另外四套系統在同一預算下為 0%。

誰發布 測了什麼 怎麼讀分

基準實際在測什麼

「Erdős 問題」並不是同一難度的一套題。Thomas Bloom 維護的 erdosproblems.com 當時收錄約 1217 道,其中 652 道仍開放。Epoch 請 Bloom 從仍開放的題裡挑出他認為既重要又難的 68 道,約佔當時未解題的 10%,且截至 2026年8月仍無解。

01

選題,而不是題庫全收

Bloom 估計,到 2026年8月,這一檔次的 Erdős 題被 AI 解出的大約只有 3–5 道。名單是主觀的;Epoch 寫明:只要別人既覺得有些題不該進、又覺得另一些題必須進,選題就算及格。

02

Lean 核驗,而不是自然語言論文

算分條件是產出通過核驗的 Lean 證明或反駁。68 道裡有 50 道已在 Google 的 Formal Conjectures 專案中形式化;其餘 18 道由 AI 形式化,Epoch 寫明自己不是 Lean 專家,正在尋求額外審閱。核驗還用了 Lean FRO 的 Comparator,用來抵禦作弊提交。

03

公開鷹架,固定預算

評測程式碼開源。預設每題一次嘗試、推理預算 300 美元、工作時間 72 小時。模型沒有連網,只能用離線數學論文集和電腦代數系統一類工具。

首輪怎麼跑、怎麼計分

  1. 1

    先看固定協議

    已跑五套系統:預發布 GPT-6 Astra、GPT-5.6 Sol、GPT-5.5、Claude Fable 5.1、Claude Fable 5。每題一次嘗試。只有 Lean 核驗通過才算解出。

  2. 2

    再看官方分數

    只有 Astra 解出任何題:68 道中的 2 道,即 3%。第 74 題用反例推翻,花費 218 美元、15 小時;第 126 題給出證明,花費 247 美元、16 小時。Astra 其餘 66 次嘗試,以及其他四套系統的全部嘗試,都在預算內沒有交出可核驗證明。

  3. 3

    額外嘗試不是這項分數

    Epoch 另用同一預發布 Astra、更大預算和變動鷹架做了不系統的嘗試。那些嘗試至少解出 5 道(另含第 1、548、571 題),全部嘗試花費超過 22 萬美元,官方跑大約 2 萬美元。Epoch 寫明:官方分仍是上面的 3%。

68
仍開放的 Erdős 題
$300
每題預設預算
72 h
每題工作時限

3% 說明什麼、不說明什麼

Epoch 自己的讀法是:在這個鷹架、這個預算下,Astra 解出這份「有分量開放題」名單的約 3%。這說明 AI 做出這類突破已經真實發生,但還遠談不上對任意一題都有高勝率——至少在必須於 300 美元內完成形式化時是如此。

系統 官方分 怎麼讀
GPT-6 Astra 3% (2/68) 預發布版本;協議內唯二解
GPT-5.6 Sol / GPT-5.5 0% 預算內零核驗證明
Claude Fable 5.1 / 5 0% 同協議,不是另一套題

Epoch 寫明:最醒目的 AI 數學結果多來自公司內部、過程不透明。FrontierMath Erdős 想把題、鷹架和預算一次寫清。

形式化是額外負擔
用自然語言做出突破,和把它寫成 Lean,幾乎是兩件事。Epoch 舉過單位距離猜想:自然語言約 18 頁,後續 Lean 形式化約 120 萬行,因為要補標準庫裡還沒有的深層結果。
污染會隨時間變重
現階段按公開基準跑、不強防污染。這 68 道在 2026年8月尚無解,訓練截止早於該日的模型不可能背過答案。以後可按訓練截止過濾已解題。
Erdős 不是全部數學
名單覆蓋不了數學各分支。Epoch 預期進展會與一般數學能力有相關,但寫明推斷並不嚴密。

和同事對齊分數時

讀完通常缺一張圖:官方 3%、0% 列,以及「多花算力多解幾道」為什麼不能寫進總分。不必再裝會議套件。可在tidemeet開短時空間,或看如何建立空間。同站對題目級審計,見BenchMIRT;對測試架怎麼改分,見ARC-AGI-3 雙分數

# protocol
lean-proof | $300 | 72h
official = 2/68
extras ≠ score

還有疑問?

這是在寫 Astra 發布嗎?

不是。主題是 Epoch 的新評測協議。Astra 只是首輪五個被測系統之一,而且是預發布版本。

另外解出的三道為什麼不算分?

那些嘗試預算更大、鷹架有變、嘗試次數也不固定。Epoch 明確把它們排除在 FrontierMath Erdős 分數之外。

0% 是不是表示其他模型完全不會數學?

不是。0% 表示在每題 300 美元、72 小時、一次嘗試的協議下,沒有交出通過 Lean 核驗的證明。多數嘗試是預算耗盡,而不是交了錯證。

和臨時協作工具有什麼關係?

沒有產品綁定。若只是要把官方分和「非正式加跑」畫在一張表上,臨時會議工具對比說明何時用短時瀏覽器空間即可。

免費建立空間