FrontierMath Erdősとは:2026年Epochの未解決問題Lean評価
Epochは9月1日にFrontierMath Erdősを出した。68問、Lean検証。旗艦再録ではなく、評価プロトコルの話。
2026年9月1日、Epoch AI は FrontierMath Erdős を公開した。数学的に重いと見なされた未解決の Erdős 問題 68 問を Lean で述べ、固定予算内で機械検証可能な証明または反証を出さなければ得点にならない。
旗艦発表の再録ではない。本稿は Epoch が書いた題庫・プロトコル・初回表だけを読む。プレリリースの GPT-6 Astra は 3%(2/68)。同じ予算で他の 4 システムは 0% だった。
ベンチが実際に測っていること
「Erdős 問題」は同一難度のセットではない。Thomas Bloom の erdosproblems.com は当時約 1217 問を載せ、うち 652 問が未解決だった。Epoch は Bloom に、重要かつ難しいと感じる 68 問を選ばせた。当時の未解決の約 10% で、2026年8月時点ではすべて未解決だった。
全カタログではなく選定
Bloom の粗い見積もりでは、2026年8月までにこの級の Erdős 問題を AI が解いたのは 3–5 問程度。リストは主観的だ。Epoch は、いくつかは不要だと思われても、別のいくつかは当然だと思われれば選定は足りると書く。
自然言語論文ではなく Lean 検証
得点条件は、検証を通る Lean の証明または反証である。68 問中 50 問は Google の Formal Conjectures ですでに形式化済み。残り 18 問は AI で形式化した。Epoch は自前が Lean の専門家集団ではないとし、追加レビューを求めている。検証には Lean FRO の Comparator も使い、不正提出への耐性を狙う。
公開ハーネスと固定予算
評価コードはオープンソース。既定は各問1回、$300 の推論予算、作業時間 72 時間。モデルにネットはなく、オフラインの数学論文集と計算機代数系などのツールだけを使う。
初回ランの採点
-
1
まず固定プロトコル
走らせたのは 5 システム:プレリリース GPT-6 Astra、GPT-5.6 Sol、GPT-5.5、Claude Fable 5.1、Claude Fable 5。各問1回。Lean 検証が通ったときだけ解けたと数える。
-
2
次に公式点
何かを解いたのは Astra だけ:68 問中 2 問、すなわち 3%。第74問は反例で反証(218ドル、15時間)、第126問は証明(247ドル、16時間)。Astra の残り 66 回と他 4 システムの全試行は、予算内に検証済み証明を出せなかった。
-
3
追加試行はこの点数ではない
別途、同じプレリリース Astra に大きい予算と変えた足場で、体系的でない試行をした。少なくとも 5 問(1、548、571 も含む)が一度は解け、全試行で 22 万ドル超、公式ランは約 2 万ドル。Epoch は公式点がなお 3% だと明記する。
3% が言うこと、言わないこと
Epoch 自身の読みは、この足場・この予算では Astra が「重い未解決」リストの約 3% を解いた、というものだ。AI によるこの種の突破は確かに起きている。だが任意の一問が高い確率で落ちる段階ではない——少なくとも 300 ドル内で形式化まで求めるなら。
| システム | 公式点 | 読み方 |
|---|---|---|
| GPT-6 Astra | 3% (2/68) | プレリリース;公式では唯一の解答 |
| GPT-5.6 Sol / GPT-5.5 | 0% | 予算内に検証済み証明なし |
| Claude Fable 5.1 / 5 | 0% | 同じプロトコル。別セットではない |
Epoch は、目立つ AI 数学の結果の多くが社内で、方法はあまり公開されていないと書く。FrontierMath Erdős は問題・ハーネス・予算を一箇所に書くためのものだ。
- 形式化は別プロジェクト
- 自然言語での突破と Lean 化はほぼ別仕事だ。Epoch は単位距離予想を挙げる。18ページの文章に対し、後の Lean 化は約 120 万行。ライブラリに無い深い結果を一から導く必要があったためだ。
- 汚染は後から重くなる
- 当面は古典的な公開ベンチとして走り、強い汚染対策はしない。68 問は 2026年8月時点で解が無く、その前に学習を終えたモデルが答えを覚えているはずはない。後続モデルは、当時まだ未解決の残りで比べられる。
- Erdős は数学の全部ではない
- リストは全分野の標本ではない。Epoch は一般的な数学能力の進展とある程度相関すると見つつ、推論は厳密ではないと書く。
チームが一枚の表を欲しいとき
読んだあとに足りないのは、公式の 3% と 0% の列と、「予算を増やしたら数問増えた」を総点に書けない理由の一枚だ。会議スイートは不要。tidemeetで短い空間を開くか、空間の作り方を見る。設問単位の監査はBenchMIRT、ハーネスが点数を変える話はARC-AGI-3 の二つの点数。
# protocol
lean-proof | $300 | 72h
official = 2/68
extras ≠ score
質問
Astra の発表記事か。
違う。主題は Epoch の新しい評価プロトコルだ。Astra は初回 5 システムの一つで、採点されたコピーはプレリリースである。
追加の 3 問はなぜ点数に入らないか。
予算が大きく、足場が変わり、試行回数も揃っていない。Epoch はそれらを FrontierMath Erdős の点数から外している。
0% は他モデルが数学できないという意味か。
違う。0% は、1問 300 ドル・72 時間・1 回のプロトコルで、Lean 検証を通る証明を出せなかった、という意味だ。多くは誤証の提出ではなく予算切れである。
一時的な会議ツールと何の関係か。
製品の結びつきはない。公式表と非公式の追加ランを一枚に描くだけなら、一時会議ツール比較が短いブラウザ空間で足りる場合を示す。