FrontierMath Erdős란: 2026 Epoch 미해결 문제 Lean 벤치 해설
Epoch는 9월 1일 FrontierMath Erdős를 냈다. 68문제, Lean 검증. 플래그십 재탕이 아니라 평가 프로토콜 이야기다.
2026년 9월 1일 Epoch AI는 FrontierMath Erdős를 공개했다. 수학적으로 무겁다고 본 미해결 Erdős 문제 68개를 Lean으로 적고, 고정 예산 안에서 기계 검증 가능한 증명 또는 반박을 내야 점수가 난다.
또 한 편의 플래그십 기사가 아니다. 이 글은 Epoch가 적어 둔 문제 세트·프로토콜·첫 표만 읽는다. 프리릴리스 GPT-6 Astra는 3%(2/68). 같은 예산에서 다른 네 시스템은 0%였다.
벤치가 실제로 재는 것
“Erdős 문제”는 한 난이도 묶음이 아니다. Thomas Bloom의 erdosproblems.com은 당시 약 1217개를 실었고 652개가 미해결이었다. Epoch는 Bloom에게 중요하고 어렵다고 본 68개를 고르게 했다. 당시 미해결의 약 10%이며 2026년 8월 기준으로 모두 열려 있었다.
전체 목록이 아니라 선정
Bloom의 거친 추정으로는 2026년 8월까지 이 급의 Erdős 문제를 AI가 푼 것은 3–5개 정도다. 목록은 주관적이다. Epoch는 어떤 문항은 빼야 한다고 느껴도 다른 문항은 당연히 넣어야 한다고 느끼면 선정은 충분하다고 쓴다.
자연어 논문이 아니라 Lean 검증
점수 조건은 검증을 통과한 Lean 증명 또는 반박이다. 68개 중 50개는 Google Formal Conjectures에 이미 형식화돼 있었고, 나머지 18개는 AI로 형식화했다. Epoch는 자신들이 Lean 전문가 집단이 아니며 추가 검토를 구하고 있다고 적는다. 검증에는 부정 제출에 견디도록 만든 Lean FRO의 Comparator도 쓴다.
공개 하니스와 고정 예산
평가 코드는 오픈소스다. 기본은 문제당 1회, 추론 예산 300달러, 작업 시간 72시간. 모델은 인터넷이 없고 오프라인 수학 논문 모음과 컴퓨터 대수 시스템 같은 도구만 받는다.
첫 런의 채점
-
1
먼저 고정 프로토콜
돌린 시스템은 다섯 개다. 프리릴리스 GPT-6 Astra, GPT-5.6 Sol, GPT-5.5, Claude Fable 5.1, Claude Fable 5. 문제당 한 번. Lean 검증이 통과해야 푼 것으로 센다.
-
2
다음엔 공식 점수
무엇을 푼 것은 Astra뿐이다. 68개 중 2개, 즉 3%. 74번은 반례로 반박(218달러, 15시간), 126번은 증명(247달러, 16시간). Astra의 나머지 66회와 다른 네 시스템의 모든 시도는 예산 안에서 검증된 증명을 내지 못했다.
-
3
추가 시도는 이 점수가 아니다
별도로 같은 프리릴리스 Astra에 더 큰 예산과 바뀐 스캐폴드로 비체계적 시도를 했다. 적어도 5개(1, 548, 571 포함)가 한 번은 풀렸고, 전체 시도는 22만 달러가 넘으며 공식 런은 약 2만 달러다. Epoch는 공식 점이 여전히 3%라고 명시한다.
3%가 말하는 것과 말하지 않는 것
Epoch 자신의 해석은, 이 스캐폴드와 이 예산에서 Astra가 “무거운 미해결” 목록의 약 3%를 풀었다는 것이다. 이런 돌파가 실제로 일어난다는 데이터 포인트이지, 임의의 한 문제가 높은 확률로 떨어진다는 뜻은 아니다. 적어도 300달러 안에 형식화까지 요구하면 그렇다.
| 시스템 | 공식 점수 | 읽는 법 |
|---|---|---|
| GPT-6 Astra | 3% (2/68) | 프리릴리스; 공식에선 유일한 풀이 |
| GPT-5.6 Sol / GPT-5.5 | 0% | 예산 내 검증 증명 없음 |
| Claude Fable 5.1 / 5 | 0% | 같은 프로토콜, 다른 세트가 아님 |
Epoch는 눈에 띄는 AI 수학 결과 상당수가 랩 내부에서 나왔고 방법은 거의 공개되지 않았다고 쓴다. FrontierMath Erdős는 문제·하니스·예산을 한곳에 적기 위한 것이다.
- 형식화는 별도 작업
- 자연어 돌파와 Lean 형식화는 거의 다른 일이다. Epoch는 단위 거리 추측을 든다. 18쪽 글에 대해 이후 Lean 작업은 약 120만 줄이다. 라이브러리에 아직 없는 깊은 결과를 처음부터 이끌어내야 했기 때문이다.
- 오염은 시간이 갈수록 커진다
- 당장은 고전적 공개 벤치로 돌리고 강한 오염 방지는 하지 않는다. 68개는 2026년 8월 기준 알려진 해가 없어, 그 전에 학습이 끝난 모델이 답을 외웠을 수는 없다. 이후 모델은 그때까지 남은 미해결로 비교할 수 있다.
- Erdős가 수학 전부가 아니다
- 목록은 모든 분야의 표본이 아니다. Epoch는 일반 수학 능력 진전과 어느 정도 상관을 기대하면서도 추론이 단단하지는 않다고 적는다.
팀에 표 한 장이 필요할 때
읽고 나면 보통 공식 3%와 0% 열, 그리고 예산을 더 써서 몇 문제를 더 푼 것을 총점에 쓰면 안 되는 이유의 한 장이 필요하다. 회의 스위트는 필요 없다. tidemeet에서 짧은 공간을 열거나 공간 만들기를 본다. 문항 단위 감사는 BenchMIRT, 하니스가 점수를 바꾸는 이야기는 ARC-AGI-3 두 점수.
# protocol
lean-proof | $300 | 72h
official = 2/68
extras ≠ score
질문
Astra 출시 기사인가?
아니다. 주제는 Epoch의 새 평가 프로토콜이다. Astra는 첫 런 다섯 시스템 중 하나이고, 채점된 사본은 프리릴리스다.
추가로 푼 세 문제는 왜 점수에 안 넣나?
예산이 더 크고 스캐폴드가 달랐으며 재시도 횟수도 일정하지 않다. Epoch는 이를 FrontierMath Erdős 점수에서 뺀다.
0%는 다른 모델이 수학을 못 한다는 뜻인가?
아니다. 0%는 문제당 300달러·72시간·1회 프로토콜에서 Lean 검증을 통과한 증명을 내지 못했다는 뜻이다. 대부분은 틀린 증명을 낸 것이 아니라 예산이 끝난 것이다.
임시 회의 도구와 무슨 관계인가?
제품 연동은 없다. 공식 표와 비공식 추가 런만 한 장에 그리면 임시 회의 도구 비교가 짧은 브라우저 공간으로 충분한 때를 설명한다.