ARC-AGI-3 두 점수란: 2026 Astra 표준과 어댑터 전 해설
ARC Prize는 9월 3일 Astra의 ARC-AGI-3를 62.7%와 99.9% 두 세트로 냈다. 플래그십 재탕이 아니라 테스트 프레임 이야기다.
2026년 9월 3일 ARC Prize 재단은 공식 블로그에서 GPT-6 Astra의 ARC-AGI-3 Semi-Private 점수를 두 세트로 공개했다. Standard harness 62.7%, Provider Adapter 99.9%. 같은 모델, 같은 벤치에서 30포인트 이상 벌어진다.
또 한 편의 플래그십 출시 기사가 아니다. OpenAI도 같은 날 Astra를 단계 공개했다. 이 글은 ARC Prize가 올린 두 하니스와 재단 자신의 읽기만 다룬다. Standard는 모델 비교, Adapter는 제공자의 맥락 관리를 본다.
두 하니스, 두 질문
ARC-AGI-3는 상호작용 추론 벤치다. 에이전트는 낯선 턴제 환경을 탐색하고 목표를 추론하며 설명서 없이 내부 모델을 만든다. 재단은 인간이 모든 환경을 풀 수 있다고 써 왔다. 벤치 공개 직후, 당시 측정한 전선 시스템은 모두 1% 미만이었다.
Standard harness
제공자 중립의 최소 인터페이스. 모델은 스스로 고른 가시 노트만 가져갈 수 있다. Astra(max)는 Semi-Private에서 62.7%, 비용 26,098달러. 재단은 미래 AGI가 이 조건에서 통과해야 한다고 보며, 벤더 간 비교에도 쓴다.
Provider Adapter
요청 사이에 보이지 않는 추론 상태를 유지하고 긴 대화를 압축해 이전 작업을 재사용한다. Astra(high)는 99.9%, 비용 18,817달러. 점수는 높고 청구는 낮다.
둘 다 게시판에
재단은 앞으로 ARC-AGI 리더보드에 두 조건을 함께 올리고 각각 라벨한다고 쓴다. 공개 테스트 저장소와 테스트 정책도 둘을 다룬다.
두 숫자를 읽는 법
-
1
먼저 Standard
62.7%는 다른 모델 옆에 놓을 숫자다. R&D World 등 후속 해설은 구매자가 가져갈 숫자로 본다. OpenAI 발표 페이지는 99.9%를 주표에 둔다.
-
2
Adapter가 묻는 것
Adapter는 제공자가 자사 모델용으로 만든 맥락 관리를 붙였을 때의 도달점을 묻는다. Public과 Semi-Private, 모든 추론 수준을 합치면 Adapter 실행은 기록 경과 시간으로 약 3.66배 빠르고, 양쪽이 푼 167개 게임–추론 쌍에서 총 토큰이 49% 적었다.
-
3
동작 효율을 본다
Provider Adapter에서 Astra(max)는 레벨의 96.0%에서 인간 중앙값보다 적은 동작, 레벨당 평균 51.7% 적었다. 재단은 이를 완료율이 아니라 동작 효율에서 인간 패리티의 이정표로 쓴다.
재단이 긋는 선
Astra 리플레이에서 모델은 낯선 메커니즘을 압축된 기호 세계 모델로 줄이고 상태와 계획을 쫓는 약기를 만든다. PRO-LONG 레드팀 하니스에서는 게임별 파서와 플래너도 썼다. 재단은 그것이 모델+도구이며 통제된 인간 시험과 비교할 수 없다고 경고한다.
| 항목 | 공개 숫자 | 읽는 법 |
|---|---|---|
| Standard / max | 62.7%, 26,098달러 | 벤더 비교는 이쪽 |
| Adapter / high | 99.9%, 18,817달러 | 제공자 맥락 관리 포함 |
| Adapter / max | 98.6%, 17,332달러 | 노력을 올려도 점수가 오르지 않음 |
ARC Prize 자신의 문장: ARC-AGI-3를 포화시켜도 「AGI 달성의 증명」이 아니다. 환경은 유계이고 메커니즘은 결정적이며 목표는 닫혀 있다. 열린 세계가 아니다.
- Standard가 남기는 것
- 가시 노트에 무엇을 남길지는 모델이 정한다. 인터페이스는 최소라 점수를 나란히 놓기 쉽다.
- Adapter가 남기는 것
- 불투명 추론 상태가 요청 사이에 남고 긴 대화는 압축된다. 점수와 소요 시간이 모두 움직인다.
- 인간 베이스라인의 출처
- 공개 전 일반인 약 500명. 레벨별 베이스라인은 완료자의 동작 수 중앙값. 참가자는 세션 보상이며 전문 퍼즐 선수가 아니다.
팀에 그림 한 장이 필요할 때
읽고 나면 보통 Standard 62.7%, Adapter 99.9%, 「AGI가 아니다」라는 경계의 한 장이 필요하다. 회의 스위트는 필요 없다. tidemeet에서 짧은 공간을 열거나 공간 만들기를 본다. 같은 주 독립 조사는 METR의 OpenAI / Hugging Face 보고, 다른 랩 프로토콜은 DeepMind 이중맹검 엔클레이브.
# 축
standard-62.7 → adapter-99.9 → not-agi
질문
GPT-6 Astra 출시 기사인가?
아니다. Astra는 9월 3일부터 단계 공개됐다. 이 글은 그날 ARC Prize가 올린 두 ARC-AGI-3 점수와 하니스 차이만 설명한다.
다른 모델과 비교할 점수는?
재단은 Standard를 벤더 간 동일 조건으로 본다. Adapter 점수는 그 제공자의 맥락 관리를 붙인 상한이며, 같은 어댑터가 없는 모델에 들이대면 안 된다.
99.9%면 AGI인가?
재단은 아니라고 쓴다. ARC-AGI-3 환경은 유계이고 목표는 닫혀 있다. Astra를 일반화를 향한 실질적 진전으로 보고 거기서 멈춘다.
임시 회의 도구와 무슨 관계인가?
제품 연동은 없다. 두 하니스를 한 장에 그리면 임시 회의 도구 비교가 짧은 브라우저 공간으로 충분한 때를 설명한다.