ARC-AGI-3の二つの点数とは:2026 Astra標準とアダプタ解説

ARC Prizeは9月3日、AstraのARC-AGI-3を62.7%と99.9%の二系統で出した。旗艦再録ではなく、テスト架の話。

2026年9月3日、ARC Prize財団は公式ブログで GPT-6 AstraARC-AGI-3 Semi-Private を二系統で公表した。Standard harness 62.7%、Provider Adapter 99.9%。同じモデル、同じベンチで三十ポイント以上開く。

旗艦発表の再録ではない。OpenAI も同日 Astra を段階公開していた。本稿は ARC Prize が載せた二系統のハーネスと、財団自身の読み方だけを扱う。Standard はモデル比較、Adapter は提供元の文脈管理を見る。

何を測ったか 二つのハーネス 点数の読み方

二つのハーネス、二つの問い

ARC-AGI-3 は対話的な推論ベンチだ。エージェントは見知らぬターン制環境を探索し、目標を推論し、説明書なしで内部モデルを作る。財団は、人間は全環境を解けると書いてきた。公開直後、当時測った前線システムはいずれも 1% 未満だった。

01

Standard harness

提供元に中立な最小インタフェース。モデルは自分で選んだ可視ノートだけを持ち越せる。Astra(max)は Semi-Private で 62.7%、費用 26,098 ドル。財団は将来の AGI がこの条件で突破すべきだとし、ベンダー横断比較にも使う。

02

Provider Adapter

リクエスト間で見えない推論状態を保持し、長い会話を圧縮して先行作業を再利用する。Astra(high)は 99.9%、費用 18,817 ドル。点は高く、請求は安い。

03

両方を掲示する

財団は今後 ARC-AGI リーダーボードで両条件を併記し、それぞれラベルすると書く。公開テストリポジトリとテスト方針も両方を扱う。

二つの数字の読み方

  1. 1

    まず Standard

    62.7% は他モデルと並べられる数字だ。R&D World など後続解説は買い手の数字として扱う。OpenAI の発表ページは 99.9% を主表に置く。

  2. 2

    Adapter が問うもの

    Adapter は、提供元が自モデル向けに設計した文脈管理を付けたときの到達点を問う。Public と Semi-Private、全推論レベルを通すと、Adapter 実行は記録経過時間で約 3.66 倍速く、両方解けた 167 のゲーム—推論対では総トークンが 49% 少なかった。

  3. 3

    動作効率を見る

    Provider Adapter では Astra(max)が 96.0% のレベルで人間中央値より少ない手数、レベルあたり平均 51.7% 少なかった。財団はこれを完了率ではなく、動作効率での人間パリティの節目と書く。

62.7%
Standard Semi-Private(max)
99.9%
Provider Adapter(high)
96%
人間中央値より少ない手数のレベル

財団が引く線

Astra のリプレイでは、見知らぬ仕組みをコンパクトな記号的世界モデルに圧縮し、状態と計画を追う略記を自作する。PRO-LONG のレッドチーム架では関ごとのパーサやプランナも書いた。財団は、それはモデル+ツールであり、管理された人間試験とは比べられないと注意する。

項目 公開数字 読み方
Standard / max 62.7%、26,098 ドル ベンダー比較にはこちら
Adapter / high 99.9%、18,817 ドル 提供元の文脈管理付き
Adapter / max 98.6%、17,332 ドル 努力を上げても点は上がらない

ARC Prize 自身の文:ARC-AGI-3 を飽和させても「AGI 達成の証明」にはならない。環境は有界、仕組みは決定的、目標は閉じている。開放世界ではない。

Standard が残すもの
可視ノートに何を残すかはモデルが決める。インタフェースは最小で、点数を並べやすい。
Adapter が残すもの
不透明な推論状態がリクエスト間で残り、長い会話は圧縮される。点も所要時間も動く。
人間ベースラインの作り方
公開前に一般約 500 人。レベルごとのベースラインは完了者の手数の中央値。参加者はセッション報酬であり、専門のパズル選手ではない。

チームが一枚の図を欲しいとき

読んだあとに足りないのは、Standard 62.7%、Adapter 99.9%、そして「AGI ではない」という境界の一枚だ。会議スイートは不要。tidemeetで短い空間を開くか、空間の作り方を見る。同週の独立調査はMETR の OpenAI / Hugging Face 報告、別のラボプロトコルはDeepMind の二重盲検エンクレーブ

# 軸
standard-62.7 → adapter-99.9 → not-agi

質問

GPT-6 Astra の発売記事か。

違う。Astra は 9月3日から段階公開された。本稿はその日 ARC Prize が出した二つの ARC-AGI-3 点数とハーネスの違いだけを説明する。

他モデルと比べるならどちらの点か。

財団は Standard をベンダー横断の同一条件とする。Adapter の点は、その提供元の文脈管理を付けた上限であり、同じアダプタを持たないモデルに押し付けてはいけない。

99.9% は AGI か。

財団は否と書く。ARC-AGI-3 の環境は有界で目標は閉じている。Astra を汎化への実質的進展とし、そこで止める。

一時的な会議ツールと何の関係か。

製品の結びつきはない。二つのハーネスを一枚に描くだけなら、一時会議ツール比較が短いブラウザ空間で足りる場合を示す。

スペースを無料で作る