ARC-AGI-3 zwei Werte erklärt: Astra Standard vs Adapter 2026
ARC Prize setzte am 3. September 62,7 % und 99,9 % für Astra auf ARC-AGI-3. Es geht um zwei Harnesses, nicht um eine Launch-Rezension.
Am 3. September 2026 veröffentlichte die Stiftung ARC Prize zwei ARC-AGI-3-Semi-Private-Werte für GPT-6 Astra: 62,7 % im Standard-Harness und 99,9 % im Provider Adapter. Dasselbe Modell, dieselbe Bank, mehr als dreißig Punkte Abstand.
Das ist keine weitere Flaggschiff-Rezension. OpenAI rollte Astra am selben Tag aus. Dieser Text liest nur die zwei Harnesses, die ARC Prize selbst publizierte, und die Lesart der Stiftung: Standard zum Modellvergleich, Adapter für das Context-Management des Anbieters.
Zwei Harnesses, zwei Fragen
ARC-AGI-3 ist eine interaktive Reasoning-Bank: Agenten müssen fremde rundenbasierte Umgebungen erkunden, Ziele erschließen und ohne Anleitung ein internes Modell bauen. Die Stiftung schreibt, Menschen lösen jede Umgebung; beim Start lag jedes getestete Frontier-System unter 1 %.
Standard harness
Minimale, anbieterneutrale Schnittstelle. Das Modell darf nur sichtbare Notizen mitnehmen, die es selbst behält. Astra (max) erreichte 62,7 % auf Semi-Private für 26.098 $. Die Stiftung sagt, eine künftige AGI solle die Bank unter diesen Bedingungen schaffen; der Vergleich über Anbieter läuft hier.
Provider Adapter
Hält undurchsichtigen Reasoning-Zustand zwischen Requests und komprimiert lange Gespräche, damit frühere Arbeit wiederverwendet wird. Astra (high): 99,9 % für 18.817 $. Höherer Wert, niedrigere Rechnung.
Beide auf die Tafel
ARC Prize will künftig beide Bedingungen auf dem ARC-AGI-Leaderboard führen, jeweils beschriftet. Das offene Test-Repo und die Testpolitik decken beide ab.
Die zwei Zahlen lesen
-
1
Zuerst Standard
62,7 % ist die Zahl, die neben andere Modelle darf. R&D World und spätere Erklärstücke behandeln sie als Käuferzahl. OpenAIs Launchseite führt 99,9 %.
-
2
Dann die Frage des Adapters
Der Adapter fragt, wie weit das Modell mit dem Context-Management kommt, das der Anbieter dafür gebaut hat. Über Public und Semi-Private und alle Reasoning-Stufen waren Adapter-Läufe in der erfassten Zeit etwa 3,66× schneller und nutzten 49 % weniger Tokens auf den 167 Spiel-Reasoning-Paaren, die beide lösten.
-
3
Dann Aktionseffizienz
Im Provider Adapter brauchte Astra (max) auf 96,0 % der Level weniger Aktionen als der menschliche Median und im Schnitt 51,7 % weniger Aktionen pro Level. Die Stiftung nennt das einen Meilenstein der Aktionseffizienz gegenüber Menschen, keinen reinen Abschlusswert.
Wo die Stiftung die Linie zieht
In Astras Replays verdichtet das Modell fremde Mechaniken zu einem kompakten symbolischen Weltmodell und erfindet Kurzschrift für Zustand und Pläne. Im PRO-LONG-Red-Team-Harness schrieb es auch spielbezogene Parser und Planer; die Stiftung warnt: das ist Modell plus Werkzeuge, nicht vergleichbar mit dem kontrollierten Menschentest.
| Punkt | Öffentliche Zahl | Lesart |
|---|---|---|
| Standard / max | 62,7 %, 26.098 $ | Für den Anbietervergleich |
| Adapter / high | 99,9 %, 18.817 $ | Mit Anbieter-Context-Management |
| Adapter / max | 98,6 %, 17.332 $ | Mehr Effort heißt nicht mehr Punkte |
Satz von ARC Prize: ARC-AGI-3 zu sättigen ist kein „Beweis für AGI“. Die Umgebungen sind begrenzt, die Mechanik deterministisch, die Ziele geschlossen — nicht die offene Welt.
- Was Standard behält
- Das Modell entscheidet, was in sichtbaren Notizen bleibt. Die Schnittstelle ist minimal, damit Werte nebeneinander sitzen.
- Was der Adapter behält
- Undurchsichtiger Reasoning-Zustand überlebt zwischen Requests; lange Chats werden verdichtet. Wert und Laufzeit bewegen sich.
- Wie die menschliche Baseline entstand
- Etwa 500 Personen aus der Öffentlichkeit vor dem Start; die Baseline pro Level ist der Median der Aktionszahl unter den Fertigen. Teilnehmende wurden pro Sitzung bezahlt, nicht als Puzzle-Profis angeworben.
Wenn das Team eine Skizze braucht
Danach fehlt oft ein Bild: Standard 62,7 %, Adapter 99,9 %, die Linie „kein AGI“. Keine extra Meeting-Suite. Raum auf tidemeet oder Raum anlegen. Unabhängige Eval derselben Woche: METR zu OpenAI / Hugging Face; anderes Laborprotokoll: DeepMinds Doppelblind-Enklave.
# Achse
standard-62.7 → adapter-99.9 → not-agi
Fragen
Ist das eine Astra-Launch-Rezension?
Nein. Astra startete am 3. September gestaffelt. Dieser Text erklärt nur die zwei ARC-AGI-3-Werte, die ARC Prize an dem Tag veröffentlichte, und warum die Harnesses differieren.
Welchen Wert gegen andere Modelle nutzen?
Die Stiftung behandelt Standard als den vergleichbaren Zustand über Anbieter. Der Adapter-Wert ist eine Obergrenze mit dem Context-Management dieses Anbieters; nicht gegen Modelle ohne denselben Adapter pressen.
Ist 99,9 % AGI?
Die Stiftung sagt nein. ARC-AGI-3-Umgebungen sind begrenzt und geschlossen. Astra gilt als substantieller Fortschritt Richtung Generalisierung — und dort endet der Anspruch.
Was hat das mit einem temporären Meeting-Tool zu tun?
Keine Produktbindung. Nur eine Skizze der zwei Harnesses? Siehe temporäre Meeting-Tools.