ARC-AGI-3 deux scores expliqués : Astra Standard vs Adapter 2026
ARC Prize a affiché 62,7 % et 99,9 % pour Astra sur ARC-AGI-3 le 3 septembre. L’enjeu : deux harnesses, pas un récit de lancement.
Le 3 septembre 2026, la fondation ARC Prize a publié deux scores ARC-AGI-3 Semi-Private pour GPT-6 Astra : 62,7 % au harness Standard et 99,9 % au Provider Adapter. Même modèle, même banc, plus de trente points d’écart.
Ce n’est pas un autre récit de lancement. OpenAI déployait Astra le même jour. Ce texte ne lit que les deux harnesses publiés par ARC Prize et la règle de la fondation : Standard pour comparer les modèles, Adapter pour la gestion de contexte du fournisseur.
Deux harnesses, deux questions
ARC-AGI-3 est un banc de raisonnement interactif : l’agent explore des environnements au tour par tour inconnus, infère des buts et construit un modèle interne sans notice. La fondation écrit que les humains résolvent tous les environnements ; au lancement, chaque système frontière testé était sous 1 %.
Standard harness
Interface minimale, neutre vis-à-vis du fournisseur. Le modèle n’emporte que les notes visibles qu’il choisit. Astra (max) : 62,7 % sur Semi-Private pour 26 098 $. La fondation estime qu’une future AGI doit passer le banc dans ces conditions ; la comparaison inter-fournisseurs passe par là.
Provider Adapter
Conserve un état de raisonnement opaque entre requêtes et compacte les longues conversations pour réutiliser le travail antérieur. Astra (high) : 99,9 % pour 18 817 $. Meilleur score, facture plus basse.
Les deux au tableau
ARC Prize dit qu’il publiera les deux conditions sur le classement ARC-AGI, chacune étiquetée. Le dépôt de tests ouvert et la politique de test couvrent les deux.
Lire les deux chiffres
-
1
D’abord le Standard
62,7 % est le chiffre à poser à côté des autres modèles. R&D World et les explications suivantes le traitent comme le chiffre de l’acheteur. La page de lancement OpenAI met 99,9 % en tête.
-
2
Puis ce que mesure l’Adapter
L’Adapter demande jusqu’où va le modèle avec la gestion de contexte conçue par son fournisseur. Sur Public et Semi-Private et tous les niveaux de raisonnement, les runs Adapter étaient environ 3,66× plus rapides en temps écoulé enregistré et ont utilisé 49 % de jetons en moins sur les 167 paires jeu–raisonnement résolues par les deux.
-
3
Puis l’efficacité d’action
Sur le Provider Adapter, Astra (max) a utilisé moins d’actions que la médiane humaine sur 96,0 % des niveaux et 51,7 % d’actions en moins par niveau en moyenne. La fondation y voit un jalon de parité humaine sur l’efficacité d’action, pas un score de seule complétion.
Où la fondation trace la ligne
Dans les replays d’Astra, le modèle condense des mécaniques inconnues en un modèle du monde symbolique compact et invente une sténo pour l’état et les plans. Dans le harness red-team PRO-LONG, il a aussi écrit des parseurs et planificateurs par jeu ; la fondation prévient : c’est modèle plus outils, incomparable au test humain contrôlé.
| Poste | Chiffre public | Lecture |
|---|---|---|
| Standard / max | 62,7 %, 26 098 $ | Pour comparer les fournisseurs |
| Adapter / high | 99,9 %, 18 817 $ | Avec la gestion de contexte du fournisseur |
| Adapter / max | 98,6 %, 17 332 $ | Plus d’effort n’est pas toujours plus de points |
Phrase d’ARC Prize : saturer ARC-AGI-3 n’est pas une « preuve d’AGI ». Les environnements sont bornés, les mécaniques déterministes, les buts fermés — pas le monde ouvert.
- Ce que garde le Standard
- Le modèle décide ce qui reste dans les notes visibles. L’interface est minimale pour aligner les scores.
- Ce que garde l’Adapter
- L’état de raisonnement opaque survit entre requêtes ; les longs chats sont compactés. Score et durée bougent.
- D’où vient la baseline humaine
- Environ 500 personnes du public avant le lancement ; la baseline par niveau est la médiane des actions chez ceux qui ont fini. Les participants étaient payés à la séance, pas recrutés comme spécialistes de puzzles.
Quand l’équipe veut un seul croquis
Ensuite il manque souvent un dessin : Standard 62,7 %, Adapter 99,9 %, la ligne « pas AGI ». Pas de suite de réunion. Ouvrez tidemeet ou voyez créer un espace. Autre éval indépendante de la semaine : rapport METR OpenAI / Hugging Face ; autre protocole de labo : enclave en double aveugle DeepMind.
# axe
standard-62.7 → adapter-99.9 → not-agi
Questions
Est-ce un récit du lancement d’Astra ?
Non. Astra a commencé un déploiement échelonné le 3 septembre. Ce texte n’explique que les deux scores ARC-AGI-3 publiés ce jour-là par ARC Prize et pourquoi les harnesses diffèrent.
Quel score face aux autres modèles ?
La fondation traite le Standard comme la condition comparable entre fournisseurs. Le score Adapter est une borne haute avec la gestion de contexte de ce fournisseur ; ne pas le coller à des modèles sans le même adaptateur.
99,9 % veut-il dire AGI ?
La fondation dit non. Les environnements ARC-AGI-3 sont bornés et fermés. Elle voit en Astra un progrès réel vers la généralisation, et s’arrête là.
Quel lien avec un outil de réunion temporaire ?
Aucun lien produit. Pour un seul croquis des deux harnesses, voir outils de réunion temporaires.