BenchMIRT expliqué : audit Ai2 des bancs LLM au prompt 2026
Ai2 a publié BenchMIRT le 1er septembre : auditer les bancs au prompt, pas au score d’en-tête. Deux axes, pas un récit de flagship.
Le 1er septembre 2026, l’Allen Institute for AI (Ai2) a publié BenchMIRT sur Hugging Face : un audit qui lit un banc au niveau de chaque prompt, pas seulement le score d’en-tête.
Ce n’est pas un autre récit de flagship. Le texte s’en tient à ce qu’Ai2 a écrit : 100 LLM open-weight, 16 bancs, plus de 34 000 questions, et deux dimensions récupérées sans labels — sûreté et raisonnement général.
Ce que fait vraiment la méthode
Un banc se vend en général comme une capacité : sûreté, raisonnement ou suivi d’instructions. Un item peut en demander plus. Une question BBQ sur un petit-fils et un grand-père qui réservent un Uber sonde le stéréotype d’âge — et aussi qui-est-qui et la preuve plutôt que l’hypothèse.
De l’IRT au MIRT
La théorie de la réponse à l’item vient de la psychométrie : toutes les questions n’apportent pas la même information. Ai2 avait déjà utilisé l’IRT unidimensionnelle dans Fluid Benchmarking. BenchMIRT passe au MIRT pour séparer plusieurs capacités sur le même item.
Estimations des deux côtés
Pour un modèle, elle estime la force sur les capacités reflétées par les bancs choisis. Pour chaque question, la difficulté et la capacité de l’item à séparer les modèles plus forts des plus faibles sur ces axes.
Pas de labels de capacité
Entraînement sur 100 LLM, 16 bancs et plus de 34 000 items. Six bancs de raisonnement incluent MMLU-Pro, GPQA, MATH et BBH. Dix viennent de la suite sûreté Olmo 3, dont HarmBench, StrongReject, WildJailbreak, BBQ, WMDP et XSTest. L’équipe n’a pas dit à la méthode ce que chaque banc mesure.
Quels deux axes sont revenus
-
1
D’abord la récupération stable
La méthode a récupéré indépendamment deux dimensions dominantes : sûreté et raisonnement général. Les relances à zéro ont trouvé la même paire. Les hauts scores des bancs de raisonnement suivaient le raisonnement ; les bancs jailbreak et contenus nuisibles suivaient la sûreté.
-
2
Puis les items mal groupés
BBQ est classé sûreté, mais s’alignait bien plus sur le raisonnement général : un score bas peut aussi venir d’une question difficile à lire, pas seulement du stéréotype. WMDP teste des savoirs dual-use dangereux en biologie, chimie et cyber et s’alignait aussi davantage sur le raisonnement. Un raisonnement général plus fort allait avec des scores WMDP plus bas, car refuser ou ne pas fournir le savoir dangereux est la réponse voulue.
-
3
Puis les scissions dans un banc
WildJailbreak moyenne des jailbreaks nuisibles et des prompts bénins qui testent le sur-refus. Sur HarmBench, les demandes nuisibles standard et contextuelles s’alignaient davantage sur la sûreté ; les items copyright — par exemple les paroles de « What a Wonderful World » — davantage sur le raisonnement général.
Un jeu plus mince tient-il l’image
Après classement des items par information, garder 10 % des questions sur ces 16 bancs a généralement préservé presque la même image plus fort / plus faible sur la capacité sous-jacente de sûreté ou de raisonnement ; 50 % collait souvent encore mieux au jeu complet. Sur des questions hold-out non observées, la prédiction juste/faux était à 79 % ; une moyenne de banc simple était juste 70 % du temps.
| Constat | Affirmation publique | Lecture |
|---|---|---|
| Axes dominants | Sûreté / raisonnement général | Récupérés sans labels |
| BBQ, WMDP | Plus proches du raisonnement | Un score de suite sûreté n’est pas un comportement de sûreté |
| Coupe d’items | 10 % garde surtout l’image | Tous les items n’informent pas autant |
Ai2 est explicite : cela ne veut pas forcément dire que les bancs sont défectueux. Cela veut dire qu’un score peut empiler plusieurs signaux, et que BenchMIRT sert à les séparer.
- Coût si l’on veut seulement un rang
- Pour classer les modèles selon la performance prédite sur des items hold-out aléatoires, la moyenne du banc fait légèrement mieux que BenchMIRT. L’avantage de la méthode est le tableau par question, pas le classement global.
- Risque d’effacer les items utiles
- Les mêmes estimations peuvent servir à retirer les questions de sûreté les plus informatives, pour qu’un modèle peu sûr passe une éval plus faible. Les auteurs jugent la transparence digne de ce risque et le nomment.
- Les axes suivent le jeu
- Un autre mélange d’évals pourrait faire apparaître d’autres capacités. L’histoire à deux axes est liée à ces 16 bancs.
Quand l’équipe veut un seul croquis
Ensuite il manque souvent un dessin : axe sûreté, axe raisonnement, et pourquoi BBQ / WMDP ne sont pas des scores de sûreté purs. Pas de suite de réunion. Ouvrez tidemeet ou voyez créer un espace. Pour un harness qui déplace un score : les deux scores ARC-AGI-3 ; pour une isolation d’éval cassée : METR et Hugging Face.
# axe
safety ↔ general-reasoning
bbq/wmdp ≠ safety-only
Questions
Est-ce l’histoire d’un nouveau flagship ?
Non. BenchMIRT est une méthode d’audit d’évaluation, pas une sortie de modèle. L’échantillon s’arrête aux open-weight de mars 2025 et avant.
Puis-je noter Astra ou Fable 2026 avec ?
Le billet dit que les modèles d’entraînement et d’évaluation datent tous d’au plus mars 2025. Les générations plus récentes ne sont pas couvertes. Ne pas coller les deux axes sur des flagships hors échantillon.
10 % des items remplacent-ils le banc entier ?
Les auteurs disent que, sur ces 16 bancs, les 10 % les plus informatifs ont généralement gardé l’image plus fort / plus faible. Pour un rang prédit sur des hold-out aléatoires, la moyenne complète reste un peu meilleure.
Quel lien avec un outil de réunion temporaire ?
Aucun lien produit. Pour un seul croquis des deux axes et des bancs mal groupés, voir outils de réunion temporaires.