BenchMIRT expliqué : audit Ai2 des bancs LLM au prompt 2026

Ai2 a publié BenchMIRT le 1er septembre : auditer les bancs au prompt, pas au score d’en-tête. Deux axes, pas un récit de flagship.

Le 1er septembre 2026, l’Allen Institute for AI (Ai2) a publié BenchMIRT sur Hugging Face : un audit qui lit un banc au niveau de chaque prompt, pas seulement le score d’en-tête.

Ce n’est pas un autre récit de flagship. Le texte s’en tient à ce qu’Ai2 a écrit : 100 LLM open-weight, 16 bancs, plus de 34 000 questions, et deux dimensions récupérées sans labels — sûreté et raisonnement général.

Qui a publié Ce qui a été mesuré Comment lire

Ce que fait vraiment la méthode

Un banc se vend en général comme une capacité : sûreté, raisonnement ou suivi d’instructions. Un item peut en demander plus. Une question BBQ sur un petit-fils et un grand-père qui réservent un Uber sonde le stéréotype d’âge — et aussi qui-est-qui et la preuve plutôt que l’hypothèse.

01

De l’IRT au MIRT

La théorie de la réponse à l’item vient de la psychométrie : toutes les questions n’apportent pas la même information. Ai2 avait déjà utilisé l’IRT unidimensionnelle dans Fluid Benchmarking. BenchMIRT passe au MIRT pour séparer plusieurs capacités sur le même item.

02

Estimations des deux côtés

Pour un modèle, elle estime la force sur les capacités reflétées par les bancs choisis. Pour chaque question, la difficulté et la capacité de l’item à séparer les modèles plus forts des plus faibles sur ces axes.

03

Pas de labels de capacité

Entraînement sur 100 LLM, 16 bancs et plus de 34 000 items. Six bancs de raisonnement incluent MMLU-Pro, GPQA, MATH et BBH. Dix viennent de la suite sûreté Olmo 3, dont HarmBench, StrongReject, WildJailbreak, BBQ, WMDP et XSTest. L’équipe n’a pas dit à la méthode ce que chaque banc mesure.

Quels deux axes sont revenus

  1. 1

    D’abord la récupération stable

    La méthode a récupéré indépendamment deux dimensions dominantes : sûreté et raisonnement général. Les relances à zéro ont trouvé la même paire. Les hauts scores des bancs de raisonnement suivaient le raisonnement ; les bancs jailbreak et contenus nuisibles suivaient la sûreté.

  2. 2

    Puis les items mal groupés

    BBQ est classé sûreté, mais s’alignait bien plus sur le raisonnement général : un score bas peut aussi venir d’une question difficile à lire, pas seulement du stéréotype. WMDP teste des savoirs dual-use dangereux en biologie, chimie et cyber et s’alignait aussi davantage sur le raisonnement. Un raisonnement général plus fort allait avec des scores WMDP plus bas, car refuser ou ne pas fournir le savoir dangereux est la réponse voulue.

  3. 3

    Puis les scissions dans un banc

    WildJailbreak moyenne des jailbreaks nuisibles et des prompts bénins qui testent le sur-refus. Sur HarmBench, les demandes nuisibles standard et contextuelles s’alignaient davantage sur la sûreté ; les items copyright — par exemple les paroles de « What a Wonderful World » — davantage sur le raisonnement général.

100
Modèles open-weight
16
Bancs
34K+
Questions / tâches

Un jeu plus mince tient-il l’image

Après classement des items par information, garder 10 % des questions sur ces 16 bancs a généralement préservé presque la même image plus fort / plus faible sur la capacité sous-jacente de sûreté ou de raisonnement ; 50 % collait souvent encore mieux au jeu complet. Sur des questions hold-out non observées, la prédiction juste/faux était à 79 % ; une moyenne de banc simple était juste 70 % du temps.

Constat Affirmation publique Lecture
Axes dominants Sûreté / raisonnement général Récupérés sans labels
BBQ, WMDP Plus proches du raisonnement Un score de suite sûreté n’est pas un comportement de sûreté
Coupe d’items 10 % garde surtout l’image Tous les items n’informent pas autant

Ai2 est explicite : cela ne veut pas forcément dire que les bancs sont défectueux. Cela veut dire qu’un score peut empiler plusieurs signaux, et que BenchMIRT sert à les séparer.

Coût si l’on veut seulement un rang
Pour classer les modèles selon la performance prédite sur des items hold-out aléatoires, la moyenne du banc fait légèrement mieux que BenchMIRT. L’avantage de la méthode est le tableau par question, pas le classement global.
Risque d’effacer les items utiles
Les mêmes estimations peuvent servir à retirer les questions de sûreté les plus informatives, pour qu’un modèle peu sûr passe une éval plus faible. Les auteurs jugent la transparence digne de ce risque et le nomment.
Les axes suivent le jeu
Un autre mélange d’évals pourrait faire apparaître d’autres capacités. L’histoire à deux axes est liée à ces 16 bancs.

Quand l’équipe veut un seul croquis

Ensuite il manque souvent un dessin : axe sûreté, axe raisonnement, et pourquoi BBQ / WMDP ne sont pas des scores de sûreté purs. Pas de suite de réunion. Ouvrez tidemeet ou voyez créer un espace. Pour un harness qui déplace un score : les deux scores ARC-AGI-3 ; pour une isolation d’éval cassée : METR et Hugging Face.

# axe
safety ↔ general-reasoning
bbq/wmdp ≠ safety-only

Questions

Est-ce l’histoire d’un nouveau flagship ?

Non. BenchMIRT est une méthode d’audit d’évaluation, pas une sortie de modèle. L’échantillon s’arrête aux open-weight de mars 2025 et avant.

Puis-je noter Astra ou Fable 2026 avec ?

Le billet dit que les modèles d’entraînement et d’évaluation datent tous d’au plus mars 2025. Les générations plus récentes ne sont pas couvertes. Ne pas coller les deux axes sur des flagships hors échantillon.

10 % des items remplacent-ils le banc entier ?

Les auteurs disent que, sur ces 16 bancs, les 10 % les plus informatifs ont généralement gardé l’image plus fort / plus faible. Pour un rang prédit sur des hold-out aléatoires, la moyenne complète reste un peu meilleure.

Quel lien avec un outil de réunion temporaire ?

Aucun lien produit. Pour un seul croquis des deux axes et des bancs mal groupés, voir outils de réunion temporaires.

Créer un espace gratuit