BenchMIRT erklärt: Ai2 prüft LLM-Bänke auf Prompt-Ebene 2026
Ai2 stellte BenchMIRT am 1. September vor: Bänke auf Prompt-Ebene prüfen. Zwei Achsen, keine Flaggschiff-Rezension.
Am 1. September 2026 veröffentlichte das Allen Institute for AI (Ai2) auf Hugging Face BenchMIRT: ein Audit, das eine Bank auf Prompt-Ebene liest, nicht nur den Kopfwert.
Keine weitere Flaggschiff-Rezension. Der Text bleibt bei dem, was Ai2 festgehalten hat: 100 Open-Weight-LLMs, 16 Benchmarks, mehr als 34.000 Fragen — und zwei Dimensionen, die die Methode ohne Labels zurückholte: Sicherheit und allgemeines Reasoning.
Was die Methode tatsächlich tut
Eine Bank wird meist als eine Fähigkeit verkauft: Sicherheit, Reasoning oder Instruction Following. Ein einzelnes Item kann mehr verlangen. Eine BBQ-Frage zu Enkel und Großvater beim Uber-Buchen prüft Altersstereotype — und wer-ist-wer sowie Evidenz statt Annahme.
Von IRT zu MIRT
Item-Response-Theorie kommt aus der Psychometrie: nicht jede Frage trägt gleich viel Information. Ai2 hatte eindimensionale IRT schon in Fluid Benchmarking genutzt. BenchMIRT erweitert das auf mehrdimensionale IRT, damit mehrere Fähigkeiten auf demselben Item getrennt werden.
Schätzungen auf beiden Seiten
Für ein Modell schätzt sie die Stärke auf den Fähigkeiten der gewählten Bänke. Für jede Frage schätzt sie Schwierigkeit und, wie gut das Item stärkere von schwächeren Modellen auf diesen Fähigkeiten trennt.
Keine Fähigkeitslabels
Training mit 100 LLMs, 16 Benchmarks und mehr als 34.000 Items. Sechs Reasoning-Bänke umfassen MMLU-Pro, GPQA, MATH und BBH. Zehn stammen aus der Olmo-3-Safety-Suite, darunter HarmBench, StrongReject, WildJailbreak, BBQ, WMDP und XSTest. Die Methode erfuhr nicht, welche Bank was misst.
Welche zwei Achsen zurückkamen
-
1
Zuerst die stabile Rückholung
Die Methode holte unabhängig zwei dominante Dimensionen: Sicherheit und allgemeines Reasoning. Neustarts von vorn fanden dasselbe Paar. Hohe Werte auf den meisten Reasoning-Bänken folgten Reasoning; Jailbreak- und Schadinhalte-Bänke folgten Sicherheit.
-
2
Dann falsch gruppierte Items
BBQ gilt als Safety, lag aber deutlich näher am allgemeinen Reasoning: ein niedriger Wert kann auch schweres Verstehen bedeuten, nicht nur Stereotyp. WMDP prüft gefährliches Dual-Use-Wissen in Biologie, Chemie und Cyber und lag ebenfalls näher am Reasoning. Stärkeres allgemeines Reasoning hing mit niedrigeren WMDP-Werten zusammen, weil Verweigern oder Nichtliefern des gefährlichen Wissens die gewünschte Antwort ist.
-
3
Dann Spaltung in einer Bank
WildJailbreak mittelt schädliche Jailbreaks mit harmlosen Prompts, die Überverweigerung prüfen. Bei HarmBench lagen Standard- und Kontext-Schadanfragen näher an Sicherheit; Copyright-Items — etwa Lyrics von „What a Wonderful World“ — näher am allgemeinen Reasoning.
Hält ein dünneres Set das Bild
Nach Rangfolge nach Informationsgehalt bewahrte das Behalten von 10 % der Fragen über diese 16 Bänke im Allgemeinen fast dasselbe Stärker/Schwächer-Bild auf der zugrunde liegenden Safety- oder Reasoning-Fähigkeit; 50 % passten oft noch näher an das Vollset. Auf nicht beobachteten Hold-out-Fragen lag die Vorhersage richtig/falsch bei 79 %; ein einfacheres „nimm den Bankdurchschnitt“ lag bei 70 %.
| Fund | Öffentliche Aussage | Lesart |
|---|---|---|
| Dominante Achsen | Sicherheit / allgemeines Reasoning | Ohne Labels zurückgeholt |
| BBQ, WMDP | Näher am Reasoning | Safety-Suite-Wert ist kein Safety-Verhalten |
| Item-Schnitt | 10 % halten das Bild weitgehend | Nicht jedes Item trägt gleich viel |
Ai2 ist klar: das heißt nicht zwingend, die Bänke seien fehlerhaft. Es heißt, ein Wert kann mehrere Signale stapeln — und BenchMIRT soll sie trennen.
- Preis, wenn nur Rang zählt
- Geht es um Rang nach vorhergesagter Leistung auf zufälligen Hold-out-Items, ist der Bankdurchschnitt etwas besser als BenchMIRT. Der Vorteil der Methode ist das Fragenbild, nicht die Gesamttabelle.
- Risiko, nützliche Items zu streichen
- Dieselben Schätzungen können die informativsten Safety-Fragen entfernen, damit ein unsicheres Modell eine schwächere Eval besteht. Die Autoren halten die Transparenz für den Preis wert und benennen das Risiko.
- Achsen folgen dem Set
- Eine andere Mischung von Evals könnte andere Fähigkeiten zeigen. Die Zwei-Achsen-Story hängt an diesen 16 Bänken.
Wenn das Team eine Skizze braucht
Danach fehlt oft ein Bild: Safety-Achse, Reasoning-Achse, und warum BBQ / WMDP keine reinen Safety-Werte sind. Keine extra Meeting-Suite. Raum auf tidemeet oder Raum anlegen. Wie ein Harness einen Wert verschiebt: ARC-AGI-3 zwei Werte; Isolationsbruch: METR und Hugging Face.
# Achse
safety ↔ general-reasoning
bbq/wmdp ≠ safety-only
Fragen
Ist das eine neue Flaggschiff-Story?
Nein. BenchMIRT ist eine Eval-Audit-Methode, keine Modellveröffentlichung. Die Stichprobe endet bei Open-Weight-Modellen bis März 2025.
Kann ich Astra oder Fable 2026 damit bewerten?
Der Beitrag sagt: alle Modelle zum Trainieren und Evaluieren stammen bis März 2025. Neuere Generationen sind nicht erfasst. Die zwei Achsen nicht auf Flagschiffe ohne Stichprobe kleben.
Ersetzen 10 % der Items die volle Bank?
Die Autoren sagen: auf diesen 16 Bänken hielt die informativsten 10 % das Stärker/Schwächer-Bild weitgehend. Für vorhergesagten Rang auf zufälligen Hold-outs bleibt der Voll-Durchschnitt etwas besser.
Was hat das mit einem temporären Meeting-Tool zu tun?
Keine Produktbindung. Nur eine Skizze der zwei Achsen und falsch gruppierten Bänke? Siehe temporäre Meeting-Tools.