BenchMIRT что это: аудит бенчмарков Ai2 на уровне вопросов 2026
Ai2 1 сентября выложила BenchMIRT: аудит стендов на уровне вопроса, не заголовка. Сюжет — две оси, не флагман.
1 сентября 2026 Allen Institute for AI (Ai2) опубликовал на Hugging Face BenchMIRT: аудит, который читает бенчмарк на уровне каждого вопроса, а не только заголовочный балл.
Это не ещё один пересказ флагмана. Текст держится того, что записала Ai2: 100 открытых LLM, 16 бенчмарков, больше 34 тысяч вопросов — и две оси, которые метод вернул без подсказанных меток: безопасность и общее рассуждение.
Что метод делает на самом деле
Бенч обычно продают как одну способность: безопасность, рассуждение или следование инструкциям. Один пункт может требовать большего. Вопрос BBQ про внука и деда, заказывающих Uber, проверяет возрастной стереотип — и ещё кто-есть-кто и опору на факты, а не на допущение.
От IRT к MIRT
Теория ответов на задания пришла из психометрики: не каждый вопрос даёт одинаково много информации. Ai2 уже применяла одномерную IRT в Fluid Benchmarking. BenchMIRT расширяет это до многомерной IRT, чтобы разделить несколько способностей на одном пункте.
Оценки с обеих сторон
Для модели оценивается сила на способностях выбранных стендов. Для вопроса — трудность и то, насколько пункт отделяет более сильные модели от более слабых по этим осям.
Без меток способностей
Обучение на 100 LLM, 16 бенчмарках и более чем 34 тысячах пунктов. Шесть стендов рассуждения включают MMLU-Pro, GPQA, MATH и BBH. Десять — из набора безопасности Olmo 3, в том числе HarmBench, StrongReject, WildJailbreak, BBQ, WMDP и XSTest. Методу не говорили, что измеряет каждый стенд.
Какие две оси вернулись
-
1
Сначала устойчивый возврат
Метод независимо вернул две доминирующие оси: безопасность и общее рассуждение. Повторы с нуля находили ту же пару. Высокие баллы на большинстве стендов рассуждения шли за рассуждением; стенды джейлбрейка и вредного контента — за безопасностью.
-
2
Затем неверно сгруппированные пункты
BBQ обычно кладут в безопасность, но он сильнее лёг на общее рассуждение: низкий балл может означать трудность понять вопрос, а не только стереотип. WMDP проверяет опасные двойные знания в биологии, химии и кибербезопасности и тоже ближе к рассуждению. Более сильное общее рассуждение связано с более низкими баллами WMDP, потому что отказ или невыдача опасного знания — желаемый ответ.
-
3
Затем раскол внутри одного стенда
WildJailbreak усредняет вредные джейлбрейки и безобидные промпты, которые ловят чрезмерный отказ. В HarmBench стандартные и контекстные вредные запросы ближе к безопасности; авторские пункты — например текст «What a Wonderful World» — ближе к общему рассуждению.
Держит ли более тонкий набор картину
После ранжирования пунктов по информативности оставление 10% вопросов на этих 16 стендах в целом почти сохраняло картину сильнее/слабее по подлежащей безопасности или рассуждению; 50% чаще ещё ближе к полному набору. На ненаблюдаемых hold-out вопросах предсказание верно/неверно было 79%; более простой «средний балл стенда» — 70%.
| Находка | Публичное утверждение | Как читать |
|---|---|---|
| Доминирующие оси | Безопасность / общее рассуждение | Вернули без меток |
| BBQ, WMDP | Ближе к рассуждению | Балл набора безопасности — не поведение безопасности |
| Обрезка пунктов | 10% в основном держит картину | Не каждый пункт несёт равную информацию |
Ai2 прямо пишет: это не обязательно значит, что стенды дефектны. Это значит, что один балл может сложить несколько сигналов, а BenchMIRT их разводит.
- Цена, если нужен только ранг
- Если цель — ранг по предсказанной работе на случайных hold-out пунктах, средний балл стенда чуть лучше BenchMIRT. Сила метода — картина по вопросам, не общая таблица.
- Риск выкинуть полезные пункты
- Те же оценки можно использовать, чтобы убрать самые информативные вопросы безопасности, и небезопасная модель пройдёт более слабую оценку. Авторы считают прозрачность этого риска стоящей и всё же его называют.
- Оси следуют за набором
- Другая смесь оценок может выявить другие способности. История двух осей привязана к этим 16 стендам.
Когда команде нужна одна схема
После текста обычно нужна одна картинка: ось безопасности, ось рассуждения и почему BBQ / WMDP — не чистые баллы безопасности. Лишний пакет для встреч не нужен. Откройте tidemeet или как создать пространство. Как харнес сдвигает балл: два балла ARC-AGI-3; срыв изоляции оценки: METR и Hugging Face.
# ось
safety ↔ general-reasoning
bbq/wmdp ≠ safety-only
Вопросы
Это история нового флагмана?
Нет. BenchMIRT — метод аудита оценок, не выпуск модели. Выборка останавливается на открытых весах марта 2025 и раньше.
Можно ли так оценить Astra или Fable 2026?
Пост пишет: все модели для обучения и оценки выпущены не позже марта 2025. Более новые поколения не покрыты. Не клеить две оси на флагманы вне выборки.
Заменяют ли 10% пунктов полный стенд?
Авторы говорят: на этих 16 стендах самые информативные 10% в целом держали картину сильнее/слабее. Для предсказанного ранга на случайных hold-out полный средний балл всё ещё чуть лучше.
Какое отношение к временному инструменту встреч?
Продуктовой связки нет. Если нужна одна схема двух осей и неверно сгруппированных стендов, см. временные инструменты встреч.