BenchMIRT что это: аудит бенчмарков Ai2 на уровне вопросов 2026

Ai2 1 сентября выложила BenchMIRT: аудит стендов на уровне вопроса, не заголовка. Сюжет — две оси, не флагман.

1 сентября 2026 Allen Institute for AI (Ai2) опубликовал на Hugging Face BenchMIRT: аудит, который читает бенчмарк на уровне каждого вопроса, а не только заголовочный балл.

Это не ещё один пересказ флагмана. Текст держится того, что записала Ai2: 100 открытых LLM, 16 бенчмарков, больше 34 тысяч вопросов — и две оси, которые метод вернул без подсказанных меток: безопасность и общее рассуждение.

Кто опубликовал Что измерили Как читать

Что метод делает на самом деле

Бенч обычно продают как одну способность: безопасность, рассуждение или следование инструкциям. Один пункт может требовать большего. Вопрос BBQ про внука и деда, заказывающих Uber, проверяет возрастной стереотип — и ещё кто-есть-кто и опору на факты, а не на допущение.

01

От IRT к MIRT

Теория ответов на задания пришла из психометрики: не каждый вопрос даёт одинаково много информации. Ai2 уже применяла одномерную IRT в Fluid Benchmarking. BenchMIRT расширяет это до многомерной IRT, чтобы разделить несколько способностей на одном пункте.

02

Оценки с обеих сторон

Для модели оценивается сила на способностях выбранных стендов. Для вопроса — трудность и то, насколько пункт отделяет более сильные модели от более слабых по этим осям.

03

Без меток способностей

Обучение на 100 LLM, 16 бенчмарках и более чем 34 тысячах пунктов. Шесть стендов рассуждения включают MMLU-Pro, GPQA, MATH и BBH. Десять — из набора безопасности Olmo 3, в том числе HarmBench, StrongReject, WildJailbreak, BBQ, WMDP и XSTest. Методу не говорили, что измеряет каждый стенд.

Какие две оси вернулись

  1. 1

    Сначала устойчивый возврат

    Метод независимо вернул две доминирующие оси: безопасность и общее рассуждение. Повторы с нуля находили ту же пару. Высокие баллы на большинстве стендов рассуждения шли за рассуждением; стенды джейлбрейка и вредного контента — за безопасностью.

  2. 2

    Затем неверно сгруппированные пункты

    BBQ обычно кладут в безопасность, но он сильнее лёг на общее рассуждение: низкий балл может означать трудность понять вопрос, а не только стереотип. WMDP проверяет опасные двойные знания в биологии, химии и кибербезопасности и тоже ближе к рассуждению. Более сильное общее рассуждение связано с более низкими баллами WMDP, потому что отказ или невыдача опасного знания — желаемый ответ.

  3. 3

    Затем раскол внутри одного стенда

    WildJailbreak усредняет вредные джейлбрейки и безобидные промпты, которые ловят чрезмерный отказ. В HarmBench стандартные и контекстные вредные запросы ближе к безопасности; авторские пункты — например текст «What a Wonderful World» — ближе к общему рассуждению.

100
Открытые модели
16
Бенчмарки
34K+
Вопросы / задачи

Держит ли более тонкий набор картину

После ранжирования пунктов по информативности оставление 10% вопросов на этих 16 стендах в целом почти сохраняло картину сильнее/слабее по подлежащей безопасности или рассуждению; 50% чаще ещё ближе к полному набору. На ненаблюдаемых hold-out вопросах предсказание верно/неверно было 79%; более простой «средний балл стенда» — 70%.

Находка Публичное утверждение Как читать
Доминирующие оси Безопасность / общее рассуждение Вернули без меток
BBQ, WMDP Ближе к рассуждению Балл набора безопасности — не поведение безопасности
Обрезка пунктов 10% в основном держит картину Не каждый пункт несёт равную информацию

Ai2 прямо пишет: это не обязательно значит, что стенды дефектны. Это значит, что один балл может сложить несколько сигналов, а BenchMIRT их разводит.

Цена, если нужен только ранг
Если цель — ранг по предсказанной работе на случайных hold-out пунктах, средний балл стенда чуть лучше BenchMIRT. Сила метода — картина по вопросам, не общая таблица.
Риск выкинуть полезные пункты
Те же оценки можно использовать, чтобы убрать самые информативные вопросы безопасности, и небезопасная модель пройдёт более слабую оценку. Авторы считают прозрачность этого риска стоящей и всё же его называют.
Оси следуют за набором
Другая смесь оценок может выявить другие способности. История двух осей привязана к этим 16 стендам.

Когда команде нужна одна схема

После текста обычно нужна одна картинка: ось безопасности, ось рассуждения и почему BBQ / WMDP — не чистые баллы безопасности. Лишний пакет для встреч не нужен. Откройте tidemeet или как создать пространство. Как харнес сдвигает балл: два балла ARC-AGI-3; срыв изоляции оценки: METR и Hugging Face.

# ось
safety ↔ general-reasoning
bbq/wmdp ≠ safety-only

Вопросы

Это история нового флагмана?

Нет. BenchMIRT — метод аудита оценок, не выпуск модели. Выборка останавливается на открытых весах марта 2025 и раньше.

Можно ли так оценить Astra или Fable 2026?

Пост пишет: все модели для обучения и оценки выпущены не позже марта 2025. Более новые поколения не покрыты. Не клеить две оси на флагманы вне выборки.

Заменяют ли 10% пунктов полный стенд?

Авторы говорят: на этих 16 стендах самые информативные 10% в целом держали картину сильнее/слабее. Для предсказанного ранга на случайных hold-out полный средний балл всё ещё чуть лучше.

Какое отношение к временному инструменту встреч?

Продуктовой связки нет. Если нужна одна схема двух осей и неверно сгруппированных стендов, см. временные инструменты встреч.

Создать пространство