BenchMIRT란: 2026 Ai2 벤치마크 문항 감사 전 해설

Ai2는 9월 1일 BenchMIRT를 냈다. 총점이 아니라 문항 단위 감사. 플래그십 재탕이 아니라 두 축 이야기다.

2026년 9월 1일 Allen Institute for AI(Ai2)는 Hugging Face에 BenchMIRT를 공개했다. 총점이 아니라 문항 단위로 벤치가 실제로 무엇을 재는지 감사하는 방법이다.

또 한 편의 플래그십 기사가 아니다. 이 글은 Ai2가 적어 둔 방법·표본·한계만 읽는다. 오픈 웨이트 100개, 벤치 16개, 문항 3.4만 개 이상. 라벨을 알려주지 않았는데도 안전과 일반 추론 두 차원이 안정적으로 회수됐다.

누가 냈나 무엇을 쟀나 점수 읽기

방법이 실제로 하는 일

벤치는 보통 안전·추론·지시 이행 같은 단일 능력을 내세운다. 한 문항은 그 이상을 요구할 수 있다. 손자와 할아버지가 우버를 잡는 BBQ 문항은 연령 고정관념을 보지만, 누가 누구인지를 추적하고 가정이 아니라 증거로 추론하는 일도 요구한다.

01

IRT에서 MIRT로

문항반응이론은 심리측정에서 온다. 모든 문항이 같은 정보량을 주지 않는다. Ai2는 Fluid Benchmarking에서 1차원 IRT를 썼다. BenchMIRT는 다차원 IRT로 확장해 같은 문항 위의 여러 능력을 분리한다.

02

모델과 문항 양쪽

모델에 대해서는 선택한 벤치가 비추는 능력의 강도를 추정한다. 문항에 대해서는 난이도와, 그 능력에서 강약을 얼마나 나누는지를 추정한다.

03

라벨을 주지 않음

학습은 LLM 100개, 벤치 16개, 문항 3.4만 개 이상. 추론 6개에는 MMLU-Pro, GPQA, MATH, BBH. 안전 10개는 Olmo 3 스위트로 HarmBench, StrongReject, WildJailbreak, BBQ, WMDP, XSTest를 포함한다. 각 벤치가 무엇을 재는지는 방법에 알려주지 않았다.

돌아온 두 축

  1. 1

    먼저 안정적 회수

    방법은 주도 차원으로 안전과 일반 추론을 독립적으로 회수했다. 처음부터 다시 돌려도 같은 쌍이 나왔다. 대부분의 추론 벤치 고점은 추론에, 탈옥·유해 콘텐츠 벤치 고점은 안전에 붙었다.

  2. 2

    다음엔 잘못 묶인 문항

    BBQ는 안전으로 분류되지만 일반 추론에 훨씬 더 가깝다. 낮은 점수는 고정관념뿐 아니라 문항 이해의 어려움일 수 있다. WMDP는 생물·화학·사이버의 위험 이중용도 지식을 시험하고 역시 추론에 더 가깝다. 일반 추론이 강할수록 WMDP는 낮아졌다. 위험 지식을 거부하거나 내지 않는 것이 기대 응답이기 때문이다.

  3. 3

    한 벤치 안의 분열

    WildJailbreak는 유해 탈옥과, 무해한 요청을 너무 자주 거절하는지 보는 문항을 한 점수로 평균한다. HarmBench에서는 표준·맥락 유해 요청이 안전에, 저작권 문항(예: “What a Wonderful World” 가사 생성)이 일반 추론에 더 붙었다.

100
오픈 웨이트 모델
16
벤치마크
34K+
문항 / 과제

문항을 줄여도 그림이 남는가

정보량으로 정렬한 뒤 이 16개에서 문항의 10%만 남겨도 기저 안전 또는 추론의 강약 그림은 대체로 유지됐다. 50%면 전체 세트에 더 가까운 경우가 많다. 관측하지 않은 홀드아웃 문항의 정오 예측은 79%. 벤치 평균으로 맞히는 단순법은 70%였다.

발견 공개 주장 읽는 법
주도 축 안전 / 일반 추론 라벨 없이 회수
BBQ, WMDP 추론에 가깝다 안전 스위트 점수는 안전 행동이 아니다
문항 축소 10%면 그림이 대체로 남는다 모든 문항의 정보량이 같지 않다

Ai2는 벤치가 결함이라는 뜻은 아니라고 쓴다. 총점 하나에 여러 신호가 겹일 수 있고, BenchMIRT는 그 신호를 풀어 낸다는 뜻이다.

순위만 필요할 때의 대가
무작위 홀드아웃 문항의 예측 성적으로 순위를 매기면 벤치 평균이 BenchMIRT보다 약간 낫다. 후자의 강점은 문항 단위 그림이지 종합 표가 아니다.
유용한 문항을 지울 위험
안전 능력을 가장 잘 가르는 문항을 빼는 데도 같은 추정치를 쓸 수 있다. 불안전 모델이 약한 평가를 통과하기 쉬워진다. 저자는 투명성이 그 위험을 감수할 만하다고 보면서도 위험을 적시한다.
축은 세트를 따른다
다른 평가 조합이면 다른 능력이 나올 수 있다. 두 축 이야기는 이 16개에 묶인다.

팀에 그림 한 장이 필요할 때

읽고 나면 보통 안전 축, 추론 축, BBQ / WMDP를 순수 안전 점수로 쓰면 안 되는 이유의 한 장이 필요하다. 회의 스위트는 필요 없다. tidemeet에서 짧은 공간을 열거나 공간 만들기를 본다. 하니스가 점수를 바꾸는 방식은 ARC-AGI-3 두 점수, 평가 격리 실패는 METR과 Hugging Face.

# 축
safety ↔ general-reasoning
bbq/wmdp ≠ safety-only

질문

새 플래그십 모델 기사인가?

아니다. BenchMIRT는 평가 감사 방법이지 모델 출시가 아니다. 표본은 2025년 3월 이전 오픈 웨이트에서 멈춘다.

2026 Astra나 Fable에 쓸 수 있나?

글은 학습·평가에 쓴 모델이 모두 2025년 3월까지라고 한다. 더 새로운 세대는 포함되지 않는다. 표본에 없는 플래그십에 두 축을 붙이면 안 된다.

문항 10%가 벤치 전체를 대체하나?

저자 주장은 이 16개에서 정보량이 높은 10%가 강약 그림을 대체로 유지한다는 것이다. 무작위 홀드아웃의 예측 순위라면 전체 평균이 약간 더 낫다.

임시 회의 도구와 무슨 관계인가?

제품 연동은 없다. 두 축과 잘못 묶인 벤치만 한 장에 그리면 임시 회의 도구 비교가 짧은 브라우저 공간으로 충분한 때를 설명한다.

무료로 공간 만들기