BenchMIRT是什麼:2026艾倫研究所基準題目審計全解析
Ai2在9月1日發布BenchMIRT:把基準拆到每一道題。故事是兩維訊號,不是又一篇旗艦稿。
2026年9月1日,艾倫人工智慧研究所(Ai2)在 Hugging Face 發布 BenchMIRT:不看總分,而把基準拆到每一道題,估計它實際在測什麼能力。
這不是又一篇旗艦模型稿。本篇只讀 Ai2 自己寫明的方法、樣本和限制:100 個開源模型、16 項基準、3.4 萬餘道題,以及未告知標籤時仍穩定回收出的兩維——安全與一般推理。
方法實際在做什麼
單項基準通常聲稱測某一能力,例如安全、推理或指令遵循。可一道題往往同時依賴幾件事。BBQ 有一道祖孫約車的題:它在探年齡刻板印象,也要求模型分清誰是誰、按證據而不是按假設推理。
從 IRT 到 MIRT
項目反應理論來自心理計量:不是每道題都提供同樣多的資訊。Ai2 先前在 Fluid Benchmarking 裡用過單維 IRT。BenchMIRT 改用多維 IRT,把同一題上可能疊在一起的多種能力拆開。
模型和題目兩端都估
對模型,它估計在所選基準反映出的能力上有多強;對題目,它估計難度,以及題目能多好地區分這些能力上的強弱模型。
沒餵標籤
訓練涵蓋 100 個大模型、16 項基準、3.4 萬餘題。六項推理基準包括 MMLU-Pro、GPQA、MATH、BBH;十項來自 Olmo 3 安全套件,包括 HarmBench、StrongReject、WildJailbreak、BBQ、WMDP、XSTest。研究者沒有告訴方法各基準在測什麼。
它回收出哪兩維
-
1
先看穩定回收
方法獨立回收出兩維主導維度:安全與一般推理。從零重跑,兩維反覆出現。多數推理基準的高分跟推理走,越獄與有害內容基準的高分跟安全走。
-
2
再看被歸錯組的題
BBQ 常被算進安全,卻更贴近一般推理:低分可能部分來自讀不懂題,而不只是刻板印象。WMDP 測生物、化學、網路安全等危險兩用知識,也更贴近推理;更強的推理對應更低的 WMDP 分,因為拒答或給不出危險知識才算期望行為。
-
3
再看同一基準內的分裂
WildJailbreak 把有害越獄題和「不該拒的無害題」平均成一個分。HarmBench 的標準題與帶上下文題更贴近安全;版權題(例如生成《What a Wonderful World》歌詞)更贴近一般推理。
少測題時分數還穩不穩
按題目資訊量排序後,在這 16 項基準上只留 10% 的題,對底層安全或推理能力的強弱排序大體仍在;留 50% 往往更接近全量。對未觀測過的持出題,方法預測對錯正確率為 79%;用「模型在該基準上的平均表現」去猜是 70%。
| 發現 | 公開說法 | 怎麼讀 |
|---|---|---|
| 主導維 | 安全 / 一般推理 | 未告知標籤仍回收出來 |
| BBQ、WMDP | 更贴近推理 | 安全套件裡的分不等於安全行為 |
| 題目裁剪 | 10% 大體保住圖景 | 不是所有題都同等資訊量 |
Ai2 寫明:這不一定說明基準有缺陷。它說明一個總分可以疊幾種訊號,而 BenchMIRT 用來把訊號拆開。
- 排名用途的代價
- 若目標是按隨機持出題預測表現來排名,基準平均分比 BenchMIRT 略好。後者的優勢是題級圖景,不是總榜。
- 被拿去刪題的風險
- 同一套題級估計也能用來去掉最能區分安全能力的題,讓不安全模型更容易過關。作者認為透明度值得這個風險,但寫明風險存在。
- 維度跟著題庫走
- 換一套基準組合,主導維可能不是安全與推理。結論綁在這 16 項上。
和同事對齊兩維時
讀完通常缺一張圖:安全軸、推理軸,以及 BBQ / WMDP 為什麼不能當純安全分。不必再裝會議套件。可在tidemeet開短時空間,或看如何建立空間。同站對測試架怎麼改分,見ARC-AGI-3 雙分數;對評測隔離失效,見METR 與 Hugging Face 調查。
# 對照軸
safety ↔ general-reasoning
bbq/wmdp ≠ safety-only
還有疑問?
這是在寫某個新旗艦模型嗎?
不是。BenchMIRT 是評測審計方法,不是模型發布。樣本停在 2025年3月及更早的開源模型。
能拿它給 2026 的 Astra 或 Fable 打分嗎?
部落格寫明:訓練與評估用的模型都不晚於 2025年3月,因此分析沒有覆蓋更新一代。不能把這兩維直接套到未納入樣本的旗艦上。
10% 的題是不是可以替代整項基準?
作者說的是:在這 16 項上,資訊量最高的 10% 大體保住強弱排序。若要比的是隨機持出題上的預測排名,全量平均分仍略好。
和臨時協作工具有什麼關係?
沒有產品綁定。若只是要把兩維和被歸錯組的基準畫在一張圖上,臨時會議工具對比說明何時用短時瀏覽器空間即可。