BenchMIRT是什麼:2026艾倫研究所基準題目審計全解析

Ai2在9月1日發布BenchMIRT:把基準拆到每一道題。故事是兩維訊號,不是又一篇旗艦稿。

2026年9月1日,艾倫人工智慧研究所(Ai2)在 Hugging Face 發布 BenchMIRT:不看總分,而把基準拆到每一道題,估計它實際在測什麼能力。

這不是又一篇旗艦模型稿。本篇只讀 Ai2 自己寫明的方法、樣本和限制:100 個開源模型、16 項基準、3.4 萬餘道題,以及未告知標籤時仍穩定回收出的兩維——安全與一般推理。

誰發布 測了什麼 怎麼讀分

方法實際在做什麼

單項基準通常聲稱測某一能力,例如安全、推理或指令遵循。可一道題往往同時依賴幾件事。BBQ 有一道祖孫約車的題:它在探年齡刻板印象,也要求模型分清誰是誰、按證據而不是按假設推理。

01

從 IRT 到 MIRT

項目反應理論來自心理計量:不是每道題都提供同樣多的資訊。Ai2 先前在 Fluid Benchmarking 裡用過單維 IRT。BenchMIRT 改用多維 IRT,把同一題上可能疊在一起的多種能力拆開。

02

模型和題目兩端都估

對模型,它估計在所選基準反映出的能力上有多強;對題目,它估計難度,以及題目能多好地區分這些能力上的強弱模型。

03

沒餵標籤

訓練涵蓋 100 個大模型、16 項基準、3.4 萬餘題。六項推理基準包括 MMLU-Pro、GPQA、MATH、BBH;十項來自 Olmo 3 安全套件,包括 HarmBench、StrongReject、WildJailbreak、BBQ、WMDP、XSTest。研究者沒有告訴方法各基準在測什麼。

它回收出哪兩維

  1. 1

    先看穩定回收

    方法獨立回收出兩維主導維度:安全與一般推理。從零重跑,兩維反覆出現。多數推理基準的高分跟推理走,越獄與有害內容基準的高分跟安全走。

  2. 2

    再看被歸錯組的題

    BBQ 常被算進安全,卻更贴近一般推理:低分可能部分來自讀不懂題,而不只是刻板印象。WMDP 測生物、化學、網路安全等危險兩用知識,也更贴近推理;更強的推理對應更低的 WMDP 分,因為拒答或給不出危險知識才算期望行為。

  3. 3

    再看同一基準內的分裂

    WildJailbreak 把有害越獄題和「不該拒的無害題」平均成一個分。HarmBench 的標準題與帶上下文題更贴近安全;版權題(例如生成《What a Wonderful World》歌詞)更贴近一般推理。

100
開源權重模型
16
基準
34K+
題目 / 任務

少測題時分數還穩不穩

按題目資訊量排序後,在這 16 項基準上只留 10% 的題,對底層安全或推理能力的強弱排序大體仍在;留 50% 往往更接近全量。對未觀測過的持出題,方法預測對錯正確率為 79%;用「模型在該基準上的平均表現」去猜是 70%。

發現 公開說法 怎麼讀
主導維 安全 / 一般推理 未告知標籤仍回收出來
BBQ、WMDP 更贴近推理 安全套件裡的分不等於安全行為
題目裁剪 10% 大體保住圖景 不是所有題都同等資訊量

Ai2 寫明:這不一定說明基準有缺陷。它說明一個總分可以疊幾種訊號,而 BenchMIRT 用來把訊號拆開。

排名用途的代價
若目標是按隨機持出題預測表現來排名,基準平均分比 BenchMIRT 略好。後者的優勢是題級圖景,不是總榜。
被拿去刪題的風險
同一套題級估計也能用來去掉最能區分安全能力的題,讓不安全模型更容易過關。作者認為透明度值得這個風險,但寫明風險存在。
維度跟著題庫走
換一套基準組合,主導維可能不是安全與推理。結論綁在這 16 項上。

和同事對齊兩維時

讀完通常缺一張圖:安全軸、推理軸,以及 BBQ / WMDP 為什麼不能當純安全分。不必再裝會議套件。可在tidemeet開短時空間,或看如何建立空間。同站對測試架怎麼改分,見ARC-AGI-3 雙分數;對評測隔離失效,見METR 與 Hugging Face 調查

# 對照軸
safety ↔ general-reasoning
bbq/wmdp ≠ safety-only

還有疑問?

這是在寫某個新旗艦模型嗎?

不是。BenchMIRT 是評測審計方法,不是模型發布。樣本停在 2025年3月及更早的開源模型。

能拿它給 2026 的 Astra 或 Fable 打分嗎?

部落格寫明:訓練與評估用的模型都不晚於 2025年3月,因此分析沒有覆蓋更新一代。不能把這兩維直接套到未納入樣本的旗艦上。

10% 的題是不是可以替代整項基準?

作者說的是:在這 16 項上,資訊量最高的 10% 大體保住強弱排序。若要比的是隨機持出題上的預測排名,全量平均分仍略好。

和臨時協作工具有什麼關係?

沒有產品綁定。若只是要把兩維和被歸錯組的基準畫在一張圖上,臨時會議工具對比說明何時用短時瀏覽器空間即可。

免費建立空間