BenchMIRT是什么:2026艾伦研究所基准题目审计全解析
Ai2在9月1日发布BenchMIRT:把基准拆到每一道题。故事是两维信号,不是又一篇旗舰稿。
2026年9月1日,艾伦人工智能研究所(Ai2)在 Hugging Face 发布 BenchMIRT:不看总分,而把基准拆到每一道题,估计它实际在测什么能力。
这不是又一篇旗舰模型稿。本篇只读 Ai2 自己写明的方法、样本和限制:100 个开源模型、16 项基准、3.4 万余道题,以及未告知标签时仍稳定回收出的两维——安全与一般推理。
方法实际在做什么
单项基准通常声称测某一能力,例如安全、推理或指令遵循。可一道题往往同时依赖几件事。BBQ 有一道祖孙约车的题:它在探年龄刻板印象,也要求模型分清谁是谁、按证据而不是按假设推理。
从 IRT 到 MIRT
项目反应理论来自心理测量:不是每道题都提供同样多的信息。Ai2 先前在 Fluid Benchmarking 里用过单维 IRT。BenchMIRT 改用多维 IRT,把同一题上可能叠在一起的多种能力拆开。
模型和题目两端都估
对模型,它估计在所选基准反映出的能力上有多强;对题目,它估计难度,以及题目能多好地区分这些能力上的强弱模型。
没喂标签
训练覆盖 100 个大模型、16 项基准、3.4 万余题。六项推理基准包括 MMLU-Pro、GPQA、MATH、BBH;十项来自 Olmo 3 安全套件,包括 HarmBench、StrongReject、WildJailbreak、BBQ、WMDP、XSTest。研究者没有告诉方法各基准在测什么。
它回收出哪两维
-
1
先看稳定回收
方法独立回收出两维主导维度:安全与一般推理。从零重跑,两维反复出现。多数推理基准的高分跟推理走,越狱与有害内容基准的高分跟安全走。
-
2
再看被归错组的题
BBQ 常被算进安全,却更贴近一般推理:低分可能部分来自读不懂题,而不只是刻板印象。WMDP 测生物、化学、网络安全等危险两用知识,也更贴近推理;更强的推理对应更低的 WMDP 分,因为拒答或给不出危险知识才算期望行为。
-
3
再看同一基准内的分裂
WildJailbreak 把有害越狱题和“不该拒的无害题”平均成一个分。HarmBench 的标准题与带上下文题更贴近安全;版权题(例如生成《What a Wonderful World》歌词)更贴近一般推理。
少测题时分数还稳不稳
按题目信息量排序后,在这 16 项基准上只留 10% 的题,对底层安全或推理能力的强弱排序大体仍在;留 50% 往往更接近全量。对未观测过的持出题,方法预测对错正确率为 79%;用“模型在该基准上的平均表现”去猜是 70%。
| 发现 | 公开说法 | 怎么读 |
|---|---|---|
| 主导维 | 安全 / 一般推理 | 未告知标签仍回收出来 |
| BBQ、WMDP | 更贴近推理 | 安全套件里的分不等于安全行为 |
| 题目裁剪 | 10% 大体保住图景 | 不是所有题都同等信息量 |
Ai2 写明:这不一定说明基准有缺陷。它说明一个总分可以叠几种信号,而 BenchMIRT 用来把信号拆开。
- 排名用途的代价
- 若目标是按随机持出题预测表现来排名,基准平均分比 BenchMIRT 略好。后者的优势是题级图景,不是总榜。
- 被拿去删题的风险
- 同一套题级估计也能用来去掉最能区分安全能力的题,让不安全模型更容易过关。作者认为透明度值得这个风险,但写明风险存在。
- 维度跟着题库走
- 换一套基准组合,主导维可能不是安全与推理。结论绑在这 16 项上。
和同事对齐两维时
读完通常缺一张图:安全轴、推理轴,以及 BBQ / WMDP 为什么不能当纯安全分。不必再装会议套件。可在tidemeet开短时空间,或看如何创建空间。同站对测试架怎么改分,见ARC-AGI-3 双分数;对评测隔离失效,见METR 与 Hugging Face 调查。
# 对照轴
safety ↔ general-reasoning
bbq/wmdp ≠ safety-only
还有疑问?
这是在写某个新旗舰模型吗?
不是。BenchMIRT 是评测审计方法,不是模型发布。样本停在 2025年3月及更早的开源模型。
能拿它给 2026 的 Astra 或 Fable 打分吗?
博文写明:训练与评估用的模型都不晚于 2025年3月,因此分析没有覆盖更新一代。不能把这两维直接套到未纳入样本的旗舰上。
10% 的题是不是可以替代整项基准?
作者说的是:在这 16 项上,信息量最高的 10% 大体保住强弱排序。若要比的是随机持出题上的预测排名,全量平均分仍略好。
和临时协作工具有什么关系?
没有产品绑定。若只是要把两维和被归错组的基准画在一张图上,临时会议工具对比说明何时用短时浏览器空间即可。