跳到正文
原文
Hugging Face Blog·· 2026-09-02AI 评分51

BenchMIRT:LLM benchmark 实际在测量什么

BenchMIRT: What are LLM benchmarks actually measuring?

AI 导读

Allen AI 发布 BenchMIRT 方法,通过多维项目反应理论分析 benchmark 内部每个问题的真实测量维度。在 100 个开源模型和 16 个 benchmark(含 MMLU-Pro、GPQA、HarmBench 等)上的训练表明,模型能独立发现安全性和推理两个主导维度。

来源:Hugging Face Blog · huggingface.co