Hugging Face Blog·· 2026-09-02AI 评分51
BenchMIRT:LLM benchmark 实际在测量什么
BenchMIRT: What are LLM benchmarks actually measuring?
AI 导读
Allen AI 发布 BenchMIRT 方法,通过多维项目反应理论分析 benchmark 内部每个问题的真实测量维度。在 100 个开源模型和 16 个 benchmark(含 MMLU-Pro、GPQA、HarmBench 等)上的训练表明,模型能独立发现安全性和推理两个主导维度。
来源:Hugging Face Blog · huggingface.co