跳到正文
原文
Reddit · r/LocalLLaMA· /u/empirical-sadboy·· 2 天前AI 评分16

模型 benchmark 差距常在误差范围内,评测该不该加置信区间?

Can we please have some error bars?

AI 导读

Reddit 用户指出,新模型在 HumanEval、GSM8K 等榜单上仅比旧模型高出几个百分点,可能落在问题采样噪声之内:HumanEval 共 164 题,70% 得分的标准误差约 3.5 分,GSM8K 约 1 分,2 分差距尚不及采样温度、提示词模板、few-shot 示例和评估框架版本带来的波动。

来源:Reddit · r/LocalLLaMA · reddit.com