Reddit · r/LocalLLaMA· /u/empirical-sadboy·· 2 天前AI 评分16
模型 benchmark 差距常在误差范围内,评测该不该加置信区间?
Can we please have some error bars?
AI 导读
Reddit 用户指出,新模型在 HumanEval、GSM8K 等榜单上仅比旧模型高出几个百分点,可能落在问题采样噪声之内:HumanEval 共 164 题,70% 得分的标准误差约 3.5 分,GSM8K 约 1 分,2 分差距尚不及采样温度、提示词模板、few-shot 示例和评估框架版本带来的波动。
来源:Reddit · r/LocalLLaMA · reddit.com