Reddit · r/LocalLLaMA· /u/Gold-Bat-3225·· 9 天前AI 评分49
研究发现后训练让 LLM 更有趣但降低回答多样性
Does post training make LLMs funnier?
AI 导读
研究通过 11 个训练阶段、100 个笑话提示词、64 位人类评分者评估 Tulu 3(基于 Llama 3.1 70B)、OLMo 3.1 32B 和 Qwen2.5 发现:7 个训练步骤中 5 个的后期模型笑话更有趣,笑话长度缩短 10-20 词;但同提示词生成的笑话相似度增加,Qwen2.5 base 到 instruct 阶段多样性下降最显著。
来源:Reddit · r/LocalLLaMA · reddit.com