Reddit · r/MachineLearning· /u/MajorRedditor23·· 7 天前AI 评分68
NeurIPS 2026 论文:LLM 对「验证来源」的盲从——权威偏见研究
LLMs that push back on a wrong user still accept the same wrong answer from a "verified source" - NeurIPS 2026 [R]
AI 导读
研究者发现模型在用户坚持错误答案时会坚持正确立场,但同样错误答案被标记为「验证来源」时却会接受。这种「权威偏见」在 8 个模型中导致 45-88% 的正确答案被翻转。通过干预模型内部的方向向量,可将这种盲从降低 64-78 个百分点,为对抗工具误导提供了新思路。
来源:Reddit · r/MachineLearning · reddit.com