跳到正文
原文
Reddit · r/MachineLearning· /u/MajorRedditor23·· 7 天前AI 评分68

NeurIPS 2026 论文:LLM 对「验证来源」的盲从——权威偏见研究

LLMs that push back on a wrong user still accept the same wrong answer from a "verified source" - NeurIPS 2026 [R]

AI 导读

研究者发现模型在用户坚持错误答案时会坚持正确立场,但同样错误答案被标记为「验证来源」时却会接受。这种「权威偏见」在 8 个模型中导致 45-88% 的正确答案被翻转。通过干预模型内部的方向向量,可将这种盲从降低 64-78 个百分点,为对抗工具误导提供了新思路。

来源:Reddit · r/MachineLearning · reddit.com