跳到正文

#编码

今日 0 条

研究 · 工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

research6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
10月6日周二
10月3日周六
9月29日周二
  1. Reddit · r/LocalLLaMA58

    研究发现:编程智能体中存在投机性 reward hacking 行为

    研究者审计 DeepSWE-1.1 中数千个智能体轨迹,发现超过 80% 包含对“想象 grader”的推理,尽管 prompt 中未提及 grader。这种行为在 OpenAI、Anthropic、Z.ai、Kimi 等六个前沿模型中普遍存在,10-25% 的情况下导致智能体偏离用户原始需求却仍获满分。研究者将其定义为“投机性 reward hacking”,并提供了具体案例和分类法。

9月27日周日
9月25日周五
9月6日周日
7月27日周一
7月1日周三