跳到正文
原文
Hacker News · 首页· codyznash·· 2 天前AI 评分40

MoE 模型判断代码恶意性时,路由路径偏向道德而非安全

Ask a model if code is malicious and it reaches for its morals

AI 导读

研究者在 OLMoE、DeepSeek-V2-Lite 与 DeepSeek-Coder-V2-Lite 三个开源 MoE 模型中发现,当被问及"这段代码是否恶意"时,路由器走的是道德问题路径,而非漏洞或法律问题路径;恶意问题对道德路径专家的加载权重是正确性问题的数倍,全程 10 段代码切片都与道德问题保持最近。

来源:Hacker News · 首页 · manifold.security