Simon Willison·· 8 天前AI 评分44
Anthropic Frontier Red Team 评估:GLM-5.3 与 Claude Mythos Preview 的二进制利用能力对比
Quoting Anthropic Frontier Red Team
AI 导读
Anthropic Frontier Red Team 在二进制利用基准上测试多款模型,GLM-5.3 在 4% 的任务中实现完整控制流劫持,Claude Mythos Preview 达到 6%。这一结果表明AI模型已跨越关键门槛,此前 Claude Opus 4.6 和 GLM-5.2 在该基准上完全无法成功。
来源:Simon Willison · simonwillison.net