Import AI· Jack Clark·· 2026-08-17AI 评分45
DiG-bench:70个游戏测试AI发现能力,Opus 5与Fable 5为最佳模型
Import AI 469: Science AI; RSI simulator; and Zuck's technological pessimism
AI 导读
DiG-bench是一个包含70个游戏的发现类benchmark,旨在测试AI在陌生环境中自主发现规则的能力,其中21个游戏已公开。测试结果显示,仅Opus 5和Fable 5能在最高难度Tier 7完成部分任务,GPT-5.5与Kimi K3可在Tier 6表现,而人类测试者能100%通过所有层级。
来源:Import AI · importai.substack.com