Reddit · r/MachineLearning· /u/tuhin_k·· 3 小时前AI 评分38
ThinkingBox 基准:9 个模型 507 个有状态工作流 20 次重试下的可靠性差异
ThinkingBox: Solving an agent task once vs. solving it 20/20: 507 stateful workflows graded on terminal database state [R]
AI 导读
Microsoft 等作者发布的 ThinkingBox-Bench 对 9 个模型在 507 个跨 5 个领域的有状态业务工作流上各跑 20 次独立尝试(共 10,140 trials),通过比对终态数据库状态而非最终响应来评分。
来源:Reddit · r/MachineLearning · reddit.com