跳到正文
原文
Reddit · r/ChatGPT· /u/No_Twist_678·· 1 天前AI 评分15

Opus 4.5 与 Sol 6.1 任务完成度对比反差明显

Forget benchmarks. Sol 6.1 can’t finish work.

AI 导读

一名 Reddit 用户用相同的提示词分别测试 Sol 6.1 和 Opus 4.5 两款模型,要求它们在 10 欧元预算内完成一个家庭社交应用的搭建。结果 Sol 6.1 仅停留在"pursuing goal stalled"状态未交付任何成果,而 Opus 4.5 自主选定域名并完成了整个应用的构建。该用户在帖子中以 TLDR 形式总结这一反差,但尚未对最终产物进行测试。

来源:Reddit · r/ChatGPT · reddit.com