热点事件观察中
用户实测对比 Sol 6.1 与 Opus 系列编码代理能力,反差显著
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
一名 Reddit 用户使用相同的提示词,分别对 Sol 6.1 和 Opus 系列模型进行编码代理能力实测,要求两款模型在 10 欧元预算内搭建一个家庭社交应用。早先报道的对比对象为 Sol 6.1 与 Opus 5.5,用户指出两者之间存在能力差距。后续报道(2026-10-07)将对比对象更新为 Sol 6.1 与 Opus 4.5:Sol 6.1 在任务中停留在"pursuing goal stalled"状态,未交付任何成果;而 Opus 4.5 则自主选定域名,完成了整个应用的构建。该用户在帖子中以 TLDR 形式总结了这种反差,但尚未对最终产物进行功能或质量测试。截至目前,测试仅限于该用户个人的一次对比实验,尚无更多独立验证。
AI 根据报道生成 · 1 天前更新
报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- Reddit · r/ChatGPTOpus 4.5 与 Sol 6.1 任务完成度对比反差明显
一名 Reddit 用户用相同的提示词分别测试 Sol 6.1 和 Opus 4.5 两款模型,要求它们在 10 欧元预算内完成一个家庭社交应用的搭建。结果 Sol 6.1 仅停留在"pursuing goal stalled"状态未交付任何成果,而 Opus 4.5 自主选定域名并完成了整个应用的构建。该用户在帖子中以 TLDR 形式总结这一反差,但尚未对最终产物进行测试。
本事件热度走势
当前热度 5·可比范围峰值 10(10月7日 15:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。