跳到正文
热点事件观察中

用户实测对比 Sol 6.1 与 Opus 系列编码代理能力,反差显著

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

一名 Reddit 用户使用相同的提示词,分别对 Sol 6.1 和 Opus 系列模型进行编码代理能力实测,要求两款模型在 10 欧元预算内搭建一个家庭社交应用。早先报道的对比对象为 Sol 6.1 与 Opus 5.5,用户指出两者之间存在能力差距。后续报道(2026-10-07)将对比对象更新为 Sol 6.1 与 Opus 4.5:Sol 6.1 在任务中停留在"pursuing goal stalled"状态,未交付任何成果;而 Opus 4.5 则自主选定域名,完成了整个应用的构建。该用户在帖子中以 TLDR 形式总结了这种反差,但尚未对最终产物进行功能或质量测试。截至目前,测试仅限于该用户个人的一次对比实验,尚无更多独立验证。

AI 根据报道生成 · 1 天前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. Reddit · r/ChatGPT
    Opus 4.5 与 Sol 6.1 任务完成度对比反差明显

    一名 Reddit 用户用相同的提示词分别测试 Sol 6.1 和 Opus 4.5 两款模型,要求它们在 10 欧元预算内完成一个家庭社交应用的搭建。结果 Sol 6.1 仅停留在"pursuing goal stalled"状态未交付任何成果,而 Opus 4.5 自主选定域名并完成了整个应用的构建。该用户在帖子中以 TLDR 形式总结这一反差,但尚未对最终产物进行测试。

本事件热度走势

当前热度 5·可比范围峰值 10(10月7日 15:00)·近 24 小时可比范围变化 –

02.557.51010月7日15:0010月7日23:0010月8日06:0010月8日14:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。