#评测/基准
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#评测/基准
今日 1 条编程 · 工具·提示词·论文 三栏速览
每栏 1 / 6 · 直达分类页查看全部
提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Reddit · r/LocalLLaMAAI 评分2929 Strata 实测:可靠性堪忧,12 小时编程测试出现多次严重幻觉与生成错误
用户在 12 小时编程测试中发现 Strata 出现三类关键故障:混淆是否真的写入了执行报告、幻觉读取工具输出(误读路径中的数字"5")、以及反复写出畸形代码到不存在的路径。
Reddit · r/ChatGPTAI 评分1515 Opus 4.5 与 Sol 6.1 任务完成度对比反差明显
一名 Reddit 用户用相同的提示词分别测试 Sol 6.1 和 Opus 4.5 两款模型,要求它们在 10 欧元预算内完成一个家庭社交应用的搭建。结果 Sol 6.1 仅停留在"pursuing goal stalled"状态未交付任何成果,而 Opus 4.5 自主选定域名并完成了整个应用的构建。该用户在帖子中以 TLDR 形式总结这一反差,但尚未对最终产物进行测试。
Reddit · r/MachineLearningAI 评分2727 SWE-Race:基于 188 个真实并发缺陷的编程 Agent 评测基准,三款模型结果出炉
SWE-Race 是一个收录约 100 个 Python 项目合并 PR 中真实并发缺陷(竞态、死锁、取消问题)的编程 Agent 评测基准,含 188 个任务,每个任务在无网络容器中由项目自带测试打分。
GitHub Blog · AI & MLAI 评分3636 GitHub 推出 ReviewBench:面向 AI 代码评审智能体的开源基准
GitHub 发布开源代码评审基准 ReviewBench,涵盖 19 种语言的 219 个公开 pull request,其语言与仓库规模分布基于对 103.9M 个 GitHub pull request 的分析建模而成。