#评测/基准
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#评测/基准
今日 2 条研究 · 工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Reddit · r/LocalLLaMAAI 评分1313 本地 LLM 用户盲测:8 人体验 Qwen 3.5/3.6 与 Gemma 多档模型,多数以为是 GPT-5.5
一名用户在 RTX 3090 上用 vLLM 部署了 Qwen 3.6 27B、Qwen 3.6 35B-A3B、Gemma 26B-A4B、Qwen 3.5 9B、Gemma 12B、E4B、E2B 等本地模型,让 13 名参与者通过 OpenWebUI 界面盲用约两个月共 7,912 次请求。
Reddit · r/artificialAI 评分3838 浏览器战争模拟游戏 SECOND STRIKE 让四个 AI 模型各掌一国开战,DeepSeek 在 15 局中 13 次发射核弹
开发者推出浏览器核战模拟游戏 SECOND STRIKE,给 DeepSeek、Grok、Mistral、GPT 各分配一个国家,各跑 15 局相同战争并记录公开表态、私下计划与实际指令。
Reddit · r/LocalLLaMAAI 评分2525 盲测 A/B 投票平台对比 1,200+ 次 Blender 建模中 LLM 与 agent 框架的表现
Reddit 用户 izolight 上线了一个盲测 A/B 投票平台,让 Claude Code、Codex、opencode、omp、pi、dsh 等 AI agent 在 Blender 中完成建模任务,由用户投票选出更好的结果,覆盖纯脚本和 MCP 两种接入方式,并测试不同推理等级以寻找成本与时间平衡点。
Reddit · r/LocalLLaMAAI 评分2626 CivBench 评测大语言模型打《文明 5》游戏能力,GLM-5.3 领先 Opus-5.5
研究者发布更新版 CivBench 基准,测试大语言模型在《文明 5》中的长链策略能力。所有模型在三个相同固定开局下轮换对战,每局由两个被测 LLM 文明与六个 Vox Populi AI 对手组成。
Import AIAI 评分2727 Import AI 475:智能体集群扩展机制、Google DeepMind 推出 SynthID Bio 水印工具,以及 AI 驱动科学经济兴起
Toby Ord 在文章中提出,AI 智能体集群(swarm)是一种新的推理扩展方式,4 个智能体并行执行任务理论上能以约一半的时间完成同等工作,但集群规模扩大 10 倍仅能带来 3 到 5 倍的性能提升,呈现出经济学家所说的"互相踩脚"式边际递减。