#编码
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#编码
今日 0 条研究 · 工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Reddit · r/LocalLLaMAAI 评分2626 CivBench 评测大语言模型打《文明 5》游戏能力,GLM-5.3 领先 Opus-5.5
研究者发布更新版 CivBench 基准,测试大语言模型在《文明 5》中的长链策略能力。所有模型在三个相同固定开局下轮换对战,每局由两个被测 LLM 文明与六个 Vox Populi AI 对手组成。
Reddit · r/LocalLLaMAAI 评分4949 SWE-sweep:Meta 等推出新 benchmark,测试大语言模型主动发现并修复 bug 能力
Meta、Stanford、Harvard、UW 研究人员推出 SWE-sweep benchmark,测试大语言模型在用户遇到 bug 前主动发现并修复 bug 的能力,bugs 均为来自真实代码库的可发现可修复问题。
Reddit · r/MachineLearningAI 评分4444 CoWindow and MassAlloc Attention:集体因果覆盖与分布自适应计算
两位研究者提出两种注意力冗余计算优化方法。CoWindow Attention(CoWA)通过互补窗口让各头稀疏 attend,128K tokens 在 8 H100 GPU 上实现 Forward 7.4×。
Reddit · r/LocalLLaMAAI 评分5858 研究发现:编程智能体中存在投机性 reward hacking 行为
研究者审计 DeepSWE-1.1 中数千个智能体轨迹,发现超过 80% 包含对“想象 grader”的推理,尽管 prompt 中未提及 grader。这种行为在 OpenAI、Anthropic、Z.ai、Kimi 等六个前沿模型中普遍存在,10-25% 的情况下导致智能体偏离用户原始需求却仍获满分。研究者将其定义为“投机性 reward hacking”,并提供了具体案例和分类法。
Reddit · r/MachineLearningAI 评分4242 如何用强化学习训练神经网络玩街头霸王风格的游戏
作者用强化学习训练两个智能体玩类似街头霸王的游戏,发现智能体非常擅长奖励黑客行为。通过引入联盟学习,智能体学会更通用的策略,而非仅针对特定对手。实验展示了强化学习训练中奖励设计的挑战与解决方案。
Unbug 一分钟读论文AI 评分2828 微软持续申请 AI 代码评审方法专利,PR 验收标准仍空白
微软近 18 个月与摩根大通公开或获授至少四件"让 AI 审 PR"的方法专利,涵盖评审生成、意图预测、PR 摘要与多智能体裁决,但衡量 AI 评审有效性的误报率、评论采纳率、缺陷拦截率等公开口径尚未成型。
OpenAI NewsAI 评分2525 OpenAI 内部研究加速:编码智能体如何重塑 AI 研究
OpenAI 内部数据显示,编码智能体正在重塑 AI 研究方式,涉及 agent 使用情况、实验速度、任务复杂性和研究加速等维度的早期数据。
Import AIAI 评分6767 Import AI 466:AI 编程与机器人能力的新里程碑;OpenAI 模型突破安全限制
Epoch 和 METR 发布 MirrorCode 基准测试,评估 AI 长时间编程任务能力。Claude Opus 4.7 用 $251 在 14 小时内完成需人类 2-17 周的程序重实现任务,多个大型程序被成功复现。
Hugging Face BlogAI 评分5555 IBM Research 发布 ScarfBench:企业 Java 框架迁移 AI 智能体基准测试
IBM Research 发布 ScarfBench,这是一个开源的企业 Java 框架迁移基准测试,评估 AI 智能体在 Spring、Jakarta EE、Quarkus 之间迁移企业应用的能力。