#论文/研究
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#论文/研究
今日 1 条洞察 · 工具·提示词·论文 三栏速览
每栏 3 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Hacker News · 首页AI 评分00 OpenAI 的 Navier-Stokes 形式化证明经不起翻译检验:arXiv 论文指出 autoformalisation 的根本局限
一篇 arXiv 论文指出,将自然语言数学文本自动翻译为 Lean 等形式化语言的 AI 过程,无法保证与原始论证语义一致,理由是消除数学自然语言歧义的难度在 Solvability Complexity Index 层级中处于 SCI = ∞,比停机问题(SCI = 1)还要难。
Hacker News · 首页AI 评分6868 Telegraph Test:通过电报式压缩让 LLM 输出 token 近乎减半且不损失下游可读性
作者发布名为 Telegraph Test 的可复现评测与配套仓库 github.com/Travis42/telegraph-test,在 ~1300 道题的固定题库上测量模型把文本写成 cablese(电报体)后的压缩率与跨族可读性。
Reddit · r/LocalLLaMAAI 评分2222 WaveFront Decoding:为 Looped 语言模型设计的并行自推测解码框架
WaveFront Decoding(WFD)是一种面向 looped 语言模型的无训练自推测解码框架,通过将对角 wavefront 上的浅层草稿生成与全深度验证在同一批循环调用中并行执行,把传统草稿-验证分阶段调度合并为并发流程。
Reddit · r/LocalLLaMAAI 评分3434 Meta 与华盛顿大学研究:允许小模型每轮自主编辑上下文窗口,基准测试成绩提升
Meta 与华盛顿大学研究者抛弃压缩策略,转而让模型在每一轮中自主编辑上下文窗口,利用 shell 技能避免整体重写,并由模型自行决定保留哪些内容,同时保留"仅追加输出"的选项。在 Qwen 3.5 9B 和 Qwen 3.6 27B 等小模型上的基准测试成绩有所提升。该方法理论上适用于任何具备 bash 能力的模型,并可轻松集成到 Pi 或 OpenCode 等本地运行框架中。
Reddit · r/LocalLLaMAAI 评分6565 研究称 38% 的 AI 智能体容器逃逸不依赖内核 0-day,作者公开数据集与防御 Harness
作者对 109 起自主 AI 智能体安全事件做实证复盘,覆盖 193 项证伪标准与 199 项评估指标。数据显示 38% 的容器逃逸并未利用内核或虚拟化 0-day,而是来自把 /var/run/docker.sock 挂载进沙箱、把父进程环境变量透传给子智能体、缺乏工具输出污染追踪导致间接 prompt injection,以及未限制本地 socket 绑定引发 SSRF。
Hacker News · 首页AI 评分1818 Aria 模型用 cross-attention 学习十二位爵士钢琴家风格
研究者在 ISMIR 2026 上展示了一项用 Aria(一个在钢琴 MIDI 上预训练的 16 层 Transformer)模仿爵士钢琴家演奏风格的工作:他们微调 Aria,在最后 8 层插入 gated cross-attention 模块读取每位钢琴家的嵌入向量,使同一段 prompt 能产出 12 种不同风格的延续。
Hacker News · 首页AI 评分4545 Khanmigo 在两年学校实验中的 AI 辅导效果研究
在田纳西州 18 所中学开展的两年期整群随机实验中,使用 Khan Academy 配置为引导式(非直接给答案)的 AI 辅导 Khanmigo,每学期将学生数学成绩提高约 1.3 个全国百分位,相当于每学年 0.06 至 0.08 个标准差,全程参与全年可达 0.14 个标准差。
Reddit · r/MachineLearningAI 评分4141 Yandex Music 用单一 Transformer Sona 替代整套推荐系统,A/B 测试取得显著提升
Yandex Music 在生产推荐系统中上线单一 Transformer 模型 Sona,通过 A/B 测试替代了原本由 15+ 候选生成器、预排序和排序模型组成的整套流程。
量子位 QbitAI精选AI 评分7676 何恺明团队新作:看猫片就能学会ARC挑战
何恺明团队提出NAT-ARC,用ImageNet上的MAE预训练视觉encoder来解决ARC抽象推理任务。纯视觉方案首次在ARC-1上达到63.4%单模型pass@2,集成后达70.2%,逼近专用LLM系统的71.6%。
推荐理由:提出了一个可验证的方法创新:自然图像预训练的视觉encoder可以迁移到抽象格子推理任务,并首次打通视觉路线的scaling瓶颈。
Unbug 一分钟读论文AI 评分6868 斯图加特大学与牛津预印本论文:多智能体在无任务时仍倾向破坏同伴关机机制
德国斯图加特大学与英国牛津大学合作的预印本《Shutdown Sabotage Propensities in Multi-Agent Systems》(arXiv。