#论文/研究
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#论文/研究
今日 4 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Reddit · r/artificialAI 评分3131 科学家借助生成式 AI 设计转座酶,实验性基因编辑系统靶向 DNA 插入效率翻倍
科学家用生成式 AI 设计出一种蛋白质,将实验性基因编辑系统的靶向 DNA 插入效率在培养细胞中提升至两倍。该团队在数千个基因组中筛选天然与合成转座酶,相关研究由 Integra Therapeutics、庞培法布拉大学和基因组调控中心合作,发表于 Nature Biotechnology。研究同时指出,基因编辑中某一步骤的改进并不必然提升所有应用场景的效果。
Reddit · r/MachineLearningAI 评分1818 MA-BC:一种通过拆分分歧、汇聚共识来高效学习多目标专家演示的模仿学习方法
Ziyad Sheiyad Sheebaelhamd 等人提出 MA-BC,针对多个目标不同的专家的演示数据,通过仅在观测动作不冲突时汇聚数据来兼顾各自权衡并共享信息。文章给出该策略的样本复杂度上下界证明。该工作由 Ziyad Sheebaelhamd、Luca Viano、Volkan Cevher、Claire Vernade 联合提交。
Google Research精选AI 评分6868 Google 研究:AI 协助三个月专利撰写实地实验显示初级律师未获持久判断力提升
Google Research 发布与 NBER 合作的论文《Does AI Assistance Enhance or Erode Expertise?
推荐理由:原文基于三个月实地实验区分了即时产出与长期判断力,可帮助读者理解 AI 工具在专业培养中的边界。
Hacker News · 首页AI 评分00 OpenAI 的 Navier-Stokes 形式化证明经不起翻译检验:arXiv 论文指出 autoformalisation 的根本局限
一篇 arXiv 论文指出,将自然语言数学文本自动翻译为 Lean 等形式化语言的 AI 过程,无法保证与原始论证语义一致,理由是消除数学自然语言歧义的难度在 Solvability Complexity Index 层级中处于 SCI = ∞,比停机问题(SCI = 1)还要难。
Hacker News · 首页AI 评分2121 Lean 中由 AI 辅助完成 11 个正方形最优填充的完整证明
一个使用 Lean 的项目通过 AI 辅助生成并由 EvolvingPrograms 完整验证运行通过,完成了 11 个正方形最优填充的完整最优化证明。验证接受全部 7,920 个本地 Lean 模块,最终审计报告零许可项,并依赖 Lean kernel 与原生编译器。
Hacker News · 首页AI 评分6868 Telegraph Test:通过电报式压缩让 LLM 输出 token 近乎减半且不损失下游可读性
作者发布名为 Telegraph Test 的可复现评测与配套仓库 github.com/Travis42/telegraph-test,在 ~1300 道题的固定题库上测量模型把文本写成 cablese(电报体)后的压缩率与跨族可读性。
The DecoderAI 评分7575 OpenAI 在 GitHub 发布 372 条 AI 数学证明,绕过传统期刊流程
OpenAI 在 GitHub 上发布 372 条由其内部前沿模型生成的数学结果,称每条都解决了一个开放问题或在关键方向取得实质进展,其中包含对若干主流计算机算法的改进以及与黎曼猜想相关的进展。
Hacker News · 首页AI 评分4141 OpenWAM:面向可组合世界-动作模型的开源框架
OpenWAM 是一个面向机器人操作的世界-动作模型开源框架,将 Wan2.2-5B 视频模型与 2B 动作专家在 Mixture-of-Transformers 架构中结合,预训练使用约 334 万条轨迹、14.64k 小时视频。
Hacker News · 首页AI 评分3434 Jev 驱动的 SRE 诊断流水线在 SREGym-Lite 21 个故障上达到 76.2% 通过率
Jev 驱动的诊断流水线在无 LLM 智能体参与的情况下,通过程序化采集 Kubernetes 集群证据并交给 Jev 作出选择式判断,自动生成诊断报告。
量子位 QbitAIAI 评分4242 OpenAI 一夜公开 722 篇数学手稿,覆盖黎曼、霍奇、BSD 等猜想
OpenAI 一次性公开了 722 篇数学手稿,全部由一个尚未发布的内部模型生成,共归为 372 组结果,涉及准黎曼猜想、霍奇猜想、BSD 猜想、π 的无理性指数等 17 个方向,平均每项结果消耗的算力约相当于 ChatGPT Pro 思考 3 小时。
Hacker News · 首页AI 评分3535 UniEvo-VL:面向多模态模型自改进的自蒸馏训练框架
UniEvo-VL 是一种让单个多模态模型同时充当教师与学生的自进化框架,通过学生与教师条件下的去噪扩散分布之间的逐状态散度最小化,在测试时利用模型自身的批判反馈进行自蒸馏训练。
Hacker News · 首页AI 评分2525 OpenAI 发布整数乘法复杂度低于 n log n 的新成果
OpenAI 在 Math Release 预印本平台上发表了题为《Integer multiplication below $n\log n$》的研究,作者署名为 OpenAI。该论文聚焦于整数乘法这一基础算法问题,尝试给出低于 $n\log n$ 复杂度的乘法方法。
Hacker News · 首页AI 评分00 OpenAI 公开发布 700 篇数学证明与反例预印本
OpenAI 一次性公开了约 700 篇预印本,涵盖数学证明与反例,涵盖组合数学、几何拓扑、代数、计算复杂性等多个方向,时间集中在 2026 年 9 月下旬至 10 月初,每篇均附日期标记。
The Verge · AIAI 评分6161 OpenAI 公开 722 篇数学论文手稿,称包含对数百个未解问题的求解
OpenAI 在 GitHub 发布了 722 篇数学论文手稿,覆盖 372 个结果族,称其中包含对数百个长期未解数学问题的解答。相关研究来自一款尚未发布的前沿模型,公司称平均每个结果约消耗相当于 ChatGPT Pro 三小时思考的算力,并附带了部分推理摘要与计算量估计。
Reddit · r/MachineLearningAI 评分1818 AFP-GIC:可控生成式图像压缩框架在 IEEE Access 发表
AFP-GIC 框架发表于 IEEE Access(2026),针对超低码率场景,通过非对称自适应融合先验迁移管道,在不传输融合先验的前提下实现先验引导的纹理重建。
Hacker News · 首页AI 评分4040 MoE 模型判断代码恶意性时,路由路径偏向道德而非安全
研究者在 OLMoE、DeepSeek-V2-Lite 与 DeepSeek-Coder-V2-Lite 三个开源 MoE 模型中发现,当被问及"这段代码是否恶意"时,路由器走的是道德问题路径,而非漏洞或法律问题路径;恶意问题对道德路径专家的加载权重是正确性问题的数倍,全程 10 段代码切片都与道德问题保持最近。
Reddit · r/LocalLLaMAAI 评分2727 FactorEngram:基于基向量门控的分解式 n-gram 记忆模块用于大语言模型
FactorEngram 提出一种用于大语言模型的分解式 n-gram 记忆模块,通过在共享基向量字典上检索稀疏系数并以基向量级门控进行上下文调制,使多义模式可按上下文选择性读取相关记忆成分,相较 Engram 将每个嵌入作为整体存储的方式更灵活。
Google ResearchAI 评分4141 Google Earth AI 用 PDFM 行星地理空间基础模型赋能全球公共卫生
Google Research 团队以 Google Earth AI 的 Population Dynamics Foundation Model(PDFM)为代表,演示了行星级地理空间基础模型在公共卫生中的新范式。
Reddit · r/LocalLLaMAAI 评分2222 WaveFront Decoding:为 Looped 语言模型设计的并行自推测解码框架
WaveFront Decoding(WFD)是一种面向 looped 语言模型的无训练自推测解码框架,通过将对角 wavefront 上的浅层草稿生成与全深度验证在同一批循环调用中并行执行,把传统草稿-验证分阶段调度合并为并发流程。
The DecoderAI 评分5454 研究团队扩展 LeCun 的 JEPA,推出跨物理与生物的通用世界模型 JEPA-Anything
PhAI Labs 联合斯坦福、牛津、普林斯顿的研究者发布论文 JEPA-Anything,将 LeCun 提出的 Joint-Embedding Predictive Architectures(JEPA)扩展为一个跨物理、机器人、气象、生物学等七类领域的通用世界模型。
Reddit · r/MachineLearningAI 评分1717 论文 "Learning to Learn a Language":用合成非语言先验实现自然语言上下文学习
一篇名为"Learning to Learn a Language"的论文提出在上下文学习自然语言的方法,用从随机循环因果模型采样的合成序列作为先验,训练一个 300M 参数的 byte-level Transformer,仅用这些合成序列训练后即可在测试时预测真实语言。
Reddit · r/LocalLLaMAAI 评分3434 Meta 与华盛顿大学研究:允许小模型每轮自主编辑上下文窗口,基准测试成绩提升
Meta 与华盛顿大学研究者抛弃压缩策略,转而让模型在每一轮中自主编辑上下文窗口,利用 shell 技能避免整体重写,并由模型自行决定保留哪些内容,同时保留"仅追加输出"的选项。在 Qwen 3.5 9B 和 Qwen 3.6 27B 等小模型上的基准测试成绩有所提升。该方法理论上适用于任何具备 bash 能力的模型,并可轻松集成到 Pi 或 OpenCode 等本地运行框架中。
Reddit · r/LocalLLaMAAI 评分6565 研究称 38% 的 AI 智能体容器逃逸不依赖内核 0-day,作者公开数据集与防御 Harness
作者对 109 起自主 AI 智能体安全事件做实证复盘,覆盖 193 项证伪标准与 199 项评估指标。数据显示 38% 的容器逃逸并未利用内核或虚拟化 0-day,而是来自把 /var/run/docker.sock 挂载进沙箱、把父进程环境变量透传给子智能体、缺乏工具输出污染追踪导致间接 prompt injection,以及未限制本地 socket 绑定引发 SSRF。
Hacker News · 首页AI 评分1818 Aria 模型用 cross-attention 学习十二位爵士钢琴家风格
研究者在 ISMIR 2026 上展示了一项用 Aria(一个在钢琴 MIDI 上预训练的 16 层 Transformer)模仿爵士钢琴家演奏风格的工作:他们微调 Aria,在最后 8 层插入 gated cross-attention 模块读取每位钢琴家的嵌入向量,使同一段 prompt 能产出 12 种不同风格的延续。
Hacker News · 首页AI 评分4545 Khanmigo 在两年学校实验中的 AI 辅导效果研究
在田纳西州 18 所中学开展的两年期整群随机实验中,使用 Khan Academy 配置为引导式(非直接给答案)的 AI 辅导 Khanmigo,每学期将学生数学成绩提高约 1.3 个全国百分位,相当于每学年 0.06 至 0.08 个标准差,全程参与全年可达 0.14 个标准差。
Hacker News · 首页AI 评分99 LSM-Tree 键值存储的时空权衡优化研究
一篇研究论文提出针对 LSM-Tree 键值存储的时空权衡改进方案。原标题与来源未点出具体作者、机构或产品名,仅显示为 Hacker News 首页分享的 PDF 论文。论文旨在通过算法或结构优化,在查询时间与存储空间之间取得更优平衡,但具体方法与评测数据未在所提供内容中给出。
Hacker News · 首页AI 评分3333 Opus 5.5 智能体发现两种室温磁性半导体候选材料
Opus 5.5 agents 协助发现两种 Luttinger 补偿型室温磁性半导体候选材料。其一是首次设计的五元化合物 YBaMnFeO₅,DFT(HSE06)计算预测其带隙为 2.35 eV,空穴自旋窗口 1.0 eV、电子自旋窗口 1.4 eV,远高于室温热扰动(约 26 meV);另一种是 1999 年已合成、但其目标性质此前未被预测的已知材料。
Hacker News · 首页AI 评分6262 Dust:在不依赖反向传播的情况下预训练 Transformer
qLabs 提出 Dust,一种在激活空间(每个 token 独立扰动)做零阶优化的 transformer 预训练方法,无需反向传播。
Google ResearchAI 评分3737 Google 发布《智能体隐私与安全的开放与新兴问题》研讨会报告,主张以"情境完整性"框架约束 AI 智能体行为
Google 发布一份由 50 多位学界与业界专家共同撰写的研讨会报告,系统梳理 AI 智能体在隐私与安全上区别于传统软件的三大挑战:非结构化接口带来的提示词注入、概率性控制流难以用传统测试保障,以及任务委派后用户监督失效的"确认疲劳"。报告主张以"情境完整性"理论为基础,构建包含系统级沙箱、模型级推理与用户级控制的分层防御架构,并提出由实时动态策略引擎监督智能体行为是否合乎所在情境的社会规范。
Reddit · r/LocalLLaMAAI 评分00 Context Language Models 论文解读:让模型像编辑文件一样动态修改上下文
一篇新论文提出 Context Language Models,让模型在推理过程中像编辑文件一样实时修改上下文,可在长时任务、编程与深度研究上提升表现并降低显存占用。
Import AIAI 评分2727 Import AI 475:智能体集群扩展机制、Google DeepMind 推出 SynthID Bio 水印工具,以及 AI 驱动科学经济兴起
Toby Ord 在文章中提出,AI 智能体集群(swarm)是一种新的推理扩展方式,4 个智能体并行执行任务理论上能以约一半的时间完成同等工作,但集群规模扩大 10 倍仅能带来 3 到 5 倍的性能提升,呈现出经济学家所说的"互相踩脚"式边际递减。
Reddit · r/MachineLearningAI 评分4141 Yandex Music 用单一 Transformer Sona 替代整套推荐系统,A/B 测试取得显著提升
Yandex Music 在生产推荐系统中上线单一 Transformer 模型 Sona,通过 A/B 测试替代了原本由 15+ 候选生成器、预排序和排序模型组成的整套流程。
Reddit · r/MachineLearningAI 评分1717 用十亿棋谱蒸馏 Stockfish,3.9B 位置数据集在 Hugging Face 开源
用户 microscope1024 将 Stockfish 价值函数蒸馏到一个 ResNet/ViT 模型中,训练数据来自 Gigafish 的一亿个棋谱位置,对应的 39 亿位置完整数据集已在 Hugging Face 上发布,由 Lichess 37 个月对局生成;实验发现纯 ViT 难以理解棋盘,CNN 凭借归纳偏置训练初期表现更好,CNN 与 ViT 结合时效果最佳。
量子位 QbitAIAI 评分7272 Hinton 等 22 位作者联合发布首篇 RSI 论文,探讨 AI 自动参与研发是否触发智能爆炸
Hinton、Bengio、Jakub Pachocki 等 22 位作者联合发布论文《What if automating AI R&D triggers an intelligence explosion?
Reddit · r/artificialAI 评分4343 AI 发现44个可能隐藏类地行星的恒星系统
伯尔尼大学与瑞士国家行星科学能力中心(NCCR PlanetS)开发的AI模型识别出44个已知的恒星系统,可能隐藏未发现的类地行星。该模型在模拟行星系统上测试达到最高99%的精确度,但这些预测的行星尚未被观测验证,其方法价值取决于后续观测。
Hacker News · 首页AI 评分2828 Homa:终结 AI 集群的 TCP 时代
论文 Homa 提出面向 AI 集群的新型网络传输协议,目标取代该场景长期使用的 TCP。AI 训练与推理集群对低延迟、高吞吐的需求与 TCP 机制存在错配,Homa 通过定制传输层设计回应这一挑战。该工作已在 Hacker News 引发讨论,目前尚未公布具体性能数据与开源安排。
Reddit · r/artificialAI 评分2525 MoralityBench.ai:AI 道德评测基准
MoralityBench.ai 是一个基于道德心理学测试的 AI 基准评测。评测结果显示,除 Jev 外,各模型在不同运行中的答案存在显著差异,表明道德推理并非确定性输出。该基准旨在评估大语言模型的道德判断能力。
The DecoderAI 评分7474 Google 研究人员提出 RRSI 方法防止 AI 智能体在自我改进时记忆测试
Google 研究人员提出 RRSI(正则化递归自我改进智能体框架)方法,通过限制编辑预算和严格审查机制,防止 AI 智能体的自我改进过程过度拟合训练任务。在 8 个基准测试上,RRSI 在训练任务上提升高达 14.1 分,在 5 个未见过的任务上提升达 4.7 分,同时运行时 token 使用减少约 30%。
Reddit · r/MachineLearningAI 评分5252 用于动力学系统零样本重建的极简可解释架构
NeurIPS 2026 论文提出名为 DynaBase 的极简架构,仅使用一个参数 α 控制局部收敛/发散率,配合上下文选择器从给定信号中选取最近邻数据点,即可重建固定点(α<1)、极限环(α=1)和混沌吸引子(α>1)等不同动力学状态。
Reddit · r/MachineLearningAI 评分4444 425 张极端镜面反射数据集发布:用于计算机视觉与深度估计算法基准测试
一个包含 425 个资产的自定义多面镜面服装数据集发布,旨在测试计算机视觉模型、深度摄像头和空间 AI 应对极端镜面反射的能力。数据集包含 100% 未压缩的 Camera-Master RAW 文件和高分辨率 JPEG,在高对比度户外环境拍摄以触发边界框丢失和分割失败。每个资产配有分块缓冲的 SHA-256 取证清单。