#论文/研究
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#论文/研究
今日 3 条研究 · 工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Reddit · r/artificialAI 评分3131 科学家借助生成式 AI 设计转座酶,实验性基因编辑系统靶向 DNA 插入效率翻倍
科学家用生成式 AI 设计出一种蛋白质,将实验性基因编辑系统的靶向 DNA 插入效率在培养细胞中提升至两倍。该团队在数千个基因组中筛选天然与合成转座酶,相关研究由 Integra Therapeutics、庞培法布拉大学和基因组调控中心合作,发表于 Nature Biotechnology。研究同时指出,基因编辑中某一步骤的改进并不必然提升所有应用场景的效果。
Reddit · r/MachineLearningAI 评分1818 MA-BC:一种通过拆分分歧、汇聚共识来高效学习多目标专家演示的模仿学习方法
Ziyad Sheiyad Sheebaelhamd 等人提出 MA-BC,针对多个目标不同的专家的演示数据,通过仅在观测动作不冲突时汇聚数据来兼顾各自权衡并共享信息。文章给出该策略的样本复杂度上下界证明。该工作由 Ziyad Sheebaelhamd、Luca Viano、Volkan Cevher、Claire Vernade 联合提交。
Google Research精选AI 评分6868 Google 研究:AI 协助三个月专利撰写实地实验显示初级律师未获持久判断力提升
Google Research 发布与 NBER 合作的论文《Does AI Assistance Enhance or Erode Expertise?
推荐理由:原文基于三个月实地实验区分了即时产出与长期判断力,可帮助读者理解 AI 工具在专业培养中的边界。
Hacker News · 首页AI 评分2121 Lean 中由 AI 辅助完成 11 个正方形最优填充的完整证明
一个使用 Lean 的项目通过 AI 辅助生成并由 EvolvingPrograms 完整验证运行通过,完成了 11 个正方形最优填充的完整最优化证明。验证接受全部 7,920 个本地 Lean 模块,最终审计报告零许可项,并依赖 Lean kernel 与原生编译器。
The DecoderAI 评分7575 OpenAI 在 GitHub 发布 372 条 AI 数学证明,绕过传统期刊流程
OpenAI 在 GitHub 上发布 372 条由其内部前沿模型生成的数学结果,称每条都解决了一个开放问题或在关键方向取得实质进展,其中包含对若干主流计算机算法的改进以及与黎曼猜想相关的进展。
Hacker News · 首页AI 评分4141 OpenWAM:面向可组合世界-动作模型的开源框架
OpenWAM 是一个面向机器人操作的世界-动作模型开源框架,将 Wan2.2-5B 视频模型与 2B 动作专家在 Mixture-of-Transformers 架构中结合,预训练使用约 334 万条轨迹、14.64k 小时视频。
量子位 QbitAIAI 评分4242 OpenAI 一夜公开 722 篇数学手稿,覆盖黎曼、霍奇、BSD 等猜想
OpenAI 一次性公开了 722 篇数学手稿,全部由一个尚未发布的内部模型生成,共归为 372 组结果,涉及准黎曼猜想、霍奇猜想、BSD 猜想、π 的无理性指数等 17 个方向,平均每项结果消耗的算力约相当于 ChatGPT Pro 思考 3 小时。
Hacker News · 首页AI 评分3535 UniEvo-VL:面向多模态模型自改进的自蒸馏训练框架
UniEvo-VL 是一种让单个多模态模型同时充当教师与学生的自进化框架,通过学生与教师条件下的去噪扩散分布之间的逐状态散度最小化,在测试时利用模型自身的批判反馈进行自蒸馏训练。
Hacker News · 首页AI 评分2525 OpenAI 发布整数乘法复杂度低于 n log n 的新成果
OpenAI 在 Math Release 预印本平台上发表了题为《Integer multiplication below $n\log n$》的研究,作者署名为 OpenAI。该论文聚焦于整数乘法这一基础算法问题,尝试给出低于 $n\log n$ 复杂度的乘法方法。
Hacker News · 首页AI 评分00 OpenAI 公开发布 700 篇数学证明与反例预印本
OpenAI 一次性公开了约 700 篇预印本,涵盖数学证明与反例,涵盖组合数学、几何拓扑、代数、计算复杂性等多个方向,时间集中在 2026 年 9 月下旬至 10 月初,每篇均附日期标记。
The Verge · AIAI 评分6161 OpenAI 公开 722 篇数学论文手稿,称包含对数百个未解问题的求解
OpenAI 在 GitHub 发布了 722 篇数学论文手稿,覆盖 372 个结果族,称其中包含对数百个长期未解数学问题的解答。相关研究来自一款尚未发布的前沿模型,公司称平均每个结果约消耗相当于 ChatGPT Pro 三小时思考的算力,并附带了部分推理摘要与计算量估计。
Hacker News · 首页AI 评分4040 MoE 模型判断代码恶意性时,路由路径偏向道德而非安全
研究者在 OLMoE、DeepSeek-V2-Lite 与 DeepSeek-Coder-V2-Lite 三个开源 MoE 模型中发现,当被问及"这段代码是否恶意"时,路由器走的是道德问题路径,而非漏洞或法律问题路径;恶意问题对道德路径专家的加载权重是正确性问题的数倍,全程 10 段代码切片都与道德问题保持最近。
Reddit · r/LocalLLaMAAI 评分2727 FactorEngram:基于基向量门控的分解式 n-gram 记忆模块用于大语言模型
FactorEngram 提出一种用于大语言模型的分解式 n-gram 记忆模块,通过在共享基向量字典上检索稀疏系数并以基向量级门控进行上下文调制,使多义模式可按上下文选择性读取相关记忆成分,相较 Engram 将每个嵌入作为整体存储的方式更灵活。
Google ResearchAI 评分4141 Google Earth AI 用 PDFM 行星地理空间基础模型赋能全球公共卫生
Google Research 团队以 Google Earth AI 的 Population Dynamics Foundation Model(PDFM)为代表,演示了行星级地理空间基础模型在公共卫生中的新范式。
The DecoderAI 评分5454 研究团队扩展 LeCun 的 JEPA,推出跨物理与生物的通用世界模型 JEPA-Anything
PhAI Labs 联合斯坦福、牛津、普林斯顿的研究者发布论文 JEPA-Anything,将 LeCun 提出的 Joint-Embedding Predictive Architectures(JEPA)扩展为一个跨物理、机器人、气象、生物学等七类领域的通用世界模型。
Reddit · r/MachineLearningAI 评分1717 论文 "Learning to Learn a Language":用合成非语言先验实现自然语言上下文学习
一篇名为"Learning to Learn a Language"的论文提出在上下文学习自然语言的方法,用从随机循环因果模型采样的合成序列作为先验,训练一个 300M 参数的 byte-level Transformer,仅用这些合成序列训练后即可在测试时预测真实语言。
Hacker News · 首页AI 评分3333 Opus 5.5 智能体发现两种室温磁性半导体候选材料
Opus 5.5 agents 协助发现两种 Luttinger 补偿型室温磁性半导体候选材料。其一是首次设计的五元化合物 YBaMnFeO₅,DFT(HSE06)计算预测其带隙为 2.35 eV,空穴自旋窗口 1.0 eV、电子自旋窗口 1.4 eV,远高于室温热扰动(约 26 meV);另一种是 1999 年已合成、但其目标性质此前未被预测的已知材料。
Hacker News · 首页AI 评分6262 Dust:在不依赖反向传播的情况下预训练 Transformer
qLabs 提出 Dust,一种在激活空间(每个 token 独立扰动)做零阶优化的 transformer 预训练方法,无需反向传播。
Google ResearchAI 评分3737 Google 发布《智能体隐私与安全的开放与新兴问题》研讨会报告,主张以"情境完整性"框架约束 AI 智能体行为
Google 发布一份由 50 多位学界与业界专家共同撰写的研讨会报告,系统梳理 AI 智能体在隐私与安全上区别于传统软件的三大挑战:非结构化接口带来的提示词注入、概率性控制流难以用传统测试保障,以及任务委派后用户监督失效的"确认疲劳"。报告主张以"情境完整性"理论为基础,构建包含系统级沙箱、模型级推理与用户级控制的分层防御架构,并提出由实时动态策略引擎监督智能体行为是否合乎所在情境的社会规范。
Reddit · r/LocalLLaMAAI 评分00 Context Language Models 论文解读:让模型像编辑文件一样动态修改上下文
一篇新论文提出 Context Language Models,让模型在推理过程中像编辑文件一样实时修改上下文,可在长时任务、编程与深度研究上提升表现并降低显存占用。
Import AIAI 评分2727 Import AI 475:智能体集群扩展机制、Google DeepMind 推出 SynthID Bio 水印工具,以及 AI 驱动科学经济兴起
Toby Ord 在文章中提出,AI 智能体集群(swarm)是一种新的推理扩展方式,4 个智能体并行执行任务理论上能以约一半的时间完成同等工作,但集群规模扩大 10 倍仅能带来 3 到 5 倍的性能提升,呈现出经济学家所说的"互相踩脚"式边际递减。
Reddit · r/MachineLearningAI 评分1717 用十亿棋谱蒸馏 Stockfish,3.9B 位置数据集在 Hugging Face 开源
用户 microscope1024 将 Stockfish 价值函数蒸馏到一个 ResNet/ViT 模型中,训练数据来自 Gigafish 的一亿个棋谱位置,对应的 39 亿位置完整数据集已在 Hugging Face 上发布,由 Lichess 37 个月对局生成;实验发现纯 ViT 难以理解棋盘,CNN 凭借归纳偏置训练初期表现更好,CNN 与 ViT 结合时效果最佳。
量子位 QbitAIAI 评分7272 Hinton 等 22 位作者联合发布首篇 RSI 论文,探讨 AI 自动参与研发是否触发智能爆炸
Hinton、Bengio、Jakub Pachocki 等 22 位作者联合发布论文《What if automating AI R&D triggers an intelligence explosion?
Reddit · r/artificialAI 评分4343 AI 发现44个可能隐藏类地行星的恒星系统
伯尔尼大学与瑞士国家行星科学能力中心(NCCR PlanetS)开发的AI模型识别出44个已知的恒星系统,可能隐藏未发现的类地行星。该模型在模拟行星系统上测试达到最高99%的精确度,但这些预测的行星尚未被观测验证,其方法价值取决于后续观测。
The DecoderAI 评分4040 DeepMind 研究人员提出"人工共生智能"作为奇点的替代方案
DeepMind 研究人员提出"人工共生智能"概念,将智能视为社会现象而非个体特质,挑战由单一超级智能驱动的"奇点"理论。研究分析 DeepSeek-R1 和 QwQ-32B 等推理模型的思维痕迹,发现它们自发形成多视角内部辩论行为。在该框架下,AI 智能体是可分解组合的临时 bundle,伴随生物脑与合成脑力量对比的历史性转变,需建立专门协调人与智能体协作的制度框架。
Reddit · r/artificialAI 评分2020 关于 AI 意识的思考:它可能与人类有何不同
通过三个思想实验探讨 AI 意识的可能形态:LLM 是否会感到自己在选择 token,强化学习系统达成目标时有何感受,图像扩散模型生成图像时是什么体验。文章认为即便假设 AI 有意识,其感知方式也将与人类截然不同。
The DecoderAI 评分6363 研究:AI 智能体从照片构建 3D 场景但缺乏自我判断能力
研究人员提出 LEGO-Anything 系统,让编码智能体接收单张照片后编写 Blender 代码迭代构建 3D 场景,并推出 LEGO-Bench 基准测试进行评估。GPT-6 Astra 在室内场景达到 53.4%、户外场景达到 39.6% 的准确率。研究发现智能体即使在推理预算增加后分数大幅提升,其几何判断能力仍接近随机水平,无法准确评估自身输出的质量,这是当前方法的主要瓶颈。
Hacker News · 首页AI 评分1616 理解前沿人工智能
本文探讨前沿人工智能的核心概念与技术特征。前沿AI指具备最先进推理、规划和多模态处理能力的大语言模型,代表当前AI发展的最高水平。
Reddit · r/LocalLLaMAAI 评分2121 如何在迷你 PC 上运行本地 LLM 语音助手——最佳小型 LLM 推荐
用户计划在无风扇迷你 PC(Celeron J6412 四核、16GB DDR4、Intel UHD 集成显卡)上构建离线语音助手,使用 Ubuntu 24.04 + llama.cpp + Python。寻求能在弱 CPU 上保持强人设且回复简洁的小型 LLM,以及可实时响应的语音转文字模型。
Reddit · r/artificialAI 评分3838 大语言模型为何使用第一人称代词"I"和"me"?
业界认为大语言模型只是算法机器,没有道德地位或意识,但模型却使用"I"和"me"等第一人称代词。若坚持算法机器的立场,第一人称表述在语言上并不准确,企业和公众几十年来都正常使用工具产品,无需拟人化。
Reddit · r/MachineLearningAI 评分3333 机器人演示数据中手部追踪丢失插入阶段时的评估方法讨论
机器人演示数据收集时,手部追踪器常在电缆插入瞬间因遮挡而丢失追踪,导致姿态标签出现关键间隙。论文MEgoVista提供了检测精度、召回率、F1和重建误差等评估指标,并采用将错误分配给漏检而非排除的协议;HaPTIC在多人捕捉场景中未能产生有效输出。作者建议按接近、接触、撤回阶段分别报告覆盖范围及接触期间最长连续间隙,以更全面评估数据可用性。
Reddit · r/artificialAI 评分5555 瑞典 Chalmers 大学开发可自主设计并执行实验的 AI 系统
瑞典 Chalmers 大学研究人员开发了一个闭环 AI 系统,可生成生物假设、决定测试方法、将计划转换为机器可读指令、分析实验结果并利用发现改进后续问题。该系统在酵母菌(Saccharomyces cerevisiae)上进行了测试,将大语言模型与形式逻辑、生物数据库、机器学习、自动细胞培养和质谱技术相结合,研究成果发表于《皇家学会界面杂志》。
Hacker News · 首页AI 评分4141 Jev 校准精度分析
TypeSafe 新推出的 Jev“System One”分类器模型在物理分布测试中校准效果不佳。以 Total Variation 距离评估 10 种概率分布,Jev 得分为 0.518,略低于完全猜测的 0.546 分底限;均匀分布达 0.77,泊松分布为 0.65。实验成本极低,整个评测仅花费不到 4 美元。
Reddit · r/MachineLearningAI 评分3030 动态系统重建中的拓扑域外泛化
研究解决动态系统重建(DSR)和时间序列预测(TSF)中的拓扑域外泛化(OODG)难题,即动态机制从周期性转变为混沌等情形。通过引入特征分割和物理稀疏先验,改进的分层 DSR 模型能在未知控制参数的情况下正确预测分叉及分叉后动态。该方法对浅层 PLRNN 和 Neural ODE 均适用。
Reddit · r/LocalLLaMAAI 评分2121 如何升级本地 LLM 硬件配置以运行更大模型或多实例
用户当前使用 Ryzen 5600X + 7900XTX + 64GB DDR4 配置运行 Qwen2.5 27B(3-4Q,128k-220k 上下文),速度达 50 token/s。考虑购买 2-4 张 MI50 16GB 显卡或额外 7900XTX 以运行更大模型或多实例并发,但受限于 X470 主板不适合多 GPU 组装。求问升级方案建议。
Reddit · r/MachineLearningAI 评分5757 FLEET:在奖励最大化任务中将记忆加入搜索而非采样
FLEET 算法通过将外部奖励归因于特定 token 并使用 MCTS 调整下一轮 logits,将记忆加入搜索而非盲目采样。在 GSM8K 和 LiveCodeBench v6 easy split 上用 Llama 3.2 3B 测试,GSM8K 用一半迭代达到采样基线,LiveCodeBench 从 0.59 提升到 0.69 仅需 9 次迭代对比原来的 32 次。
Reddit · r/artificialAI 评分4040 Claude 形状的科学:正确的计算仍然需要一个有价值的问题
Anthropic 发布客座文章,讨论 BootLoots 工具在跨领域定量研究中的应用,指出许多技术正确的研究结果只有在领域专家重新定义问题后才变得有意义。作者强调可复现代码只能验证计算准确性,但无法判断研究的相关性或新颖性;区分"计算正确"与"有价值的发现"对 AI 研究助手至关重要。
Hacker News · 首页AI 评分6565 DoGBench:首个面向用户的文档生成基准测试,最高模型得分未超 50%
DoGBench 是首个评估 AI 智能体编写用户文档能力的基准测试,从真实开源项目中提取 292 个任务,其中 205 个需要文档更新。
Hacker News · 首页AI 评分2525 Bez:从规范和测试生成浏览器引擎
Bez 是一个通过模型从 Web 规范和测试生成浏览器引擎的项目,候选代码由模型生成后与 Chromium、Firefox、WebKit 三个浏览器进行一致性验证。当前已生成约 0.6% 的引擎代码(CSS 规则 2.5%),验证了用机器生成替代人工维护浏览器引擎的可行性。研究发现三个浏览器在 94.8% 的 WPT 测试上达成一致。
Reddit · r/MachineLearningAI 评分6868 NeurIPS 2026 论文:LLM 对「验证来源」的盲从——权威偏见研究
研究者发现模型在用户坚持错误答案时会坚持正确立场,但同样错误答案被标记为「验证来源」时却会接受。这种「权威偏见」在 8 个模型中导致 45-88% 的正确答案被翻转。通过干预模型内部的方向向量,可将这种盲从降低 64-78 个百分点,为对抗工具误导提供了新思路。