交叉发现
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
交叉发现
今日 8 条研究 · 工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Reddit · r/LocalLLaMAAI 评分1313 本地 LLM 用户盲测:8 人体验 Qwen 3.5/3.6 与 Gemma 多档模型,多数以为是 GPT-5.5
一名用户在 RTX 3090 上用 vLLM 部署了 Qwen 3.6 27B、Qwen 3.6 35B-A3B、Gemma 26B-A4B、Qwen 3.5 9B、Gemma 12B、E4B、E2B 等本地模型,让 13 名参与者通过 OpenWebUI 界面盲用约两个月共 7,912 次请求。
Reddit · r/artificialAI 评分3838 浏览器战争模拟游戏 SECOND STRIKE 让四个 AI 模型各掌一国开战,DeepSeek 在 15 局中 13 次发射核弹
开发者推出浏览器核战模拟游戏 SECOND STRIKE,给 DeepSeek、Grok、Mistral、GPT 各分配一个国家,各跑 15 局相同战争并记录公开表态、私下计划与实际指令。
Reddit · r/MachineLearningAI 评分66 在无标注网络流量上做应用识别:从自监督对比学习到 BERT 式掩码建模的方案探讨 [R]
一位开发者尝试用 Transformer 模型从无标注网络流量中识别 3000-5000 个应用,仅有约 100 个应用的小规模标注数据。流量以约 15 秒为窗口切分,每个窗口包含多条带域名、协议、字节数与时间戳等特征的网络流。候选方案包括自监督对比学习、BERT 式掩码建模预训练后再在小标注集上微调,以及对嵌入向量做聚类后逐步映射到已知应用;作者担忧模型可能学到设备、会话或用户特征而非应用本身。
Reddit · r/artificialAI 评分3131 科学家借助生成式 AI 设计转座酶,实验性基因编辑系统靶向 DNA 插入效率翻倍
科学家用生成式 AI 设计出一种蛋白质,将实验性基因编辑系统的靶向 DNA 插入效率在培养细胞中提升至两倍。该团队在数千个基因组中筛选天然与合成转座酶,相关研究由 Integra Therapeutics、庞培法布拉大学和基因组调控中心合作,发表于 Nature Biotechnology。研究同时指出,基因编辑中某一步骤的改进并不必然提升所有应用场景的效果。
Reddit · r/MachineLearningAI 评分1818 MA-BC:一种通过拆分分歧、汇聚共识来高效学习多目标专家演示的模仿学习方法
Ziyad Sheiyad Sheebaelhamd 等人提出 MA-BC,针对多个目标不同的专家的演示数据,通过仅在观测动作不冲突时汇聚数据来兼顾各自权衡并共享信息。文章给出该策略的样本复杂度上下界证明。该工作由 Ziyad Sheebaelhamd、Luca Viano、Volkan Cevher、Claire Vernade 联合提交。
Google Research精选AI 评分6868 Google 研究:AI 协助三个月专利撰写实地实验显示初级律师未获持久判断力提升
Google Research 发布与 NBER 合作的论文《Does AI Assistance Enhance or Erode Expertise?
推荐理由:原文基于三个月实地实验区分了即时产出与长期判断力,可帮助读者理解 AI 工具在专业培养中的边界。
AWS Machine Learning BlogAI 评分2323 Amazon Quick 与 Amazon Bedrock 通过实时 ACL 强制执行重构 RAG 访问控制
Amazon Quick 和 Amazon Bedrock Knowledge Bases 通过实时 ACL 强制执行解决企业 RAG 场景下的权限难题。
Hacker News · 首页AI 评分1212 皮尤研究中心调查:37国受访者认为社交媒体损害民主的比例持续上升
皮尤研究中心对 37 个国家的调查显示,自 2022 或 2023 年以来,多数有可比数据的国家中认为社交媒体不利于民主的受访者比例显著上升,美国以 64% 居前。富裕国家民众更倾向持负面看法,澳大利亚、加拿大、法国、德国、荷兰、英国和美国均有半数以上受访者持此观点。调查还显示社交平台在各国的使用差异,但总体负面评价呈扩大趋势。
Hacker News · 首页AI 评分2121 Lean 中由 AI 辅助完成 11 个正方形最优填充的完整证明
一个使用 Lean 的项目通过 AI 辅助生成并由 EvolvingPrograms 完整验证运行通过,完成了 11 个正方形最优填充的完整最优化证明。验证接受全部 7,920 个本地 Lean 模块,最终审计报告零许可项,并依赖 Lean kernel 与原生编译器。
Reddit · r/ChatGPTAI 评分33 NOVA SBE 硕士论文招募参与者测试 AI 酒店预订助手
葡萄牙 NOVA SBE 学生正在为硕士论文招募参与者,测试一款 AI 酒店预订助手,参与者将在虚构酒店场景中选择房型,并在交互前后回答问卷,全程约 10-15 分钟,不涉及真实预订或购买。作为感谢,完成者可参与抽取 5 张 €50 亚马逊礼品卡。
Reddit · r/artificialAI 评分33 NOVA SBE 硕士论文招募参与者测试 AI 酒店预订助手
葡萄牙 NOVA SBE 学生为完成硕士论文研究,招募参与者试用一个 AI 酒店预订助手并填写问卷,全程约 10–15 分钟,不涉及真实预订或购买。作为感谢,完成者有机会赢取五张 €50 Amazon 礼品卡中的一张。
The DecoderAI 评分7575 OpenAI 在 GitHub 发布 372 条 AI 数学证明,绕过传统期刊流程
OpenAI 在 GitHub 上发布 372 条由其内部前沿模型生成的数学结果,称每条都解决了一个开放问题或在关键方向取得实质进展,其中包含对若干主流计算机算法的改进以及与黎曼猜想相关的进展。
Hacker News · 首页AI 评分4141 OpenWAM:面向可组合世界-动作模型的开源框架
OpenWAM 是一个面向机器人操作的世界-动作模型开源框架,将 Wan2.2-5B 视频模型与 2B 动作专家在 Mixture-of-Transformers 架构中结合,预训练使用约 334 万条轨迹、14.64k 小时视频。
Product HuntAI 评分1212 Ownfeed:自动筛选 Reddit、X、Bluesky 和 Hacker News 上的潜在客户发帖
Ownfeed 是一款面向独立开发者的客户线索监控工具,用户只需粘贴产品链接,它就会每天自动抓取 Reddit、X、Bluesky 和 Hacker News 上的相关讨论,并只保留真正有需求的用户发帖。产品不依赖关键词告警、收件箱提醒或自动回复机制,用户每天花约五分钟浏览即可自行回复。
量子位 QbitAIAI 评分4242 OpenAI 一夜公开 722 篇数学手稿,覆盖黎曼、霍奇、BSD 等猜想
OpenAI 一次性公开了 722 篇数学手稿,全部由一个尚未发布的内部模型生成,共归为 372 组结果,涉及准黎曼猜想、霍奇猜想、BSD 猜想、π 的无理性指数等 17 个方向,平均每项结果消耗的算力约相当于 ChatGPT Pro 思考 3 小时。
Hacker News · 首页AI 评分3535 UniEvo-VL:面向多模态模型自改进的自蒸馏训练框架
UniEvo-VL 是一种让单个多模态模型同时充当教师与学生的自进化框架,通过学生与教师条件下的去噪扩散分布之间的逐状态散度最小化,在测试时利用模型自身的批判反馈进行自蒸馏训练。
Hacker News · 首页AI 评分2525 OpenAI 发布整数乘法复杂度低于 n log n 的新成果
OpenAI 在 Math Release 预印本平台上发表了题为《Integer multiplication below $n\log n$》的研究,作者署名为 OpenAI。该论文聚焦于整数乘法这一基础算法问题,尝试给出低于 $n\log n$ 复杂度的乘法方法。
Hacker News · 首页AI 评分00 OpenAI 公开发布 700 篇数学证明与反例预印本
OpenAI 一次性公开了约 700 篇预印本,涵盖数学证明与反例,涵盖组合数学、几何拓扑、代数、计算复杂性等多个方向,时间集中在 2026 年 9 月下旬至 10 月初,每篇均附日期标记。
The Verge · AIAI 评分6161 OpenAI 公开 722 篇数学论文手稿,称包含对数百个未解问题的求解
OpenAI 在 GitHub 发布了 722 篇数学论文手稿,覆盖 372 个结果族,称其中包含对数百个长期未解数学问题的解答。相关研究来自一款尚未发布的前沿模型,公司称平均每个结果约消耗相当于 ChatGPT Pro 三小时思考的算力,并附带了部分推理摘要与计算量估计。
Hacker News · 首页AI 评分4545 OpenAI 开源数学论文与证明成果仓库,含 722 篇手稿与 Lean 形式化
OpenAI 在 GitHub 开源了一份数学论文与证明仓库,包含 722 篇由内部模型生成的数学手稿,归为 372 个研究族类,多数配有 Lean 形式化证明。模型被投喂约 4,000 个开放问题,平均每项结果使用 3 小时 ChatGPT Pro 思考算力,部分成果涉及黎曼 ζ 函数无零点区域与 Hodge 猜想证明。
Hacker News · 首页AI 评分5858 OpenAI 在官网分享 AI 数学进展,公开数学与预印本仓库
OpenAI 在官网发布 “Sharing AI progress in mathematics” 页面,并给出 GitHub 仓库 openai/math 及其中的 preprints 目录,公开其数学方向的研究资料。该帖在 Hacker News 首页获得 1263 分、1453 条评论,引发社区围绕 OpenAI 数学能力与公开材料的讨论。
Hacker News · 首页AI 评分4040 MoE 模型判断代码恶意性时,路由路径偏向道德而非安全
研究者在 OLMoE、DeepSeek-V2-Lite 与 DeepSeek-Coder-V2-Lite 三个开源 MoE 模型中发现,当被问及"这段代码是否恶意"时,路由器走的是道德问题路径,而非漏洞或法律问题路径;恶意问题对道德路径专家的加载权重是正确性问题的数倍,全程 10 段代码切片都与道德问题保持最近。
Reddit · r/LocalLLaMAAI 评分2727 FactorEngram:基于基向量门控的分解式 n-gram 记忆模块用于大语言模型
FactorEngram 提出一种用于大语言模型的分解式 n-gram 记忆模块,通过在共享基向量字典上检索稀疏系数并以基向量级门控进行上下文调制,使多义模式可按上下文选择性读取相关记忆成分,相较 Engram 将每个嵌入作为整体存储的方式更灵活。
Google ResearchAI 评分4141 Google Earth AI 用 PDFM 行星地理空间基础模型赋能全球公共卫生
Google Research 团队以 Google Earth AI 的 Population Dynamics Foundation Model(PDFM)为代表,演示了行星级地理空间基础模型在公共卫生中的新范式。
The DecoderAI 评分5454 研究团队扩展 LeCun 的 JEPA,推出跨物理与生物的通用世界模型 JEPA-Anything
PhAI Labs 联合斯坦福、牛津、普林斯顿的研究者发布论文 JEPA-Anything,将 LeCun 提出的 Joint-Embedding Predictive Architectures(JEPA)扩展为一个跨物理、机器人、气象、生物学等七类领域的通用世界模型。
Reddit · r/MachineLearningAI 评分1717 论文 "Learning to Learn a Language":用合成非语言先验实现自然语言上下文学习
一篇名为"Learning to Learn a Language"的论文提出在上下文学习自然语言的方法,用从随机循环因果模型采样的合成序列作为先验,训练一个 300M 参数的 byte-level Transformer,仅用这些合成序列训练后即可在测试时预测真实语言。
Hacker News · 首页AI 评分6060 SemiAnalysis 对比 Anthropic 与 OpenAI 订阅计划:Opus 5.5 套餐性价比约为 OpenAI 的 5 倍
SemiAnalysis 发布订阅计划 Tokenomics 仪表盘方法论与对比报告。报告按 (套餐、模型、token 类型) 三元组实测各档订阅的 API 等价价值。
Reddit · r/ChatGPTAI 评分66 博士生咨询最适合用于论文研究的 AI 订阅服务
一名博士生在 Reddit 求助,希望找到最适合撰写论文章节的 AI 订阅服务。该用户需要 AI 能深入搜索近期全球真实项目进展,并梳理出研究空白与下一步方向。帖子未给出具体模型或订阅方案的推荐答案。
Reddit · r/LocalLLaMAAI 评分4444 用闭式轨迹权重手术把 Qwen 3.5 4B 能力迁移到 0.8B:中间层为何崩溃及 4 个锚点块如何修复
研究者提出一种跳过反向传播的闭式轨迹匹配方法,通过正则化最小二乘和谱投影直接把 Qwen 3.5 4B 的层间隐藏状态轨迹迁移到 0.8B 学生模型;起初编辑全部 24 层导致 NLL 暴涨 64.78%。
Reddit · r/MachineLearningAI 评分77 一名学习者计划从零起步系统梳理 ML 与 AI 发展史,公开征求学习与社区搭建建议
一位 Reddit 用户计划从电路、晶体管和逻辑门开始,系统梳理机器学习与人工智能的发展脉络,涵盖算法、统计、神经网络、深度学习、大语言模型(LLM)与 AI 智能体等主题,并打算以公开学习系列的形式记录进展、提问与讨论。该用户希望就学习方式、内容发布平台(自建博客还是选择 X、LinkedIn、Reddit、Substack、Medium 等现有社区)以及如何吸引同好建立学习社群征求社区建议。
Reddit · r/LocalLLaMAAI 评分2525 盲测 A/B 投票平台对比 1,200+ 次 Blender 建模中 LLM 与 agent 框架的表现
Reddit 用户 izolight 上线了一个盲测 A/B 投票平台,让 Claude Code、Codex、opencode、omp、pi、dsh 等 AI agent 在 Blender 中完成建模任务,由用户投票选出更好的结果,覆盖纯脚本和 MCP 两种接入方式,并测试不同推理等级以寻找成本与时间平衡点。
Reddit · r/LocalLLaMAAI 评分2626 CivBench 评测大语言模型打《文明 5》游戏能力,GLM-5.3 领先 Opus-5.5
研究者发布更新版 CivBench 基准,测试大语言模型在《文明 5》中的长链策略能力。所有模型在三个相同固定开局下轮换对战,每局由两个被测 LLM 文明与六个 Vox Populi AI 对手组成。
Hacker News · 首页AI 评分3333 Opus 5.5 智能体发现两种室温磁性半导体候选材料
Opus 5.5 agents 协助发现两种 Luttinger 补偿型室温磁性半导体候选材料。其一是首次设计的五元化合物 YBaMnFeO₅,DFT(HSE06)计算预测其带隙为 2.35 eV,空穴自旋窗口 1.0 eV、电子自旋窗口 1.4 eV,远高于室温热扰动(约 26 meV);另一种是 1999 年已合成、但其目标性质此前未被预测的已知材料。
Hacker News · 首页AI 评分6262 Dust:在不依赖反向传播的情况下预训练 Transformer
qLabs 提出 Dust,一种在激活空间(每个 token 独立扰动)做零阶优化的 transformer 预训练方法,无需反向传播。
Google ResearchAI 评分3737 Google 发布《智能体隐私与安全的开放与新兴问题》研讨会报告,主张以"情境完整性"框架约束 AI 智能体行为
Google 发布一份由 50 多位学界与业界专家共同撰写的研讨会报告,系统梳理 AI 智能体在隐私与安全上区别于传统软件的三大挑战:非结构化接口带来的提示词注入、概率性控制流难以用传统测试保障,以及任务委派后用户监督失效的"确认疲劳"。报告主张以"情境完整性"理论为基础,构建包含系统级沙箱、模型级推理与用户级控制的分层防御架构,并提出由实时动态策略引擎监督智能体行为是否合乎所在情境的社会规范。
Reddit · r/LocalLLaMAAI 评分1313 AnyJev:把任意 LLM 转为 Jev 式决策模型的 Nokia 应用研究项目
Nokia 应用研究中心发布 AnyJev 项目,可在单次前向传播中从 LLM 内部状态直接得出可信决策,无需生成循环、解析或微调。该方法可将大语言模型改造为快速、低成本且确定性输出的分类器,把生成式模型转为推理型决策模型。
Reddit · r/LocalLLaMAAI 评分00 Context Language Models 论文解读:让模型像编辑文件一样动态修改上下文
一篇新论文提出 Context Language Models,让模型在推理过程中像编辑文件一样实时修改上下文,可在长时任务、编程与深度研究上提升表现并降低显存占用。
MIT Technology Review · AIAI 评分1313 知识匮乏成 AI 智能体落地最大瓶颈,MIT Technology Review 调研称仅 34% 企业项目进入生产
MIT Technology Review 对 300 位数据与 AI 高管的调研显示,知识匮乏是企业 AI 智能体难以投产的关键瓶颈,约 34% 的智能体项目最终进入生产环节,即便高科技企业也面临同样困境。
Import AIAI 评分2727 Import AI 475:智能体集群扩展机制、Google DeepMind 推出 SynthID Bio 水印工具,以及 AI 驱动科学经济兴起
Toby Ord 在文章中提出,AI 智能体集群(swarm)是一种新的推理扩展方式,4 个智能体并行执行任务理论上能以约一半的时间完成同等工作,但集群规模扩大 10 倍仅能带来 3 到 5 倍的性能提升,呈现出经济学家所说的"互相踩脚"式边际递减。
Hacker News · 首页AI 评分3939 Cloudflare Web Search API 进入公测,支持 Ceramic.ai、Exa、Linkup 三家搜索提供商
Cloudflare Web Search API 进入 beta 测试,允许 AI 智能体和应用通过 REST API 或 Worker 调用实时搜索互联网,结果经 AI Gateway 路由并按各提供商标价计费,无额外加价。