#论文/研究
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#论文/研究
今日 4 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Google DeepMind精选AI 评分6868 Google DeepMind 发布 Decoupled DiLoCo:面向分布式 AI 训练的高弹性新架构
Google DeepMind 发布 Decoupled DiLoCo(解耦分布式低通信)架构,通过将训练任务分散到相互独立的计算岛屿,实现跨数据中心的分布式大语言模型训练。
推荐理由:这篇论文提出了一种新的分布式训练架构,能够在低带宽条件下跨数据中心训练大模型,同时保持较高的硬件容错性。
Google Research精选AI 评分6464 ReasoningBank:让智能体从经验中学习
Google Research 发布 ReasoningBank 框架,使大语言模型能在测试时从成功和失败的经验中自我进化。该框架将推理模式提炼为高层记忆存储,在 WebArena 和 SWE-Bench Verified 上相比无记忆智能体分别提升 8.3% 和 4.6% 成功率,并结合 MaTTS 扩展方法进一步提升 3% 成功率。
推荐理由:论文给出了在 WebArena 和 SWE-bench 上相对于 baseline 的具体提升幅度(8.3%、4.6%、3%),并开源了代码,读者可据此判断该方法对智能体记忆机制研究的参考价值。
Berkeley AI ResearchAI 评分5959 GRASP:基于梯度的新型长视野世界模型规划器
研究团队提出 GRASP,一种基于梯度的规划器,用于解决学习到的世界模型在长视野规划中的脆弱性问题。核心方法包括:将轨迹提升到虚拟状态以实现时间并行优化、向状态迭代添加随机性以实现探索、以及重塑梯度以保留动作梯度而阻断脆弱的状态输入梯度。在 Push-T 任务上,GRASP 在 H=40-80 的各视野下均取得最高成功率,且中位成功时间显著低于基线方法。
Google ResearchAI 评分5252 Google Research 发布 Simula:通过机制设计实现推理驱动的合成数据生成
Google Research 在 TMLR 发表论文,介绍 Simula 框架——一个基于推理优先的合成数据生成系统。该框架将数据生成过程分解为全局多样性、本地多样性、复杂化和质量检查四个可控维度,支持 seedless 和 agentic 方式生成数据。
Google ResearchAI 评分4949 Google Research 发布 MoGen 神经元形态生成模型,用合成神经元将脑图重建错误率降低 4.4%
Google Research 发布 MoGen(Neuronal Morphology Generation)模型,使用 PointInfinity point cloud flow matching 架构生成合成神经形状来增强 PATHFINDER 训练数据,将小鼠脑图重建错误率降低 4.4%,主要减少了合并错误。
Google ResearchAI 评分4040 ConvApparel:衡量并缩小用户模拟器中的真实感差距
Google Research推出ConvApparel数据集,包含超4000段人类-AI多轮对话(共近15000轮),在服装购物领域采用双智能体协议收集数据。该数据集通过人口级统计对齐、人类相似度评分、反事实验证三种评估维度,衡量当前LLM用户模拟器与真实人类行为的显著差距,为构建更可信的AI测试工具提供路径。
Google ResearchAI 评分5656 Google 研究评估大语言模型行为倾向的对齐度
Google 研究团队提出一个评估 LLM 行为倾向对齐度的框架,通过情境判断测试(SJT)评估 25 个模型在同理心、情绪调节等行为特质上与人类偏好的对齐程度。研究发现小型模型(<25B)对齐度接近随机水平,大型前沿模型(>120B)在人类共识度高时对齐度接近完美,但在低共识场景下存在系统性过度自信问题,且模型自我报告与其实际行为存在显著差异。
Google ResearchAI 评分5858 Google 研究:AI 评测需要多少评分者才够?
Google Research 发表研究探讨 AI benchmark 中评分者数量与项目数量的权衡。研究发现常见的 1-5 个评分者标准不足以捕捉人类观点的细微差别,若要反映真实的人类分歧通常需要超过 10 个评分者。
Google Research精选AI 评分7474 Google 发布白皮书:负责任披露量子漏洞更新加密货币安全风险评估
Google 发布白皮书,更新了量子计算机破解 ECDLP-256 椭圆曲线密码学所需的资源估算。估算显示需不到 50 万物理量子比特在几分钟内即可破解,这比之前减少了约 20 倍。Google 建议加密货币社区转向后量子密码学以应对量子计算威胁,并采用零知识证明方式披露漏洞以避免被恶意利用。
推荐理由:原文给出了量子计算机破解 ECDLP-256 的最新资源估算,读者可据此了解量子威胁的实际时间线并提前规划迁移。
Google Research精选AI 评分6363 Google发布TurboQuant:面向极端压缩的向量量化新算法
Google Research发布TurboQuant、QJL和PolarQuant三种向量量化压缩算法,可在Gemma和Mistral模型上将KV cache内存降低至少6倍,同时保持模型性能不变。
推荐理由:原文给出了6x内存降低和8x性能提升的具体数据,以及TurboQuant、QJL、PolarQuant三种算法的技术原理,读者可以据此了解向量量化技术的最新进展。
Google ResearchAI 评分3939 Google Research 在 The Check Up 大会展示医疗 AI 最新进展:从创新到临床应用
Google Research 联合 Imperial College London 和 NHS 在 Nature Cancer 发表研究,显示其 AI 诊断系统可识别 25% 传统筛查遗漏的"间隔期乳腺癌",并与印度、泰国、澳大利亚医疗机构合作完成超百万次糖尿病视网膜病变筛查。
Google Research精选AI 评分6666 Google Research 发布乳腺癌筛查机器学习研究
Google Research 与英国 NHS 合作开展 AIMS 研究,评估 AI 乳腺癌检测系统。研究一评估了 12.5 万名女性回溯数据和 12 个前瞻性站点,AI 敏感性高于首位人类读者,癌症检出率从 7.54 提升至 9.33/千人,检出 25% 间隔期癌症。
推荐理由:原文给出了详细的 AI 乳腺癌筛查系统研究方法和结果,读者可以了解 AI 在医疗筛查中的实际性能表现以及人机协作的挑战。
Google ResearchAI 评分5555 Google 测试大语言模型在高温超导研究问题上的表现
Google Research 与 Cornell 大学合作,评估了六款大语言模型在高温超导领域回答专家级问题的能力。测试问题由领域专家设计,涵盖67道深度专业问题。NotebookLM 和自定义 RAG 系统基于专家筛选的文献库表现最佳,而依赖开放网络的模型倾向于混淆已确立理论与高度推测性假说。模型在时序理解、上下文理解和图像推理方面存在明显弱点。
Berkeley AI ResearchAI 评分4646 SPEX and ProxySPEX 如何在大规模语言模型中识别关键交互
Berkeley AI Research 提出 SPEX(Spectral Explainer)和后续算法 ProxySPEX,利用信号处理与编码理论将交互发现规模提升数个数量级。
Google Research精选AI 评分7373 Google Research 发布 Groundsource:用 Gemini 将新闻转化为灾害数据
Google Research 发布了 Groundsource,这是一项利用 Gemini 将全球新闻报道转化为结构化灾害数据的新方法论。该方法已生成 260 万条城市突发洪水事件记录,覆盖 150 多个国家(2000 年至今),准确率在实用层面达 82%。Google 已将此数据用于改进 Flood Hub 的洪水预测能力,未来计划扩展到其他灾害类型。
推荐理由:该方法通过 AI 从全球新闻中提取结构化灾害数据,填补了传统监测系统无法覆盖的小型和局部灾害的数据空白。
Google Research精选AI 评分7171 Google在真实临床研究中测试对话式诊断AI可行性
Google Research与Beth Israel Deaconess Medical Center合作,对对话式诊断AI系统AMIE进行了前瞻性单中心可行性研究。
推荐理由:原文给出了在真实临床环境中测试对话式诊断AI的详细数据,包括安全性、诊断准确率、用户接受度等,读者可以据此了解当前医疗AI从模拟场景走向真实诊疗的可行性。
Google ResearchAI 评分5353 WAXAL:面向非洲语言语音技术的大规模开放资源
Google Research 发布 WAXAL 数据集,涵盖 27 种非洲语言,包含约 1846 小时 ASR 转录语音和 565 小时 TTS 高保真录音,采用 CC-BY-4.0 许可证开放获取。该数据集通过图像提示的采集方法获取自然语音,并与 Makerere 大学、 Ghana 大学等非洲学术机构合作构建,旨在为非洲 AI 生态系统提供语音技术研究基础设施。
Berkeley AI ResearchAI 评分4343 信息驱动的成像系统设计
研究团队开发了一个基于互信息的成像系统直接评估与优化框架,可在不依赖具体任务解码器的情况下量化测量区分物体的信息量。该框架在彩色摄影、射电天文学、无透镜成像和显微镜四个领域验证,信息估计可准确预测下游任务性能。优化该信息指标可产生与端到端神经网络方法相当的设计结果,同时显著降低内存和计算需求。
Berkeley AI ResearchAI 评分4949 强化学习新范式:分而治之算法如何突破长程任务扩展性难题
本文提出一种基于“分而治之”的强化学习新算法,突破传统时序差分(TD)学习的扩展性瓶颈。该方法将轨迹划分为等长段落并组合其值来更新完整轨迹值,理论上可将Bellman递归次数从线性降至对数级别,且无需手动调优n步超参数。研究团队首次成功将分而治之值学习扩展至目标条件强化学习等复杂任务。
Berkeley AI ResearchAI 评分5858 Berkeley 研究揭示 word2vec 学习的理论机制:学习过程等价于 PCA
Berkeley AI Research 发布新论文,提供了 word2vec 学习过程的完整理论分析。研究证明在特定实际条件下,word2vec 学习问题可简化为无加权最小二乘矩阵分解,最终学习到的表示就是 PCA。
Mistral AI精选AI 评分7070 Mistral AI 发布首个 AI 模型全生命周期环境研究报告
Mistral AI 联合 Carbone 4 和 ADEME 完成了业内首个 AI 模型全生命周期分析(LCA),量化了大语言模型的环境影响。
推荐理由:原文给出了具体的环境影响数据和方法论框架,读者可以据此了解如何量化 AI 系统的环境成本。