#推理
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#推理
今日 2 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Google Research精选AI 评分6363 Google 展示强化学习框架实现量子计算持续校准
Google 在 Nature 发表研究,展示了一个强化学习框架,让智能体通过量子误差检测事件持续调整数千个控制参数,从而在计算过程中稳定量子系统。实验在 Willow 超导处理器上验证,人工注入漂移后 RL steering 将逻辑稳定性提升 3.5 倍;在专家校准后 RL 微调仍额外降低 20% 逻辑错误率。
推荐理由:给出了具体的性能提升数据(3.5 倍逻辑稳定性提升、20% 错误率下降)和两种量子码的错误率数字,读者可以直接判断该 RL 方法相比传统校准的改进幅度。
Google ResearchAI 评分2424 扩散模型的创造力从何而来:分数平滑的理论解释
Google Research 在 ICLR 2026 发表的论文揭示,扩散模型的创造力源于神经网络训练中的"分数平滑"效应。由于权重衰减等正则化手段,模型学习到的分数函数呈近似而非精确状态,导致去噪过程生成的数据会在训练点之间插值,从而产生新的合理样本,而非简单复制训练数据。研究通过 1-D 实验结合函数空间理论验证了这一机制。
Hugging Face BlogAI 评分5858 IBM Research 分析模型路由的三大误区:成本、难度和延迟远比表面复杂
IBM Research 基于 AppWorld 挑战赛和 CodeAct 智能体的实际测试,揭示了模型路由的三个反直觉发现:缓存使实际成本与定价脱钩;任务难度在路由时常不可见且只是多目标之一;模型速度不等于用户体验速度。他们将路由从分类问题重新建模为系统优化问题,实现了在 84% 准确率下 21% 成本降低和 9% 延迟降低。
Hugging Face Blog精选AI 评分8080 Thinking Machines 发布 Inkling 大模型:1T 参数、1M 上下文、支持图像/音频/文本多模态输入
Thinking Machines 发布开源多模态大模型 Inkling,参数总量 975B、激活 41B,支持图像、音频、文本三种模态输入,拥有 1M 上下文窗口,训练数据达 45T token。
推荐理由:原文给出了完整的架构说明、基准测试对比和部署配置,读者可以据此判断该模型在多模态推理任务上的相对表现以及自身硬件能否部署。
Hugging Face BlogAI 评分3333 PyTorch Profiling 教程(三):如何分析注意力机制性能
本教程演示如何使用 PyTorch profiler 分析 Transformer 架构中的注意力机制,展示了 naive attention 的 5 个核心 kernel:matmul、mul(缩放)、masked_fill、softmax 和 matmul。
Mistral AIAI 评分5656 Mistral 发布 Robostral Navigate:8B 机器人导航模型
Mistral 发布 Robostral Navigate,这是一款 8B 参数的机器人导航模型,仅使用单目 RGB 相机即可在复杂环境中自主导航,在 R2R-CE 基准测试的未见环境上达到 76.6% 成功率,优于多传感器方案 4.5 个百分点。模型结合指向式导航和强化学习,使用前缀缓存技术将训练 token 减少 22 倍,可适配轮式、足式和飞行机器人。
Hugging Face Blog精选AI 评分7272 vLLM transformers 建模后端性能追平甚至超越原生实现
vLLM 的 transformers 建模后端现已与自定义原生实现速度相当或更快,支持 Qwen3-4B 单卡、Qwen3-32B 张量并行、Qwen3-235B-A22B-FP8 MoE 数据+专家并行三种配置。
推荐理由:提供了三种不同规模 Qwen3 模型的基准对比数据,读者可以据此判断该更新对自己模型推理场景的实际价值。
Berkeley AI ResearchAI 评分3030 智能即将免费,数据系统如何迎接智能体时代
随着 AI 推理成本在过去两年下降 9x-900x(GPT-4 级能力从 $30/百万 token 降至 <$1),知识工作所需的智能正变得几乎免费。文章探讨这一变革对数据系统的三重影响:为智能体服务的数据系统(支持批量查询和高并发智能体探索)、由智能体管理的数据系统(协调数千智能体协作)、以及由智能体构建的数据系统(自动合成定制化数据系统)。
Import AIAI 评分4646 Import AI 464: Fable 编写 GPU kernel 18.71 倍加速;AI 自动化在线自由职业项目成功率升至 16.1%
Fable 在 RTX PRO 6000 Blackwell 上编写了首个真正的 megakernel,实现 18.71 倍加速,超越 Claude Opus 4.8(14.4X)和 GLM-5.2(11.14X),成为 KernelBench-Mega 有史以来最快方案。
Mistral AI精选AI 评分6565 Mistral AI 发布 Leanstral 1.5:面向所有人的形式化验证模型
Mistral AI 发布 Leanstral 1.5,一个拥有 6B 活跃参数的 Apache-2.0 开源形式化验证模型。该模型在 miniF2F 上达到 100%,在 PutnamBench 上解决 587/672 道题目,在 FATE-H 上达到 87%、FATE-X 上达到 34%,均为 SOTA。
推荐理由:原文给出了具体 benchmark 数字和 bug 发现案例,读者可据此评估该模型在形式化验证领域的能力和实用价值。
Hugging Face BlogAI 评分1919 为什么专业化对于 AI 是不可避免的
优化理论、进化生物学和竞争市场共同预测专业化是AI系统的必然选择。Goldfeder、Wyder、LeCun和Shwartz-Ziv的2026年论文引用Wolpert与Macready 1997年的定理证明,没有通用优化算法能在所有问题上胜出,资源有限时集中能力必然优于分散能力。该论文指出“通用性是理论概念,实际中是神话”,生物学和市场竞争同样通过选择机制淘汰无法在特定领域达到性能门槛的实体。
Google Research精选AI 评分6868 Google 通过冻结多Token预测加速 Pixel 设备上的 Gemini Nano 模型
Google 宣布将 Multi-Token Prediction (MTP) 架构应用于现有的冻结 Gemini Nano v3 模型,在 Pixel 9/10 系列上实现 50% 以上加速。
推荐理由:原文给出了具体的技术架构细节、性能数据(50%+加速、130MB内存节省)和在 Pixel 设备上的实测效果,读者可以据此了解移动端推理优化的具体方法。
Google ResearchAI 评分4949 推理如何解锁大语言模型中的参数化知识
Google Research在COLM 2026发表的研究发现,启用推理(CoT)能显著提升R-LLMs在简单一次性问题上的准确率,即使问题无需分步推理。通过Gemini-2.5(Flash和Pro)及Qwen3-32B在SimpleQA Verified和EntityQuestions上的实验,证明推理开启后模型能recall关闭时几乎无法获取的答案。
Import AIAI 评分3838 Import AI 462:超级说服力;自维持AI;通往ASI之路
牛津大学、英国AI安全研究所、斯坦福大学、伦敦政治经济学院联合研究显示,AI系统在基于文本的政策说服和慈善筹款任务中已超越人类专家。在涉及18,978场对话、6,923人的四项实验中,Opus 4.1和Opus 4.6是最强说服者,GPT-4o、GPT-5.4、Gemini 2.5 Pro、Grok 4.20等模型也表现出色。
Google DeepMind精选AI 评分8080 Google DeepMind 发布 DiffusionGemma:文本生成速度提升 4 倍
Google DeepMind 发布 DiffusionGemma 实验模型,这是一款 26B MoE 开源模型(Apache 2.0 许可证),通过文本扩散技术实现并行生成而非传统自回归的逐 token 生成,在 NVIDIA H100 上可达 1000+ tokens/s,RTX 5090 上 700+ tokens/s,比标准 Gemma 4 快 4 倍。
推荐理由:原文给出了性能对比数据和方法差异,读者可以据此判断 diffusion 文本生成是否适合自己的应用场景。
Google DeepMind精选AI 评分7575 Google DeepMind 发布 Gemma 4 12B:统一 encoder-free 多模态模型
Google DeepMind 发布 Gemma 4 12B,采用无编码器架构将视觉和音频输入直接整合到 LLM 主干,支持原生音频输入。性能接近更大的 26B MoE 模型,可在 16GB VRAM 的笔记本电脑上本地运行,已获 150 万次下载,发布于 Apache 2.0 许可证。
推荐理由:原文给出了架构变化(encoder-free)、性能对比(接近 26B MoE)、内存要求(16GB VRAM)和原生音频输入等具体信息,读者可以据此评估它与其他 Gemma 模型的定位差异。
Import AIAI 评分3636 Import AI 458:直面未来;以及一个关于奇点的故事
本文为作者在牛津大学HAI Lab的2026年Cosmos讲座演讲稿,探讨AI作为技术的成功对个人和社会的深远影响,呼吁"探索未来而非逃避现在"。演讲回顾了2023年至2025年AI的快速进展:AI通过律师考试、国际数学奥林匹克获银牌(2024年)再到金牌(2025年),并共同创作数学证明,指出AI已超越大多数个体的能力,正走向超越全体人类的未来。
Google DeepMind精选AI 评分6969 Google DeepMind 发布 Gemini for Science:三个科学实验工具和 Science Skills
Google DeepMind 推出 Gemini for Science 套件,包含三个实验工具:Hypothesis Generation(基于 Co-Scientist。
推荐理由:Google 一次性推出三个科学实验工具和 Science Skills,给出了明确的实验阶段和合作机构,读者可以判断这些工具对其研究流程的实际价值。
Google DeepMindAI 评分3939 Calico Life Sciences 如何用 Co-Scientist 开辟衰老研究新路径
Calico Life Sciences 的 AI/ML 负责人 Matt Onsum 和首席科学家 Katherine Labbé使用 Co-Scientist 连接分散的衰老生物学发现,将其转化为可检验的假设。Co-Scientist 帮助生成了关于整合应激反应(ISR)如何被代谢调控的假设,实验产生了对 ISR 在健康与疾病中作用具有重要意义的新发现,团队计划发表结果。
Google DeepMindAI 评分5353 Google DeepMind WeatherNext 如何帮助国家飓风中心预测飓风 Melissa 在牙买加的历史性登陆
Google DeepMind 的 AI 天气模型 WeatherNext 成功预测了 2025 年 10 月飓风 Melissa 将以五级强度登陆牙买加,这是首次从一级风速成功预测达到五级强度。
Berkeley AI ResearchAI 评分3232 自适应并行推理:高效推理扩展的新范式
大语言模型推理过程中,顺序推理面临上下文膨胀、延迟增加和context-rot等问题,自适应并行推理允许模型自主决定何时分解任务、生成多少并发线程及如何协调。基于对现有并行推理方法的分析,文章指出固定并行结构的局限性,并探讨模型自适应控制的发展方向。
Import AIAI 评分5252 AI系统或将在2028年前实现自动化研发
Jack Clark分析认为,基于SWEBench、METR、CORE-Bench等多项benchmark的进展数据,AI系统已能在数小时内独立完成复杂编码任务,并逐步掌握核心AI研发技能如复现论文、构建ML系统、优化kernel等。他预计到2028年底有60%概率实现无人类参与的AI R&D,届时AI系统可能自主训练其后继模型。文章还讨论了自动化研发对AI对齐、经济结构和人类社会的深远影响。
Google ResearchAI 评分5454 Google Research 发布 ERA 在流行病学、宇宙学、气候科学和神经科学领域的应用案例
Google 展示了 Empirical Research Assistance 工具的四个应用场景:流行病学预测(流感、COVID-19、RSV 住院率预测在 CDC 排行榜上名列前茅)。
Google Research精选AI 评分6464 ReasoningBank:让智能体从经验中学习
Google Research 发布 ReasoningBank 框架,使大语言模型能在测试时从成功和失败的经验中自我进化。该框架将推理模式提炼为高层记忆存储,在 WebArena 和 SWE-Bench Verified 上相比无记忆智能体分别提升 8.3% 和 4.6% 成功率,并结合 MaTTS 扩展方法进一步提升 3% 成功率。
推荐理由:论文给出了在 WebArena 和 SWE-bench 上相对于 baseline 的具体提升幅度(8.3%、4.6%、3%),并开源了代码,读者可据此判断该方法对智能体记忆机制研究的参考价值。
Google ResearchAI 评分5252 Google Research 发布 Simula:通过机制设计实现推理驱动的合成数据生成
Google Research 在 TMLR 发表论文,介绍 Simula 框架——一个基于推理优先的合成数据生成系统。该框架将数据生成过程分解为全局多样性、本地多样性、复杂化和质量检查四个可控维度,支持 seedless 和 agentic 方式生成数据。
Google DeepMind精选AI 评分7070 Google DeepMind 发布 Gemini Robotics-ER 1.6:增强实体推理赋能机器人任务
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其首个推理优先模型的重大升级版。该模型增强了空间推理和多视角理解能力,专门用于视觉与空间理解、任务规划和成功检测,并能原生调用工具如 Google Search、视觉语言动作模型或第三方函数。
推荐理由:原文给出了具体性能对比和新增的仪表读取功能,读者可以据此判断该模型在机器人实体推理场景中的具体提升和可用性。
Google ResearchAI 评分4040 ConvApparel:衡量并缩小用户模拟器中的真实感差距
Google Research推出ConvApparel数据集,包含超4000段人类-AI多轮对话(共近15000轮),在服装购物领域采用双智能体协议收集数据。该数据集通过人口级统计对齐、人类相似度评分、反事实验证三种评估维度,衡量当前LLM用户模拟器与真实人类行为的显著差距,为构建更可信的AI测试工具提供路径。
Google DeepMind精选AI 评分7878 Google DeepMind 发布 Gemma 4:字面意义上最强大的开源模型
Google DeepMind 正式发布 Gemma 4 系列开源模型,提供 E2B、E4B、26B MoE 和 31B Dense 四种规格。31B 版本在 Arena AI 文本排行榜位列第三,26B 排名第六,均超越参数量 20 倍于自身的模型。
推荐理由:原文给出了四个版本的具体定位和性能数据,读者可以据此判断 Gemma 4 是否适合自己的硬件条件和使用场景。
Mistral AI精选AI 评分7878 Mistral Small 4 发布:首个统一推理、指令和多模态能力的开源混合模型
Mistral 发布新模型 Mistral Small 4,这是首个统一推理(Magistral)、指令(Mistral Small)和多模态(Pixtral)能力的开源混合模型。
推荐理由:Mistral Small 4 首次将推理、指令、多模态能力统一在单一模型中,支持可配置的 reasoning_effort 参数,在基准测试中保持竞争力分数的同时输出更短,延迟降低 40%、吞吐量提升 3 倍。
Google ResearchAI 评分5555 Google 测试大语言模型在高温超导研究问题上的表现
Google Research 与 Cornell 大学合作,评估了六款大语言模型在高温超导领域回答专家级问题的能力。测试问题由领域专家设计,涵盖67道深度专业问题。NotebookLM 和自定义 RAG 系统基于专家筛选的文献库表现最佳,而依赖开放网络的模型倾向于混淆已确立理论与高度推测性假说。模型在时序理解、上下文理解和图像推理方面存在明显弱点。
Berkeley AI ResearchAI 评分4646 SPEX and ProxySPEX 如何在大规模语言模型中识别关键交互
Berkeley AI Research 提出 SPEX(Spectral Explainer)和后续算法 ProxySPEX,利用信号处理与编码理论将交互发现规模提升数个数量级。
Mistral AIAI 评分5454 Mistral AI 调查 vLLM 内存泄漏:从 Python 分析到内核追踪的完整调试过程
Mistral AI 团队在部署 Mistral Medium 3.1 模型的 P/D disaggregated serving 时发现每分钟增长 400MB 的内存泄漏。
Berkeley AI ResearchAI 评分4949 强化学习新范式:分而治之算法如何突破长程任务扩展性难题
本文提出一种基于“分而治之”的强化学习新算法,突破传统时序差分(TD)学习的扩展性瓶颈。该方法将轨迹划分为等长段落并组合其值来更新完整轨迹值,理论上可将Bellman递归次数从线性降至对数级别,且无需手动调优n步超参数。研究团队首次成功将分而治之值学习扩展至目标条件强化学习等复杂任务。
Mistral AIAI 评分4545 如何通过微调将 Pixtral-12B 应用于卫星图像任务
Mistral 通过 LoRA Fine-Tuning 技术微调 Pixtral-12B 视觉语言模型,在 Aerial Image Dataset 卫星图像分类任务上显著提升性能,尤其解决了基础模型在 "Playground" 与 "Stadium" 等易混淆类别上的分类难题。
Mistral AI精选AI 评分6868 Le Chat 深度更新:新增深度研究、语音模式、项目管理等功能
Mistral AI 为 Le Chat 推出多项新功能:Deep Research(预览版)可生成结构化研究报告;Voice mode 由新的 Voxtral 语音输入模型驱动。
推荐理由:原文给出了 Le Chat 的具体功能变化和入口,读者可据此判断它会怎样改变现有工作流。
Mistral AI精选AI 评分7272 Mistral AI 发布首款推理模型 Magistral
Mistral AI 发布首款推理模型 Magistral,提供开源版 Small(24B 参数)和企业版 Medium 两个版本。Magistral Medium 在 AIME2024 得分 73.6%( majority voting @64 达 90%),Small 版本得分 70.7%。
推荐理由:给出了 AIME2024 基准测试的具体分数(73.6%/70.7%)和速度对比(10x),读者可据此评估该推理模型在同类中的相对性能。
Mistral AI精选AI 评分7777 Mistral Small 3.1 发布
Mistral AI 发布 Mistral Small 3.1,号称同类最佳模型。新模型在文本性能和多模态理解上有所提升,上下文窗口扩展至 128k token,推理速度达 150 tokens/s,优于 Gemma 3 和 GPT-4o Mini。模型基于 Apache 2.0 许可证开源,可在单张 RTX 4090 或 32GB RAM Mac 上运行。
推荐理由:原文给出了性能对比和推理速度数据,读者可以据此判断它在同类模型中的竞争力。
Cursor Blog精选AI 评分6060 Cursor 技术博客:Llama-2-70B 推理特性分析
Cursor 分析了 Llama-2-70B 自托管推理的成本和延迟。实验表明,在 prompt 场景下 Llama 比 GPT-3.5 便宜约 3-4 倍($0.00042 vs $0.0015/1K tokens),但在 completion 场景下成本高达 $0.066/1K tokens,远高于 GPT-3.5。
推荐理由:原文给出了 Llama-2-70B 与 GPT-3.5 在成本和延迟上的详细对比实验数据,读者可据此判断自托管与 API 调用的取舍。