跳到正文

#推理

今日 2 条

工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
7月23日周四
  1. Google Research63

    Google 展示强化学习框架实现量子计算持续校准

    Google 在 Nature 发表研究,展示了一个强化学习框架,让智能体通过量子误差检测事件持续调整数千个控制参数,从而在计算过程中稳定量子系统。实验在 Willow 超导处理器上验证,人工注入漂移后 RL steering 将逻辑稳定性提升 3.5 倍;在专家校准后 RL 微调仍额外降低 20% 逻辑错误率。

    推荐理由:给出了具体的性能提升数据(3.5 倍逻辑稳定性提升、20% 错误率下降)和两种量子码的错误率数字,读者可以直接判断该 RL 方法相比传统校准的改进幅度。

7月16日周四
  1. Google Research24

    扩散模型的创造力从何而来:分数平滑的理论解释

    Google Research 在 ICLR 2026 发表的论文揭示,扩散模型的创造力源于神经网络训练中的"分数平滑"效应。由于权重衰减等正则化手段,模型学习到的分数函数呈近似而非精确状态,导致去噪过程生成的数据会在训练点之间插值,从而产生新的合理样本,而非简单复制训练数据。研究通过 1-D 实验结合函数空间理论验证了这一机制。

  2. Hugging Face Blog58

    IBM Research 分析模型路由的三大误区:成本、难度和延迟远比表面复杂

    IBM Research 基于 AppWorld 挑战赛和 CodeAct 智能体的实际测试,揭示了模型路由的三个反直觉发现:缓存使实际成本与定价脱钩;任务难度在路由时常不可见且只是多目标之一;模型速度不等于用户体验速度。他们将路由从分类问题重新建模为系统优化问题,实现了在 84% 准确率下 21% 成本降低和 9% 延迟降低。

7月15日周三
  1. Hugging Face Blog80

    Thinking Machines 发布 Inkling 大模型:1T 参数、1M 上下文、支持图像/音频/文本多模态输入

    Thinking Machines 发布开源多模态大模型 Inkling,参数总量 975B、激活 41B,支持图像、音频、文本三种模态输入,拥有 1M 上下文窗口,训练数据达 45T token。

    推荐理由:原文给出了完整的架构说明、基准测试对比和部署配置,读者可以据此判断该模型在多模态推理任务上的相对表现以及自身硬件能否部署。

7月10日周五
7月8日周三
  1. Mistral AI56

    Mistral 发布 Robostral Navigate:8B 机器人导航模型

    Mistral 发布 Robostral Navigate,这是一款 8B 参数的机器人导航模型,仅使用单目 RGB 相机即可在复杂环境中自主导航,在 R2R-CE 基准测试的未见环境上达到 76.6% 成功率,优于多传感器方案 4.5 个百分点。模型结合指向式导航和强化学习,使用前缀缓存技术将训练 token 减少 22 倍,可适配轮式、足式和飞行机器人。

7月7日周二
  1. Berkeley AI Research30

    智能即将免费,数据系统如何迎接智能体时代

    随着 AI 推理成本在过去两年下降 9x-900x(GPT-4 级能力从 $30/百万 token 降至 <$1),知识工作所需的智能正变得几乎免费。文章探讨这一变革对数据系统的三重影响:为智能体服务的数据系统(支持批量查询和高并发智能体探索)、由智能体管理的数据系统(协调数千智能体协作)、以及由智能体构建的数据系统(自动合成定制化数据系统)。

7月6日周一
7月2日周四
  1. Mistral AI65

    Mistral AI 发布 Leanstral 1.5:面向所有人的形式化验证模型

    Mistral AI 发布 Leanstral 1.5,一个拥有 6B 活跃参数的 Apache-2.0 开源形式化验证模型。该模型在 miniF2F 上达到 100%,在 PutnamBench 上解决 587/672 道题目,在 FATE-H 上达到 87%、FATE-X 上达到 34%,均为 SOTA。

    推荐理由:原文给出了具体 benchmark 数字和 bug 发现案例,读者可据此评估该模型在形式化验证领域的能力和实用价值。

6月30日周二
  1. Hugging Face Blog19

    为什么专业化对于 AI 是不可避免的

    优化理论、进化生物学和竞争市场共同预测专业化是AI系统的必然选择。Goldfeder、Wyder、LeCun和Shwartz-Ziv的2026年论文引用Wolpert与Macready 1997年的定理证明,没有通用优化算法能在所有问题上胜出,资源有限时集中能力必然优于分散能力。该论文指出“通用性是理论概念,实际中是神话”,生物学和市场竞争同样通过选择机制淘汰无法在特定领域达到性能门槛的实体。

6月27日周六
  1. Google Research68

    Google 通过冻结多Token预测加速 Pixel 设备上的 Gemini Nano 模型

    Google 宣布将 Multi-Token Prediction (MTP) 架构应用于现有的冻结 Gemini Nano v3 模型,在 Pixel 9/10 系列上实现 50% 以上加速。

    推荐理由:原文给出了具体的技术架构细节、性能数据(50%+加速、130MB内存节省)和在 Pixel 设备上的实测效果,读者可以据此了解移动端推理优化的具体方法。

6月25日周四
  1. Google Research49

    推理如何解锁大语言模型中的参数化知识

    Google Research在COLM 2026发表的研究发现,启用推理(CoT)能显著提升R-LLMs在简单一次性问题上的准确率,即使问题无需分步推理。通过Gemini-2.5(Flash和Pro)及Qwen3-32B在SimpleQA Verified和EntityQuestions上的实验,证明推理开启后模型能recall关闭时几乎无法获取的答案。

6月22日周一
6月11日周四
  1. Google DeepMind80

    Google DeepMind 发布 DiffusionGemma:文本生成速度提升 4 倍

    Google DeepMind 发布 DiffusionGemma 实验模型,这是一款 26B MoE 开源模型(Apache 2.0 许可证),通过文本扩散技术实现并行生成而非传统自回归的逐 token 生成,在 NVIDIA H100 上可达 1000+ tokens/s,RTX 5090 上 700+ tokens/s,比标准 Gemma 4 快 4 倍。

    推荐理由:原文给出了性能对比数据和方法差异,读者可以据此判断 diffusion 文本生成是否适合自己的应用场景。

6月9日周二
  1. Google DeepMind75

    Google DeepMind 发布 Gemma 4 12B:统一 encoder-free 多模态模型

    Google DeepMind 发布 Gemma 4 12B,采用无编码器架构将视觉和音频输入直接整合到 LLM 主干,支持原生音频输入。性能接近更大的 26B MoE 模型,可在 16GB VRAM 的笔记本电脑上本地运行,已获 150 万次下载,发布于 Apache 2.0 许可证。

    推荐理由:原文给出了架构变化(encoder-free)、性能对比(接近 26B MoE)、内存要求(16GB VRAM)和原生音频输入等具体信息,读者可以据此评估它与其他 Gemma 模型的定位差异。

5月26日周二
  1. Import AI36

    Import AI 458:直面未来;以及一个关于奇点的故事

    本文为作者在牛津大学HAI Lab的2026年Cosmos讲座演讲稿,探讨AI作为技术的成功对个人和社会的深远影响,呼吁"探索未来而非逃避现在"。演讲回顾了2023年至2025年AI的快速进展:AI通过律师考试、国际数学奥林匹克获银牌(2024年)再到金牌(2025年),并共同创作数学证明,指出AI已超越大多数个体的能力,正走向超越全体人类的未来。

5月17日周日
5月16日周六
  1. Google DeepMind39

    Calico Life Sciences 如何用 Co-Scientist 开辟衰老研究新路径

    Calico Life Sciences 的 AI/ML 负责人 Matt Onsum 和首席科学家 Katherine Labbé使用 Co-Scientist 连接分散的衰老生物学发现,将其转化为可检验的假设。Co-Scientist 帮助生成了关于整合应激反应(ISR)如何被代谢调控的假设,实验产生了对 ISR 在健康与疾病中作用具有重要意义的新发现,团队计划发表结果。

5月8日周五
  1. Berkeley AI Research32

    自适应并行推理:高效推理扩展的新范式

    大语言模型推理过程中,顺序推理面临上下文膨胀、延迟增加和context-rot等问题,自适应并行推理允许模型自主决定何时分解任务、生成多少并发线程及如何协调。基于对现有并行推理方法的分析,文章指出固定并行结构的局限性,并探讨模型自适应控制的发展方向。

5月4日周一
  1. Import AI52

    AI系统或将在2028年前实现自动化研发

    Jack Clark分析认为,基于SWEBench、METR、CORE-Bench等多项benchmark的进展数据,AI系统已能在数小时内独立完成复杂编码任务,并逐步掌握核心AI研发技能如复现论文、构建ML系统、优化kernel等。他预计到2028年底有60%概率实现无人类参与的AI R&D,届时AI系统可能自主训练其后继模型。文章还讨论了自动化研发对AI对齐、经济结构和人类社会的深远影响。

4月30日周四
4月22日周三
  1. Google Research64

    ReasoningBank:让智能体从经验中学习

    Google Research 发布 ReasoningBank 框架,使大语言模型能在测试时从成功和失败的经验中自我进化。该框架将推理模式提炼为高层记忆存储,在 WebArena 和 SWE-Bench Verified 上相比无记忆智能体分别提升 8.3% 和 4.6% 成功率,并结合 MaTTS 扩展方法进一步提升 3% 成功率。

    推荐理由:论文给出了在 WebArena 和 SWE-bench 上相对于 baseline 的具体提升幅度(8.3%、4.6%、3%),并开源了代码,读者可据此判断该方法对智能体记忆机制研究的参考价值。

4月16日周四
4月13日周一
  1. Google DeepMind70

    Google DeepMind 发布 Gemini Robotics-ER 1.6:增强实体推理赋能机器人任务

    Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其首个推理优先模型的重大升级版。该模型增强了空间推理和多视角理解能力,专门用于视觉与空间理解、任务规划和成功检测,并能原生调用工具如 Google Search、视觉语言动作模型或第三方函数。

    推荐理由:原文给出了具体性能对比和新增的仪表读取功能,读者可以据此判断该模型在机器人实体推理场景中的具体提升和可用性。

4月9日周四
  1. Google Research40

    ConvApparel:衡量并缩小用户模拟器中的真实感差距

    Google Research推出ConvApparel数据集,包含超4000段人类-AI多轮对话(共近15000轮),在服装购物领域采用双智能体协议收集数据。该数据集通过人口级统计对齐、人类相似度评分、反事实验证三种评估维度,衡量当前LLM用户模拟器与真实人类行为的显著差距,为构建更可信的AI测试工具提供路径。

4月3日周五
  1. Google DeepMind78

    Google DeepMind 发布 Gemma 4:字面意义上最强大的开源模型

    Google DeepMind 正式发布 Gemma 4 系列开源模型,提供 E2B、E4B、26B MoE 和 31B Dense 四种规格。31B 版本在 Arena AI 文本排行榜位列第三,26B 排名第六,均超越参数量 20 倍于自身的模型。

    推荐理由:原文给出了四个版本的具体定位和性能数据,读者可以据此判断 Gemma 4 是否适合自己的硬件条件和使用场景。

3月17日周二
  1. Mistral AI78

    Mistral Small 4 发布:首个统一推理、指令和多模态能力的开源混合模型

    Mistral 发布新模型 Mistral Small 4,这是首个统一推理(Magistral)、指令(Mistral Small)和多模态(Pixtral)能力的开源混合模型。

    推荐理由:Mistral Small 4 首次将推理、指令、多模态能力统一在单一模型中,支持可配置的 reasoning_effort 参数,在基准测试中保持竞争力分数的同时输出更短,延迟降低 40%、吞吐量提升 3 倍。

  2. Google Research55

    Google 测试大语言模型在高温超导研究问题上的表现

    Google Research 与 Cornell 大学合作,评估了六款大语言模型在高温超导领域回答专家级问题的能力。测试问题由领域专家设计,涵盖67道深度专业问题。NotebookLM 和自定义 RAG 系统基于专家筛选的文献库表现最佳,而依赖开放网络的模型倾向于混淆已确立理论与高度推测性假说。模型在时序理解、上下文理解和图像推理方面存在明显弱点。

3月13日周五
1月22日周四
11月1日周六
  1. Berkeley AI Research49

    强化学习新范式:分而治之算法如何突破长程任务扩展性难题

    本文提出一种基于“分而治之”的强化学习新算法,突破传统时序差分(TD)学习的扩展性瓶颈。该方法将轨迹划分为等长段落并组合其值来更新完整轨迹值,理论上可将Bellman递归次数从线性降至对数级别,且无需手动调优n步超参数。研究团队首次成功将分而治之值学习扩展至目标条件强化学习等复杂任务。

8月1日周五
7月17日周四
6月10日周二
  1. Mistral AI72

    Mistral AI 发布首款推理模型 Magistral

    Mistral AI 发布首款推理模型 Magistral,提供开源版 Small(24B 参数)和企业版 Medium 两个版本。Magistral Medium 在 AIME2024 得分 73.6%( majority voting @64 达 90%),Small 版本得分 70.7%。

    推荐理由:给出了 AIME2024 基准测试的具体分数(73.6%/70.7%)和速度对比(10x),读者可据此评估该推理模型在同类中的相对性能。

3月17日周一
  1. Mistral AI77

    Mistral Small 3.1 发布

    Mistral AI 发布 Mistral Small 3.1,号称同类最佳模型。新模型在文本性能和多模态理解上有所提升,上下文窗口扩展至 128k token,推理速度达 150 tokens/s,优于 Gemma 3 和 GPT-4o Mini。模型基于 Apache 2.0 许可证开源,可在单张 RTX 4090 或 32GB RAM Mac 上运行。

    推荐理由:原文给出了性能对比和推理速度数据,读者可以据此判断它在同类模型中的竞争力。

7月20日周四
  1. Cursor Blog60

    Cursor 技术博客:Llama-2-70B 推理特性分析

    Cursor 分析了 Llama-2-70B 自托管推理的成本和延迟。实验表明,在 prompt 场景下 Llama 比 GPT-3.5 便宜约 3-4 倍($0.00042 vs $0.0015/1K tokens),但在 completion 场景下成本高达 $0.066/1K tokens,远高于 GPT-3.5。

    推荐理由:原文给出了 Llama-2-70B 与 GPT-3.5 在成本和延迟上的详细对比实验数据,读者可据此判断自托管与 API 调用的取舍。