跳到正文

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 41–55 条 · 共 55 条
7月15日周三
  1. Hugging Face Blog80

    Thinking Machines 发布 Inkling 大模型:1T 参数、1M 上下文、支持图像/音频/文本多模态输入

    Thinking Machines 发布开源多模态大模型 Inkling,参数总量 975B、激活 41B,支持图像、音频、文本三种模态输入,拥有 1M 上下文窗口,训练数据达 45T token。

    推荐理由:原文给出了完整的架构说明、基准测试对比和部署配置,读者可以据此判断该模型在多模态推理任务上的相对表现以及自身硬件能否部署。

7月8日周三
7月2日周四
  1. Mistral AI65

    Mistral AI 发布 Leanstral 1.5:面向所有人的形式化验证模型

    Mistral AI 发布 Leanstral 1.5,一个拥有 6B 活跃参数的 Apache-2.0 开源形式化验证模型。该模型在 miniF2F 上达到 100%,在 PutnamBench 上解决 587/672 道题目,在 FATE-H 上达到 87%、FATE-X 上达到 34%,均为 SOTA。

    推荐理由:原文给出了具体 benchmark 数字和 bug 发现案例,读者可据此评估该模型在形式化验证领域的能力和实用价值。

6月27日周六
  1. Google Research68

    Google 通过冻结多Token预测加速 Pixel 设备上的 Gemini Nano 模型

    Google 宣布将 Multi-Token Prediction (MTP) 架构应用于现有的冻结 Gemini Nano v3 模型,在 Pixel 9/10 系列上实现 50% 以上加速。

    推荐理由:原文给出了具体的技术架构细节、性能数据(50%+加速、130MB内存节省)和在 Pixel 设备上的实测效果,读者可以据此了解移动端推理优化的具体方法。

6月11日周四
  1. Google DeepMind80

    Google DeepMind 发布 DiffusionGemma:文本生成速度提升 4 倍

    Google DeepMind 发布 DiffusionGemma 实验模型,这是一款 26B MoE 开源模型(Apache 2.0 许可证),通过文本扩散技术实现并行生成而非传统自回归的逐 token 生成,在 NVIDIA H100 上可达 1000+ tokens/s,RTX 5090 上 700+ tokens/s,比标准 Gemma 4 快 4 倍。

    推荐理由:原文给出了性能对比数据和方法差异,读者可以据此判断 diffusion 文本生成是否适合自己的应用场景。

6月9日周二
  1. Google DeepMind75

    Google DeepMind 发布 Gemma 4 12B:统一 encoder-free 多模态模型

    Google DeepMind 发布 Gemma 4 12B,采用无编码器架构将视觉和音频输入直接整合到 LLM 主干,支持原生音频输入。性能接近更大的 26B MoE 模型,可在 16GB VRAM 的笔记本电脑上本地运行,已获 150 万次下载,发布于 Apache 2.0 许可证。

    推荐理由:原文给出了架构变化(encoder-free)、性能对比(接近 26B MoE)、内存要求(16GB VRAM)和原生音频输入等具体信息,读者可以据此评估它与其他 Gemma 模型的定位差异。

5月17日周日
4月22日周三
  1. Google Research64

    ReasoningBank:让智能体从经验中学习

    Google Research 发布 ReasoningBank 框架,使大语言模型能在测试时从成功和失败的经验中自我进化。该框架将推理模式提炼为高层记忆存储,在 WebArena 和 SWE-Bench Verified 上相比无记忆智能体分别提升 8.3% 和 4.6% 成功率,并结合 MaTTS 扩展方法进一步提升 3% 成功率。

    推荐理由:论文给出了在 WebArena 和 SWE-bench 上相对于 baseline 的具体提升幅度(8.3%、4.6%、3%),并开源了代码,读者可据此判断该方法对智能体记忆机制研究的参考价值。

4月13日周一
  1. Google DeepMind70

    Google DeepMind 发布 Gemini Robotics-ER 1.6:增强实体推理赋能机器人任务

    Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其首个推理优先模型的重大升级版。该模型增强了空间推理和多视角理解能力,专门用于视觉与空间理解、任务规划和成功检测,并能原生调用工具如 Google Search、视觉语言动作模型或第三方函数。

    推荐理由:原文给出了具体性能对比和新增的仪表读取功能,读者可以据此判断该模型在机器人实体推理场景中的具体提升和可用性。

4月3日周五
  1. Google DeepMind78

    Google DeepMind 发布 Gemma 4:字面意义上最强大的开源模型

    Google DeepMind 正式发布 Gemma 4 系列开源模型,提供 E2B、E4B、26B MoE 和 31B Dense 四种规格。31B 版本在 Arena AI 文本排行榜位列第三,26B 排名第六,均超越参数量 20 倍于自身的模型。

    推荐理由:原文给出了四个版本的具体定位和性能数据,读者可以据此判断 Gemma 4 是否适合自己的硬件条件和使用场景。

3月17日周二
  1. Mistral AI78

    Mistral Small 4 发布:首个统一推理、指令和多模态能力的开源混合模型

    Mistral 发布新模型 Mistral Small 4,这是首个统一推理(Magistral)、指令(Mistral Small)和多模态(Pixtral)能力的开源混合模型。

    推荐理由:Mistral Small 4 首次将推理、指令、多模态能力统一在单一模型中,支持可配置的 reasoning_effort 参数,在基准测试中保持竞争力分数的同时输出更短,延迟降低 40%、吞吐量提升 3 倍。

7月17日周四
6月10日周二
  1. Mistral AI72

    Mistral AI 发布首款推理模型 Magistral

    Mistral AI 发布首款推理模型 Magistral,提供开源版 Small(24B 参数)和企业版 Medium 两个版本。Magistral Medium 在 AIME2024 得分 73.6%( majority voting @64 达 90%),Small 版本得分 70.7%。

    推荐理由:给出了 AIME2024 基准测试的具体分数(73.6%/70.7%)和速度对比(10x),读者可据此评估该推理模型在同类中的相对性能。

3月17日周一
  1. Mistral AI77

    Mistral Small 3.1 发布

    Mistral AI 发布 Mistral Small 3.1,号称同类最佳模型。新模型在文本性能和多模态理解上有所提升,上下文窗口扩展至 128k token,推理速度达 150 tokens/s,优于 Gemma 3 和 GPT-4o Mini。模型基于 Apache 2.0 许可证开源,可在单张 RTX 4090 或 32GB RAM Mac 上运行。

    推荐理由:原文给出了性能对比和推理速度数据,读者可以据此判断它在同类模型中的竞争力。

7月20日周四
  1. Cursor Blog60

    Cursor 技术博客:Llama-2-70B 推理特性分析

    Cursor 分析了 Llama-2-70B 自托管推理的成本和延迟。实验表明,在 prompt 场景下 Llama 比 GPT-3.5 便宜约 3-4 倍($0.00042 vs $0.0015/1K tokens),但在 completion 场景下成本高达 $0.066/1K tokens,远高于 GPT-3.5。

    推荐理由:原文给出了 Llama-2-70B 与 GPT-3.5 在成本和延迟上的详细对比实验数据,读者可据此判断自托管与 API 调用的取舍。