跳到正文
热点事件观察中

Transformer、RNN 与 SSM 记忆机制对比综述

1 篇报道1 个报道来源2 天前更新

先了解这件事

AI 综述

2026 年 10 月 7 日,Reddit r/MachineLearning 上有作者从“工作记忆”视角对 RNN、Transformer 与 SSM 三类架构的记忆承载方式进行了对比。RNN 将记忆压缩为逐步传递的循环隐藏状态,其参数规模约为 O(N²),但状态仅为 O(N)。Transformer 在推理阶段冻结权重,通过不断增长的 KV cache 来保存历史键值信息,作者将其比作“便利贴”式的外部上下文。SSM(以 Mamba 为代表)则回归到定长循环状态,并借助输入依赖的机制来决定对信息的遗忘与保留。该文未给出新的实验数据,仅从机制层面对三类架构进行梳理与比较。截至目前,事件没有更新的后续报道。

AI 根据报道生成 · 2 天前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. Reddit · r/MachineLearning
    Transformer、RNN 与 SSM 的记忆机制对比:从循环状态、KV cache 到类突触连接

    作者从"工作记忆"视角比较了 RNN、Transformer 与 SSM 三类架构的记忆承载方式:RNN 将记忆压缩为逐步传递的循环隐藏状态,参数规模约 O(N²) 而状态仅 O(N);Transformer 在推理时冻结权重,以不断增长的 KV cache 保存历史键值,更像便利贴式的外部上下文;SSM(如 Mamba)回到定长循环状态,并通过输入依赖机制决定遗忘。

本事件热度走势

当前热度 3·可比范围峰值 10(10月7日 01:00)·近 24 小时可比范围变化 -50%

02.557.51010月7日01:0010月7日13:0010月8日02:0010月8日14:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。