HySPE:基于辛双剪切的 positional encoding
HySPE: Positional Encoding via Symplectic Dual Shears
Zhongping Ji
中文摘要
提出 Hyperbolic Symplectic Positional Encoding(HySPE),将位置注意力建立在非紧辛变换之上。标准 Rotary Position Embedding(RoPE)通过旋转参数化 Sp(2,R) 的紧致椭圆分支,而 HySPE 利用对偶剪切(dual shear)的阻尼对称复合来操作其双曲分支,在每对通道上产生具有两个谱衰减率的共形辛收缩。为消除朴素绝对分解固有的指数表示漂移,在不变特征基中对算子进行对角化,并引入分块坐标重映射与自适应中心执行,保证与长度无关的数值界,同时前向延迟与缓存 RoPE 相当(RTX 4090 上 7.21 ms)。在 TinyShakespeare 上,HySPE-UltraLong 在 16 倍零样本外推(L=4096)下保持不随长度变化的困惑度 4.810,而 RoPE 退化至 131.198。在 WikiText-103(L_train=512)上将一个 51M 参数的子词 Transformer 扩展时,HySPE 在域内表现接近 RoPE,并稳健外推至长度 8192,尾部困惑度较 RoPE 降低 83.9%。这些受控实验确立了 HySPE 的外推鲁棒性与数值稳定性,但在大规模基础模型上评估其缩放行为仍是未来重要的研究方向。
关键要点
- 01问题:标准 RoPE 仅覆盖 Sp(2,R) 的紧致椭圆分支,缺乏对双曲非紧结构的利用,外推性能衰减显著
- 02方法:基于对偶剪切的阻尼对称复合构造共形辛收缩,在不变特征基对角化并加入分块重映射与自适应中心执行以保证数值稳定
- 03结果:RTX 4090 上前向 7.21 ms 与 RoPE 持平;TinyShakespeare 上 16 倍零样本外推困惑度保持 4.810
- 04结果:WikiText-103 上 51M 参数模型在长度 8192 时尾部困惑度较 RoPE 降低 83.9%
- 05局限:尚未在大规模基础模型上评估缩放行为
解读
尚无解读。
原始英文摘要
arXiv:2610.10154v1 Announce Type: new Abstract: We introduce Hyperbolic Symplectic Positional Encoding (HySPE), grounding positional attention in non-compact symplectic transformations. While canonical Rotary Position Embedding (RoPE) parameterizes the compact, elliptic branch of $\Sp(2,\R)$ via rotations, HySPE operationalizes its hyperbolic branch via a damped symmetric composition of dual shears, yielding a conformally symplectic contraction with two spectral decay rates per channel pair. To eliminate the exponential representation drift inherent to naive absolute factorizations, we diagonalize the operator in its invariant eigenbasis and introduce blockwise coordinate rebasing with adaptive centered execution. This guarantees length-independent numerical bounds while matching cached RoPE forward latency (7.21\,ms on an RTX 4090). On TinyShakespeare, HySPE-UltraLong maintains an invariant perplexity of 4.810 up to $16\times$ zero-shot extrapolation ($L=4096$), whereas RoPE degrades to 131.198. Scaled to a 51M-parameter subword Transformer on WikiText-103 ($L_{\text{train}}=512$), HySPE closely matches RoPE in-domain while robustly extrapolating to length 8192, reducing tail perplexity by 83.9\% over RoPE. While these controlled experiments establish HySPE's extrapolation robustness and numerical stability, evaluating its scaling behavior on large-scale foundation models remains an important direction for future investigation.
同方向论文 · cs.CL
查看全部 →EngramEdit:通过条件记忆实现大语言模型的解耦知识更新
2610.10533Prompt 应该做更多:检索指令对嵌入模型(embedding models)的影响
2610.10508PHRBench:面向大语言模型幻觉后推理(后幻觉推理)的行为评测
2610.10455CoTrace:通过 Harness-Model 协同演化训练终端 Agent 的数据配方
2610.10426使用大语言模型实现爱沙尼亚语文档级文本简化
2610.10378面向任务进度的行动学习:从紧凑教师监督中蒸馏小型智能体
2610.10332