在 RLVR 中将探索与优化解耦
Decoupling Exploration from Optimization in RLVR
Saif Punjwani · Micah Goldblum
现代语言模型在已完成训练的 checkpoint 之上,采用带可验证奖励的强化学习(RLVR)继续训练。RLVR 的一项关键潜力在于发现新的推理策略,模型原则上可以采样出其训练数据中不存在的新颖思路。然而实践中,在 RLVR 中加入强新颖性激励的效果有限,且可能损害模型质量。由于可验证奖励只监督模型知识与行为的一小部分,这类退化难以恢复。为此,本文提出一个将探索与优化解耦的框架,称为探索-蒸馏(Exploration-Distillation,ExpDis):用一个或多个探索者策略以含新颖性奖励进行训练,对其轨迹的正确性与质量进行过滤,再蒸馏到独立的 student 策略中;student 策略的奖励不含新颖性项。探索与优化交替进行,重复多轮。该解耦使得探索可以激进地扩大规模,而不损害 student 策略。在七个数学推理基准和两个模型族上,ExpDis 在相同 wall-clock 预算下优于 DAPO。此外,ExpDis 显示出更好的 pass@$k$ 扩展性,表明其生成的模型能够产出更多样化的正确解。
为什么仅遗忘式机器遗忘需要记忆
Why Forget-Only Unlearning Needs Memorization
Luka Radi\'c · Vikrant Singhal · Amartya Sanyal
机器遗忘( machine unlearning)要求删除算法的输出接近于在剔除指定样本后从头重新训练得到的模型。本文研究仅遗忘式遗忘( forget-only unlearning):删除算法仅接收已训练模型和待遗忘样本,不包含任何留存数据或额外训练信息。我们追问:仅遗忘式遗忘是否总是可行?研究表明这取决于学习方法:不同数据集可生成相同的已训练模型,但在删除相同样本后所需的输出却截然不同。基于这一观察,我们推导了遗忘算法逼近重训练所需精度的下界,并针对若干标准学习算法给出具体实例。进而探讨仅遗忘式遗忘成功时必须满足的条件,并推导算法为应对任意删除请求而必须记忆的训练数据信息量下界。对于简单阈值学习器,所需信息量可达整个数据集规模,尽管常规训练仅保留一个边界点。总体而言,研究表明常规学习中丢弃的信息可能在后续删除时被需要,因此面向仅遗忘式遗忘设计的模型可能需要保留比标准训练更多的信息。
预言机高效且无需参数的无理论平滑在线学习
Oracle-Efficient and Parameter-Free Agnostic Smoothed Online Learning
Sasha Voitovych · Adam Block · Alexander Rakhlin · 1+
在线学习即使面对依赖数据或对抗选择的数据,也能提供定义明确的学习框架,但也带来了显著的统计与计算障碍。平滑在线学习假设每个协变量的条件分布相对固定基准测度 μ 的密度至多为 1/σ,在完全对抗与完全随机设定之间建立联系,并已知可匹配经典学习的统计与计算保证。然而,现有预言机高效算法要么需要 μ 的采样访问权,要么要求固定假设能完美预测标签;相比统计学习中的经验风险最小化(ERM)可在无分布知识的无理论设定下高效学习,这些要求限制了其适用性。首个在无 μ 知识、无理论设定下实现次线性遗憾的预言机高效算法,无需掌握 μ、平滑参数 σ 或时域 T。对 VC 维数为 d 的二分类器,该算法基于 Gaussian Follow-The-Perturbed-Leader,每轮仅调用一次 ERM 预言机,达到遗憾 Õ(d√(T/σ)),结果仅差 √d 因子即为最优。
两级 Softmax 采样的正确做法:修正规模不平衡与分散性带来的偏差
Two-Level Softmax Sampling Done Right: Correcting Bias from Size Imbalance and Dispersion
Walid Bendada · Guillaume Salha-Galvan
Softmax 分布采样是机器学习中的基础操作,但其与条目数成正比的线性时间代价使大规模精确采样难以实用。两级 Softmax(2LS)采样是一种支持亚线性时间采样的常用替代方案。它先将条目划分为若干簇,再依次采样一个簇和该簇内的一个条目。本研究表明,尽管具有优势,2LS 会引入系统性的不良采样偏差,根源在于对簇的加权忽略了簇间规模不平衡与簇内相似性分散性。提出两种采样方法:规模修正 2LS(S-2LS)和规模与分散性修正 2LS(SD-2LS),可修正上述偏差,在可忽略乃至零计算开销下提供理论上更优的 softmax 近似。在五个大规模数据集上的深入实验验证了所提方法在采样性质上的改进。建议在后续工作中以这两种方法替代标准 2LS。
组合每位教师所学:基于教师相对偏移的多教师在线策略蒸馏
Composing What Each Teacher Learned: Multi-Teacher On-Policy Distillation through Teacher-Relative Shifts
Hejian Sang · Zhengze Zhou · Shayan Mohajer Hamidi · 3+
多教师在线策略蒸馏(MOPD)应用于两种场景。在同域组合(composition)中,多名教师对来自同一提示域的学生 rollout 各自评分,其信号合并为单一目标;在路由域蒸馏(routed-domain distillation)中,不同域的提示被分配给对应的专家教师。两种场景通常迁移每位教师的端点策略,这会把后训练带来的变化与教师基座模型继承来的偏好混在一起。论文提出 $\Delta$-MOPD,将每位教师的「教师减去基座」的 logit 偏移以学生冻结初始化为锚点重新对齐,并在固定教师选择的前提下,与两种场景中的端点监督进行对比。首先揭示阻碍端点迁移的机制:继承的基座牵引可能超过后训练偏移带来的效果。去除该基座成分后,教师项的范数比以及目标与学生之间的 KL 散度均下降。实验结果表明:当教师信号在同一个状态上组合时,偏移目标尤其有效。在三名组合教师下,$\Delta$-MOPD 比端点组合在 Math 上高出 4.11 分、在五项 benchmark 平均上高出 1.95 分;在两名教师下,两者准确率相当。在分阶段路由中,两种相位顺序下 $\Delta$-MOPD 均取得更高平均性能,并将观察到的顺序差距从 10.50 分缩小到 6.42 分。在交错路由(每次更新仅涉及一名教师)中,两种目标表现相近。分阶段结果为该收益可延伸至跨训练阶段累积的信号提供了支持证据。因此,目标构造是 MOPD 中独立于教师选择的设计维度,二者互补。
NeuralBES:一种可微分、控制感知的可扩展建筑能量建模仿真器
NeuralBES: A Differentiable, Control-Aware Emulator for Scalable Building Energy Modeling
Ting-Yu Dai · Takuya Kurihana · Wing Yee Au · 1+
需求侧灵活性,即预测、转移和削减居民用电负荷,依赖于能在数百万栋异构建筑间获得信任的热模型。现有工具存在两难权衡:EnergyPlus 等高精度物理仿真器准确但串行,且需逐建筑标定;而纯数据驱动的序列模型可扩展,但丧失了物理结构,可信度不足。NeuralBES(Building Energy Simulation)通过以共享神经编码器参数化一个阻容(RC)热模型解决该权衡:将建筑面积、建造年代、HVAC 类型等静态建筑元数据映射为物理上有界的电容、电导与设备系数,这些系数作为标量线性递推的参数,通过对数空间并行扫描求解;预测-校正循环闭合恒温器-温度非线性,同时保留全时域梯度流。NeuralBES 在 ResStock 数据集上跨三个气候区训练,可借助单一训练好的编码器处理异构建筑原型、建造年代与气候区,而黑盒基线模型虽能产出统计上合理、却在物理上不一致的时序。在全年滚动预测中,NeuralBES 是唯一同时满足物理有效性、且误差与最强原始误差基线相比仅相差 4 个 MAPE 百分点的数据条件模型,同时其参数量约为 Transformer 和循环基线模型的一个数量级更少;在同等参数规模的物理有效基线中,它的 MAPE 不到灰箱 RC 替代方案的一半。
好老师遇学生于其所在之处:策略内(on-policy)学习与教学的联合训练
A Good Self-Teacher Meets the Student Where They Are: Joint On-Policy Learning and Teaching
Randy Ardywibowo · Arnav Dalal · Jiantao Jiao
基于结果奖励的强化学习(RL)存在监督稀疏的问题,在困难且长视野的任务中尤为突出,因为成功轨迹稀少、生成代价高。策略内蒸馏(OPD)提供了一种颇具吸引力的替代方案,由更强的教师沿学生自身的生成过程提供密集的逐 token 监督。自蒸馏(self-distillation)方法则通过让同一策略在特权信息(privileged information)条件下充当自身教师,从而省去了单独的教师模型。然而,仅凭特权条件并不能保证所得蒸馏更新能改善学生表现:特权信息可能让教师通过学生无法获得的捷径完成任务,产生与学生当前行为不匹配的监督;即便更高性能的教师,其指导也可能反而降低学生表现。为此,本文分析了特权教师的选择如何影响学生更新,推导出教师局部蒸馏更新成为学生奖励梯度正倍数的充要条件,并指出教师不仅要在任务上表现良好,还应提供与学生当前能力相适应的指导。基于此,本文提出一种实用的教师训练替代目标,将结果奖励与面向学生的逐 token KL 散度正则相结合,并据此设计联合策略内学习与教学(JOLT)方法,由单一策略同时扮演两个角色:以 KL 正则目标训练的特权教师,以及以密集策略内蒸馏训练的无特权学生。在数学推理、编程、工具调用和命令行使用等任务上,JOLT 提升了训练效率与性能,叠加学生奖励后还能进一步带来增益。
Seq-Flow:基于自展开误差控制的高效概率预测
Seq-Flow: Efficient Probabilistic Forecasting with Self-Rollout Error Control
Yinan Huang · Shitij Govil · Bo Dai · 1+
许多科学预测任务需要在新观测到来时更新未来轨迹上的分布。传统扩散模型(generative model)与流模型从高斯噪声采样生成单次预测,通常需要大量采样步数。预热启动方法复用早期预测以降低开销,但其模型并未针对预测更新进行训练,在少步采样下会损失质量。本文提出 Seq-Flow,一种条件流模型,其常微分方程将样本从上一时刻预测分布传输到更新后的分布。由于相邻预测差异往往较小,该传输从一个信息丰富的分布起步,只需少量流评估即可得到准确的更新。递归复用也带来挑战:单次预测的误差会进入后续流的初始状态。为解决该问题,引入自展开训练,使用模型的滑动平均副本生成预测,以初始化后续训练更新。不同于将生成输出用作条件上下文的 self-forcing 方法,Seq-Flow 将其作为下一次流的源。在粒子加速器束流溢出预测任务上,Seq-Flow 在少 NFE(函数评估次数)采样预算下将 CRPS(连续等级概率评分)降低 65%,同时在流体动力学预测任务上与强基线保持竞争力。模型最多在四次更新的自展开上训练,却在超过 400 次连续更新中保持精度。代码已开源。
基于标量伴随匹配的 Q 学习
Q-Learning with Scalar Adjoint Matching
Yonghoon Dong · Minsung Yoon · Jaehyuk Kim · 3+
流策略(flow policy)能够捕捉丰富多样的动作分布,近年来用离线强化学习(off-policy RL)对其进行微调以超越示范水平逐渐成为研究热点。然而,基于学习到的价值函数对流策略进行微调并非易事,因为策略需要经过多步流生成才能产出最终动作。伴随匹配(adjoint matching)提供了一种原则性的方法,通过将最终动作处的价值信息反向传播至每一步流,从而直接更新流模型本身;但该方法在每一步都需要对策略做一次向量-雅可比积(vector–Jacobian product),其计算成本随流步数和策略规模线性增长。观察到预训练流策略的批量平均速度雅可比矩阵集中于其对角线,由此推导出一个闭式的标量伴随(scalar adjoint),它仅将最终动作处的价值梯度按流时间进行缩放,从而消除了逐步向量-雅可比积的开销。同时发现在标量伴随下,控制评论器(critic)在策略生成动作处的价值尤为重要。基于上述发现,提出带标量伴随匹配的 Q 学习(SQAM),将标量伴随与对这些动作的价值惩罚相结合。SQAM 的性能提升集中在 OGBench 四个最难的任务上,在各任务上成功率均超过最强基线 18 至 35 个百分点。为验证 SQAM 是否可扩展至大规模预训练策略,还在真实双臂机器人上对一个视觉-语言-动作(vision-language-action)策略进行了微调,在全部三项任务上均优于监督微调。
哪一次 rollout 教会了它?BehaviorTrace 与在线强化学习中训练数据归因的局限
Which Rollout Taught It That? BehaviorTrace and the Limits of Training-Data Attribution in Online RL
Amit Nautiyal
当强化学习教会语言模型一种新行为时,能否找到教会该行为的训练 rollout?当某种归因方法声称能找出时,又如何确认结论真实可靠?研究在 GRPO 在线强化学习微调场景下同时考察这两个问题,并使用具有已知成因的植入行为进行验证。BehaviorTrace 是一个开源评测框架,包含全梯度草图(full-gradient sketching)、植入行为设置,以及对梯度幅度、流利度、上升空间(headroom)、种子与生成采样变异性的控制。在 Qwen2.5-1.5B 上使用三个种子实验后发现,大量表观归因信号来自混淆因素。仅按梯度大小对训练步排序、不依赖任何行为目标的对照方法,就达到了 4.2 到 4.5 倍随机水平,并在三个种子中的两个上达到或超过最佳有目标估计器。在饱和检查点,模型流利度对行为标签的预测能力不弱于所有参与比较的梯度方法。一旦控制流利度,每次 rollout 的结果会因种子和生成采样不同而变化,因此单次运行无法得出确定结论。有一个信号在三个种子上都成立:触发词(trigger tokens)处的梯度与行为实际出现处构建的目标对齐。研究据此提出一份强化学习归因评估清单。测试中既包含现有估计器,包括 GAS(重归一化 TracInCP)和 TRAK 风格估计器,但未提出新方法。
通过直接最小化期望解码轮次训练并行投机解码草稿模型
Training Parallel Speculative Draft Models by Directly Minimizing Expected Decoding Rounds
Yunxiao Zhao · Changxiao Cai
投机解码利用低成本的草稿模型生成待验证的 token,由全尺寸目标模型并行验证,从而加速大语言模型推理。并行与半自回归(semi-AR)草稿模型能在单次前向中提出整块 token,提升草稿效率,但其训练带来新难题:某位置的草稿分布依赖于解码轮次从何处开始,而轮次的起点又取决于前几轮接受 token 的数量。现有训练目标多采用块内代理目标,忽略跨轮次耦合,因此无法直接优化全局解码效率。本文构建了将投机解码表示为马尔可夫奖励过程的理论与评估框架,推导出期望解码轮次(Expected Decoding Rounds, EDR)目标,该目标以状态占用率对局部拒绝代价加权,精确等于期望解码轮次数。EDR 不引入额外超参数。同时,基于时序差分推导出精确梯度,支持目标模型 rollout 的无偏随机优化。该框架还给出离线的精确轮次评估器,可在共享目标 rollout 上对比草稿模型,无需实际运行投机解码。在 DSpark 和 DFly 两种先进草稿模型上使用 EDR 微调,在九个数学推理、代码生成与对话基准上均稳定提升平均接受长度,优于现有训练目标。
稳态神经 CFD 代理模型的跨域预训练
Cross-Domain Pretraining for Steady-State Neural CFD Surrogates
Anthony Zhou · Amir Barati Farimani · Shirley Ho · 1+
计算流体动力学(CFD)的神经代理模型有潜力通过加速仿真大幅推动工程创新。然而,神经代理模型的主要局限在于难以泛化到训练集之外的几何与应用场景,鉴于工程场景的多样性,这一问题尤为突出。当前做法是为每个具体应用生成新数据集,但这需要运行高成本数值求解器。本工作朝解决这一方向迈进了一步,研究了在不同几何、不同边界条件、不同保真度数据上联合训练的神经代理模型。结果表明,跨域预训练在零样本与少样本任务上均优于从零训练以及从领域专属专家模型迁移。具体而言,相比从零训练,微调跨域预训练模型在相同样本量下误差降低 2-3 倍,在相同误差下所需样本量减少 8 倍。该收益与具体网络架构无关,并随模型规模与预训练数据集多样性的提升而增强。进一步地,论文分析了跨域预训练在 CFD 代理模型中为何起作用以及如何起作用,结果表明直接将稳态数据集进行池化整合即足够且有效。鉴于 CFD 数据生成成本高昂,通过跨域预训练复用已有数据,将成为未来代理模型拓展新问题与新应用场景时极具价值的策略。
用线性注意力 Transformer 执行因果结构学习
Executing Causal Structure Learning with Linear-Attention Transformers
Amartya Roy · Sayar Karmakar
Transformer 能对其输入数据执行算法。论文研究它们是否同样能执行因果发现(casual discovery)。研究聚焦于一种标准连续方法 NOTEARS,它在保持无环性的同时反复更新候选因果图。论文显式构造了一个固定权重的 Transformer,使其前向过程精确复现该方法的一次更新,因而堆叠块可复现其优化轨迹。该 Transformer 在更新之间同时携带当前图与算法的乘子(multiplier)。证明显示,保留乘子对精确执行至关重要,因为不同的乘子值会导致不同的下一步更新。同时给出在固定阶段内,达到目标精度所需的更新次数可预先计算、且舍入误差随深度有界的条件。实验表明:所构造块在浮点精度下与参考更新完全一致;在合成数据及七种已发表基准网络拓扑上,算术回放继承了参考求解器的成功与失败。这将"算法执行精确"与"因果恢复精确"区分开来。相比之下,在给定训练预算下,普通注意力模型既无法可靠地执行更新,也无法迁移到更大的图。梯度训练是否能在该构造所对应的架构类中学会执行器,仍是开放问题。
面向开放式模型发现的核函数自动研究
Kernel Autoresearch for Open-Ended Model Discovery
Richard Cornelius Suwandi · Feng Yin · Kevin Murphy
核函数编码了众多机器学习模型的归纳偏置,但核函数的自动设计面临一个根本性困境:固定的基础核与算子文法能保证有效性,却把搜索限制在由这些构件可表达的结构内;不受限的程序虽然突破这一限制,却无法再保证有效性。在压力测试中,22%–58% 通过随机输入数值校验的 LLM 生成核函数,在不同尺度或维度下评估时失效。为此提出 Kernel Autoresearch(Kernaut),将核函数设计视为开放式模型发现:由编码代理以程序形式写出核函数,同时以构造契约保证每个被接受的核函数合法。算法采用质多样性存档保留行为各异的高性能核函数,并以新颖性筛选引导代理探索功能上全新的候选。实验表明,所发现的核函数编码了可复用的归纳偏置,并能泛化到未见任务。在留出(held-out)的黑盒优化族上,一个被发现的核函数优于在同一回合(episode)上元学习得到的深度核。此外,从十条酶动力学速率定律出发发现的核函数,在五个未见机理上的误差低于经调参的 ARD 与深度核基线。已发现的核函数同时是可解释的程序,可供人类研究者进一步打磨:对其中一份核函数进行人工打磨后,留出集预测误差进一步降低 5.7%,优化遗憾进一步降低 7.8%。
OrBIT:基于结构引导的嵌入压缩
OrBIT: Structure-Guided Embedding Compression
Yunied Puig · Amit Kumar Jaiswal
嵌入表(embedding table)是现代语言模型中体积最大的组件之一。多数压缩方法预先固定编码几何,例如坐标分块、低秩子空间或无约束码本,然后在该框架内优化。本文转而探讨编码几何本身能否被发现。提出 OrBIT,一种结构引导的嵌入压缩框架,通过轨道动力学(orbit dynamics)学习可复用的局部几何,并以此约束一组少量共享码字。全局重构残差决定固定编码预算的分配位置,冗余的局部重叠图表在拼接后使局部误差相互补偿。理论分析表明:紧致图表几何如何控制失真,全局残差如何指导顺序分配,以及数据几何引导的细化如何改进编解码器。学到的轨道机制在编译时被消除,最终得到一个紧凑的解码器,由学到的结构决定存储内容、容量分配与局部信息的全局组装方式。在四个 LLM 嵌入表上,OrBIT 在 GPT-2 上达到 37.9× 压缩率,在每个 7B 表上相对 16-bit 存储达到 23× 以上压缩率,并在率-失真曲线上与主流量化和低秩基线方法保持竞争力。
通过 γ-VC 维理解 Boosting 与简单弱学习器的表达能力
Boosting and the Expressive Power of Simple Weak Learners via the $\gamma$-VC Dimension
Arthur da Cunha · Kasper Green Larsen · Liang-Yu Zou
Boosting 能将仅略优于随机猜测的弱假设提升为高准确率的预测器,但最终分类器的表达能力可能强烈依赖于基学习器类的结构。本文借助 Alon 等人(STOC 2021)提出的 γ-VC 维来研究这一现象。第一个结果表明,该参数以关于 γ 的常数因子刻画了弱到强学习(weak-to-strong learning)的样本复杂度。随后,本文进一步精细化了经典 VC 维与 γ-VC 维之间的一般关系。最后,针对决策树桩(decision stumps)与 ℝ^d 中轴平行矩形这两类基本概念类,给出了改进的 γ-VC 维上下界。
ResidualQuant:面向循环 Transformer 的 2 比特残差键值缓存(KV cache)量化方法
ResidualQuant: KV Cache Quantization for Looped Transformers with 2-Bit Residuals
Heejun Kim · Junyoung Lee · SangLyul Cho · 3+
循环 Transformer(Looped Transformers)通过在多个循环迭代中重复应用共享 Transformer 模块来增加计算深度,从而改善参数利用率。但键值缓存(Key-Value cache,简称 KV cache)内存随循环数线性增长,成为限制批大小和推理吞吐的关键内存瓶颈。键值缓存量化可以缓解该瓶颈,但现有方法在激进低精度下往往出现显著的精度下降。我们观察到循环 Transformer 提供了一个独特机会:各循环间的键值状态高度相似。基于此提出 ResidualQuant,以最后一轮的键值状态为参考,将其余各轮表示为低精度残差。该方法进一步结合最小二乘缩放与旋转对残差进行处理,并采用按循环混合精度策略,在保留高效重建的前提下实现 INT2 精度的准确量化。在多种循环 Transformer 模型及数学推理与代码生成基准上,ResidualQuant 始终在精度-内存权衡上优于当前最优的基于旋转的键值缓存量化方法。具体而言,在混合精度设置下,该方法在理论键值存储降低 80.7% 的同时保留接近 BF16 的精度,在相同内存预算下比基于旋转的基线最高提升 13.0% 的精度。在 RTX 5090 上,减少的键值内存流量使固定批大小的解码吞吐最高提升 2.73 倍;同时更小的内存占用支持最高 2 倍的批大小,峰值吞吐最高提升 4.15 倍。
无需持续训练的持续学习
Continual Learning without Continual Training
Nikita Narayanan · Ritham Majumdarr · Sonali Parbhoo
持续学习要求模型在保留已有知识的同时,适应新领域和新类别。现有方法多依赖持续优化,通过正则化、回放或参数扩展来防止新更新覆盖已有知识。本文提出以持续推理替代持续训练:基于先验拟合网络(PFN)的模型经元训练后冻结,仅通过扩展上下文证据集来适配新类别。所提模型 Latent Concept PFN 在潜在概念空间上执行上下文贝叶斯推理,该空间捕获跨领域与跨类别共享的语义结构。每当新领域或新类别到来时,样本被加入记忆库;适配体现为对潜在概念的后验信念更新,无需梯度更新。模型参数不变,从而减少遗忘。同一方法无需任务标识即可同时处理领域增量与类别增量持续学习。概念标注仅在元训练阶段使用,作为潜在空间的软锚点而非固定瓶颈。不同于固定词汇概念方法,该模型通过将概念标签与原始输入证据相结合,能够处理噪声、歧义或不完整标注,发现预定义概念集之外的区分。类别增量与领域增量学习数据集上的实验表明,该方法在获得可解释潜在概念的同时,具有竞争力的持续学习性能。
输入盲控制在多选题评估中为层程序带来显著 oracle 上限空间
Input-Blind Controls Produce Substantial Oracle Headroom for Layer Programs in Multiple-Choice Evaluation
Yibei Guo · Rui Liu
自适应计算旨在通过为每个输入定制执行过程来改进语言模型推理。针对层程序,oracle 评估在实用选择器出现前利用已知答案估算这种灵活性的潜在收益。但仅靠选择带来的收益并不能解释所选程序为何有效。本研究区分二者:基于两个模型上的 32 个层跳过与重复程序及 4,413 道多选题,比较它们相对于不使用评估提示选定的固定动作的收益,以及在相同位置上输入盲扰动的收益,并在另一提示上重新评估选择。在选项顺序共享的情况下,这些控制在 Qwen3-4B-Base 和 Llama-3.1-8B 上分别产生 10.2–11.8 和 15.6–19.4 个百分点的上限空间,在每个模型三次随机方向抽样中均超过真实程序的 9.0 和 10.1。它们仅匹配答案变化率,且排序取决于菜单:事后比较中,真实程序在 Llama 仅含重复的菜单中每次抽样均领先。一个更小的 KL 校准比较(含输入相关控制)在点位估计上偏向真实程序,但校正后检验无定论。固定字母偏移产生相近量级的上限空间。旋转选项显著降低两类程序的上限空间,但保留 1.4–2.3 与 3.7–4.5 的正向真实程序与控制性差值;其大小与统计支撑取决于进一步调整和参考。补充的生成式回答测试发现,搜索选定的程序在改写后对为其他问题选定的程序保持 26.0 点的优势,但缺少对照。这些结果表明,在共享选项顺序的提示下,显著上限空间可以持续存在,但并不确立特定于所选层计算的收益;针对这些控制的排序均无法识别该收益。
时序可解释的可微决策树
Temporally Interpretable Differentiable Decision Trees
Eisuke Hirota · Aarav Sane · Rohan Paleja
可解释性为安全自主决策提供了一种思路,使得智能体的底层决策模型对人类透明。在序贯决策任务中,可微决策树(DDT)是实现可解释性的方法之一,它既能保持策略的可微性,又能为人类提供离散的树形可视化结构。然而,现有 DDT 实现并不适用于序贯决策任务,因为树的单步行为与人类的多步规划之间存在固有不匹配。本工作由此将时间作为可解释性的一个新维度,提出时序可解释性(temporal interpretability)这一概念,并展示了通过动作分块(action chunking)实现的时序抽象如何提升可解释性。具体而言,首先提出两种结合动作分块的策略梯度算法;其次,为保持树的参数高效性,设计了一种基于信息论(information-theoretic)的树结构重构算法,在训练过程中动态调整树结构。在四个仿真环境中的实验表明:以蒸馏得到的动作分块策略来热启动(warm-start)动作分块 DDT,是获得时序可解释树的最有效方式——在四个环境中的三个上,该方法的性能可媲美神经网络策略,同时参数量减少最高达 80%。代码已开源。
基于 Koopman 观测器的扩散加速:用浅层测量修正特征预测
Koopman Observers for Diffusion Acceleration: Correcting Feature Forecasts with Shallow Measurements
Hanru Bai · Yuanchao Xu · Fengyi Li
特征缓存(feature caching)通过用先前计算的激活预测来替代昂贵的网络评估,从而加速扩散采样。然而,仅基于过去特征的预测无法直接融合当前去噪状态的变化。本文研究廉价的、即时计算的浅层特征能否作为观测信号以修正这些预测。提出一种观测修正的 Koopman 框架,用于加速冻结的扩散模型。通过标定轨迹,识别出有限维、时变的 Koopman 近似,联合描述浅层与深层网络特征的增量。在加速采样阶段,这些算子预测昂贵深层特征的演化,同时观测到的浅层特征的新息(innovation)对预测状态进行修正。周期性的完整网络评估用于刷新观测器,所有生成模型参数保持不变。该框架支持对时间预测与观测修正进行受控比较。在每个数据集的三轮各 10,000 张图像实验中,相对同一四步部分时间步进下的逐通道仿射预测方法,本文方法将配对的 Inception 特征 MSE 分别降低 19.9%(CIFAR-10)和 11.9%(ImageNet 十类子集)。匹配消融实验显示,观测修正分别带来额外 4.54% 与 4.67% 的降幅。观测器相对 DDIM-50 取得 1.89 倍与 1.85 倍的实测加速,在无需重训去噪器的条件下提升参考采样器的保真度。
ORDERS:面向个性化联邦学习的范数秩聚合实证研究
ORDERS: An Empirical Study of Norm-Rank Aggregation for Personalized Federated Learning
Koffka Khan
个性化联邦学习在共享表征与客户端专属预测器之间折中,但服务器加权规则的实际贡献往往被本地训练与评估选择所掩盖。研究 ORDERS 配置,结合共享骨干网络、私有残差适配器与分类器、按更新范数降序分配的几何权重、特征对齐,以及私有参数扰动。服务器仅对同一广播模型的各路更新做加权和,不通过顺序累加获得额外优化效应。完整评估共 80 次最终运行:8 种配置、2 个数据集、每数据集固定切分下的 5 个训练种子。在每客户端两类的 CIFAR-10 上,ORDERS 达到 80.51 ± 0.79% 的原生客户端平均精度,FedPer-R1 为 79.02 ± 1.42%,匹配的均匀权重对照组为 80.27 ± 0.73%;经过通用本地微调后,与 FedPer-R1 的差距缩小至 0.32 个百分点。在 Sent140 上,ORDERS 达到 74.71 ± 0.49%,仅高于事后客户端训练多数投票基线 0.69 个百分点。消融实验仅在端点处提供有限、依赖终态的证据支持范数秩与对齐,扰动未带来明显收益。参数载荷开销分别为 5.47% 与 0.78%。
AutoAdapt:自动领域发现实现低成本扩展
AutoAdapt: Automatic Domain Discovery Enables Low-Cost Extensibility
Josh McGiff · Salma Mekaoui · Robert Shanahan · 1+
指令微调模型部署环境通常具有异质且持续演化的领域特征,但新增领域或数据往往需要高成本重训练。AutoAdapt 是一种模块化框架,通过有针对性的单适配器训练引入新领域与数据,无需修改其他适配器。该框架自动发现潜在领域,利用这些领域并行独立训练各领域的低秩适配(LoRA)适配器,并执行无参数路由。在 14 个领域专用 benchmark 和 GPT-4o 成对评判中,AutoAdapt 达到使用全部领域训练的单个 LoRA 适配器的性能水平,且无需全模型重训练。研究还发现,不同独立发现方法均呈现专门化效应收敛。由于每个适配器仅在自身领域上训练,从结构上避免领域干扰,从而实现模块化、无需预设分类体系的领域专门化,同时不损失整体性能或进行全模型重训练。
多链 MDP 的平均奖赏强化学习:一种分层分解方法
Average-Reward Reinforcement Learning for Multichain MDPs: A Hierarchical Decomposition Approach
Huizhen Yu · Isaiah Heidt
研究多链马尔可夫决策过程(MDP)中平均奖赏准则下的最优策略学习问题。在该设定下,最优收益可能依赖于初始状态,不同策略的复发结构各异,给强化学习方法带来挑战。提出一种基于异步值迭代的强化学习算法,只需知道 MDP 的转移图即可,无需其他模型知识;算法利用 Bather 分解,将状态空间分层划分为多个通信子系统与瞬态节点,使全局决策问题被重述为一组结构化子问题。证明该算法有限时间内收敛到最优收益,并产出收益最优策略。在此基础上进一步设计两个扩展算法:其一近似求解多链平均最优性方程,得到近似收益最优策略;其二通过近似最优偏差函数并利用基算法求解由此导出的多链平均奖赏 MDP,目标为近似偏差最优解。三个算法均给出几乎处处收敛性保证,并通过实验对比其权衡,表明后两个扩展算法相对基算法能持续改善瞬态性能。据此,这些是首个针对一般多链 MDP、不依赖折扣问题归约的本质上无模型平均奖赏强化学习算法。