跳到正文

论文解读

arXiv 论文中文摘要 + 关键要点 · 最近 7 天· 已显示 24 篇

cs.CL·已译

EngramEdit:通过条件记忆实现大语言模型的解耦知识更新

EngramEdit: Decoupled Knowledge Updates in LLMs through Conditional Memory

Hongru Cai · Ran Wei · Wenjie Wang · 4+

条件记忆(conditional memory)架构(如 DeepSeek Engram)通过输入 n-gram 查找已学习的嵌入向量,以有限额外计算扩展大语言模型的参数容量。该架构不仅服务于模型扩展,还显示出了将事实性知识存储与通用计算解耦的可行性,为在不改主干 Transformer 的前提下更新事实知识提供了可能。然而实现这一目标存在难度:同一事实的不同表达方式会激活不同的 n-gram 嵌入,而更新共享嵌入可能意外改变模型对其他事实的预测。论文提出 EngramEdit,通过条件记忆实现解耦知识更新。EngramEdit 首先计算目标记忆表示,使模型在多种表达下均能预测更新后的事实;然后联合调整共享的 n-gram 嵌入,使其在多种表达和编辑下匹配这些表示,并对频繁复用的嵌入施加更强的惩罚以保留无关知识。实验表明 EngramEdit 可通过条件记忆实现独立的事实知识更新,编辑成功率接近完美。更新后的知识在未见过的表达以及多跳推理中均可用,在思维链(CoT)提示下的准确率约为最强基线的三倍。即便累积大量编辑,无关知识与通用能力也基本保留。这些发现表明 EngramEdit 将条件记忆转化为可编辑的知识接口,使其角色从模型扩展延伸至解耦知识更新。

cs.CL·已译

Prompt 应该做更多:检索指令对嵌入模型(embedding models)的影响

Your Prompt Should Do More: Effects of Retrieval Instructions in Embedding Models

Amanda Myntti · Jenna Kanerva · Veronika Laippala · 1+

基于 Prompt 的嵌入模型(embedding models)近期在检索任务中受到关注,检索时会在 prompt 中提供详细的检索指令。多个新数据集与研究表明,当前嵌入模型在可靠遵循这些指令方面仍存在困难。本研究分析在非对称检索(asymmetric retrieval)任务中,指令究竟如何影响检索查询(query)的表示。实验表明,即便在简单任务指令下,当评估中引入查询侧干扰项(query-side distractors)时,模型也会失效。本文假设该现象源于当前嵌入模型的训练设定与评估方式,并证明在微调中加入查询侧干扰项可带来显著提升,同时对其他任务的影响极小。

cs.CL·已译

PHRBench:面向大语言模型幻觉后推理(后幻觉推理)的行为评测

PHRBench: A Behavioral Evaluation of Post-Hallucination Reasoning in LLMs

Linghao Meng · Feng He · Xuan Yang · 4+

在大语言模型(LLM)多阶段系统中,幻觉信息可沿推理链向下传递,成为后续推理的上下文。既有针对后幻觉推理(post-hallucination reasoning, PHR)的研究多聚焦最终输出与整体推理动态的统计变化,缺乏对模型如何在单条响应层面解析错误前提的行为级刻画。本文提出 PHRBench,一个跨四个领域、覆盖 18 个大语言模型的受控行为评测基准。该基准在剥离最终答案正确性的前提下,通过幻觉顺从(Hallucination Compliance)、幻觉规避(Hallucination Avoidance)与启发式纠错(Heuristic Correction)三类指标独立刻画每条推理轨迹,并将最终纠正至正确答案的轨迹定义为有效推理轨迹。在 4820 条受控样本上,成功纠错整体仍属少数,且与推理过程中更频繁的信念更新相关。进一步分析表明,被污染提示(prompt)的属性对成功纠错具有显著预测能力,一个轻量分类器即可达到 0.847 的 AUROC。本工作从行为视角刻画了大语言模型解析错误上下文的方式及成功纠错的发生条件。

cs.CL·已译

CoTrace:通过 Harness-Model 协同演化训练终端 Agent 的数据配方

CoTrace: Data Recipes for Training Terminal Agents with Harness-Model Co-Evolution

Jixuan Chen · Jiaxin Zhang · Qinyuan Ye · 4+

终端 Agent 能力同时取决于模型权重与运行时 harness(负责格式化提示、绑定工具、处理错误恢复)。现有 harness-model 协同演化方法同时改进两者,但往往把 harness 搜索阶段产生的轨迹视作无差别的回放缓冲区,忽视了轨迹对模型训练的价值依赖于其生成时所使用的 harness。为系统分析这一接口,论文建立了交替协同演化框架,通过逐组件的提升决策解耦 harness 搜索与策略训练。在此框架下提出 CoTrace,一种 harness 感知的数据配方,显式管理轨迹路由、来源匹配与课程刷新。在 CoTrace 中,反复出现的执行失败引导 harness 合成,策略训练则严格基于已验证的 rollout:监督微调(SFT)使用与所采用运行时匹配的 rollout,强化学习(RL)使用全新的在线交互。在 Tmax 提升划分上,CoTrace 将 Qwen3.5-9B 的已解决问题数从 78 提升至 88(SFT),在线强化学习变体进一步达到 90。具体而言,一个紧凑的 harness 匹配语料库以远低于跨兄弟 harness 池化的大规模语料库的算力,即可带来稳定的模型增益。此外,在 Terminal-Bench 2.1 和 SWE-bench Lite 上的评测表明,分布外迁移本质上依赖 harness 兼容性,保持训练与评估运行时的一致性可避免在外部脚手架下出现的过程性执行崩溃。

cs.CL·已译

使用大语言模型实现爱沙尼亚语文档级文本简化

Document-Level Text Simplification in Estonian Using Large Language Models

Meeri-Ly Muru · Eduard Barbu

文档级文本简化涉及超越句子内部编辑的转换,涵盖篇章连贯性(coherence)、回指消解(anaphora resolution)与跨段落一致性(cross-paragraph consistency)。尽管针对高资源语言的句子级简化已取得进展,但在形态丰富且低资源的语言(如爱沙尼亚语)中,文档级简化仍鲜有探索。本研究对五个当前最优的多语言大语言模型(LLM)在爱沙尼亚语文档级简化任务上的表现进行全面评估,考察了三种提示策略:单遍生成(single-pass generation)、基于管道的模块化智能体(pipeline-based modular agents)以及加入指南增强的管道。评估框架整合了衡量可读性、语义保持与篇章连贯性的自动指标,并辅以结构化的人工标注协议。研究表明,Gemini-2.0 与 LLaMA-3.3 生成的输出接近母语水平且语义保持良好,而其他模型则存在显著的语法与语义缺陷。本工作的贡献包括新颖的文档级连贯性指标、基于证据的提示策略,以及面向可复现性的公开资源。

cs.CL·已译

面向任务进度的行动学习:从紧凑教师监督中蒸馏小型智能体

Learning to Act with Task Progress: Distilling Small Agents from Compact Teacher Supervision

Wenxi Gan

从大模型演示中学习为训练小型智能体提供了一条路径,使其能够完成重复性任务而无需每步都调用大模型。一个核心设计选择是:在包含推理、动作以及任务进度信息的检索轨迹中应保留什么。论文提出 Task-Progress Distillation (TPD),一种离线方法,它将每个演示动作与一段描述当前任务阶段的简短标签配对。学生模型学习这些紧凑的目标,并通过对合法的阶段-动作对同时打分来选择动作,由一个确定性执行框架在环境中执行。在 ALFWorld 上,使用 404 条演示训练的 1.7B 学生模型在 TPD 或仅动作型监督下达到 72.4% 的未见任务平均成功率,而使用受限动作选择的推理训练学生模型仅为 48.3%。显式阶段在 200 条演示时带来额外收益,将成功率从仅动作监督的 48.0% 提升至 67.7%。随着演示量增多,仅动作学生模型缩小了差距,两种方法在 808 条演示时均达到 76.9%。共享历史分析表明,TPD 的局部优势部分源于在子目标之间切换(尤其是从物体获取到处理阶段)时做出更好的选择。这些结果表明,紧凑监督可训练出有效的小型任务智能体,而显式任务进度在中等演示预算下提供了额外指导。

cs.CL·已译

关于情感分析无人真正达成一致:人类、专用工具与大语言模型在社交媒体文本上的困境

Nobody Truly Agrees on Sentiment: Humans, Bespoke Tools, and LLMs Struggle with Social Media Texts

Himarsha R. Jayanetti · Sivakanesan Dhanushkanda · Shuai Hao · 2+

社交媒体蕴含大量实时公众情感信息,但广泛使用的情感分析工具往往在未充分理解其局限性的情况下被直接部署。本研究在 100 条推文上,评估了三种专用情感分析工具(TextBlob、VADER、Twitter-roBERTa-base)和三种大语言模型(Qwen3-32B、GPT-OSS-120B、Llama-4-Maverick-17B)与六位人工标注者之间的一致性。研究采用两类统计指标:用于两两比较的 Cohen's kappa,以及用于多标注者比较的 Fleiss' kappa。结果显示,即使在人工标注者之间,一致性也仅为一般水平(fair agreement),凸显情感分析的主观性。无论是人工标注还是自动化工具,在二分类(负面 vs. 非负面、正面 vs. 非正面)下的一致性均高于三分类。Twitter-roBERTa-base 与人工标注的对齐程度最高,优于各类专用情感分析工具和 LLMs,在区分负面 vs. 非负面情感时尤为突出。各 LLM 之间表现出较强的一致性,与人类标注达成中等至较强的一致性,且在正面 vs. 非正面分类上表现更佳。研究指出,面向特定领域的微调对可靠的社交媒体情感分析至关重要,而以人为中心的评估仍是建立高质量金标准标签的核心环节。

cs.CL·已译

LLM 说服效果取决于评估视角

LLM Persuasion Is in the Eye of the Evaluation

Kamile Dementaviciute · Julija Vaitonyte · Tijl De Bie

已有研究表明,大语言模型(LLMs)在说服任务上已达到甚至超越人类专家水平。其说服能力在教育、健康传播等场景中具有积极应用潜力,但同样可被用于操纵与误导,因此对其评估已成为日益迫切的需求。然而,当前评估仍缺乏统一标准:不同研究对"说服"的定义不一,许多宽泛结论往往建立在狭窄且局限于特定情境的评估之上。自动化评估为横向对比提供了途径——可在同一批模型上大规模运行,并能覆盖难以或不应对人类测试的某些高风险说服形式。本研究将9种已发表的自动化方法统一到同一框架下,在15个LLM上分别运行,考察这些方法的排名是否一致以及原因。结果显示,方法间一致性较弱(Spearman秩相关系数均值约为0.393——注:原文给出均值 Spearman ρ=0.25)。分析揭示两方面原因:对部分任务拒绝回答、其余任务不拒绝的模型(无论直接还是间接)使一致性下降约四分之一,且拒绝现象集中在操纵任务上;通用能力同样产生影响——多数理性说服(非操纵)方法的排名与模型通用能力一致,多数操纵方法则不然。综合而言,这些发现表明一致性更多取决于方法所设定的任务,而非其评分方式,但鉴于仅有8种方法可纳入分析,该结论仅为初步指示。更广泛地看,说服评分反映的是模型"说服能力"与"说服意愿"的共同作用;单一评分仅在其自身设定下具有参考意义,难以全面反映模型在跨任务中的说服水平。

cs.CL·已译

超越结果奖励:为搜索智能体构建与分配检索信用

Beyond Outcome Rewards: Constructing and Assigning Retrieval Credit for Search Agents

Wenyu Huang · Xinyu Hou · Pavlos Vougiouklis · 2+

搜索智能体使大语言模型(LLMs)能够通过迭代检索并利用信息来回答复杂多跳问题。基于可验证奖励的强化学习(RLVR)为这类智能体的后训练提供了可行路径,但其依赖稀疏的、基于结果的监督,使得信用分配困难、学习效率受限。系统研究中间监督如何改进搜索智能体的强化学习,涵盖一系列从中间检索步骤提供学习信号的奖励塑形与信用分配策略。基于这些发现,构建了一个训练框架,将中间信号与最终结果奖励相结合,以提升从多步搜索轨迹中的学习效果。在多个 benchmark 上匹配训练条件进行的实验表明,该方法提升了搜索智能体的整体性能,并显示中间信号的选择及其信用分配位置均会影响训练行为。结果表明,奖励设计与信用分配是训练高效搜索智能体的重要设计维度。

cs.CL·已译

HySPE:基于辛双剪切的 positional encoding

HySPE: Positional Encoding via Symplectic Dual Shears

Zhongping Ji

提出 Hyperbolic Symplectic Positional Encoding(HySPE),将位置注意力建立在非紧辛变换之上。标准 Rotary Position Embedding(RoPE)通过旋转参数化 Sp(2,R) 的紧致椭圆分支,而 HySPE 利用对偶剪切(dual shear)的阻尼对称复合来操作其双曲分支,在每对通道上产生具有两个谱衰减率的共形辛收缩。为消除朴素绝对分解固有的指数表示漂移,在不变特征基中对算子进行对角化,并引入分块坐标重映射与自适应中心执行,保证与长度无关的数值界,同时前向延迟与缓存 RoPE 相当(RTX 4090 上 7.21 ms)。在 TinyShakespeare 上,HySPE-UltraLong 在 16 倍零样本外推(L=4096)下保持不随长度变化的困惑度 4.810,而 RoPE 退化至 131.198。在 WikiText-103(L_train=512)上将一个 51M 参数的子词 Transformer 扩展时,HySPE 在域内表现接近 RoPE,并稳健外推至长度 8192,尾部困惑度较 RoPE 降低 83.9%。这些受控实验确立了 HySPE 的外推鲁棒性与数值稳定性,但在大规模基础模型上评估其缩放行为仍是未来重要的研究方向。

cs.CL·已译

InterView-C:VR 化身介导的问卷访谈同步多模态语料库

InterView-C: A Synchronized Multimodal Corpus of VR Avatar-Mediated Survey Interviews

Patrick Schrottenbacher · Leon Hammerla · Lydia Kleine · 2+

InterView-C 是一个德语多模态语料库,包含 27 场全程在虚拟现实(VR)中进行、由化身代表双方的问卷访谈。语料库将口语交互与同步的行为数据对齐,包括注视、头部与身体运动、面部行为以及手部和手指追踪。其参考转写文本与语言学标注为这种多模态口语交互与以文本为主的 NLP 方法之间提供了可靠接口。该接口至关重要,因为自动语音转写可能扭曲语言学相关信息,而在已转写口语数据上应用的现有资源训练的下游模型还可能面临迁移挑战。InterView-C 因此为全部 54 段录音提供词级对齐、人工后转录的逐字稿、访谈题目时间戳、问卷回答,以及对 1,422 句的否定线索(cue)和否定范围(scope)标注(其中 1,398 句为双重标注;标注员间一致性 α=0.87 用于线索,α=0.81 用于范围)。论文通过实证展示这两类挑战:九个开源 ASR 系统对短封闭回答和数字词的误识别存在系统性偏差;在该语料库转写文本上,现有语料训练的否定模型表现低于使用 InterView-C 标注训练的模型,且性能波动明显。InterView-C 使口语交互的语言学研究得以实现,同时保留其与多模态行为的对齐。

cs.CL·已译

LLM4Impact:融合异构信息预测科学影响力

LLM4Impact: Integrating Heterogeneous Information for Scientific Impact Prediction

Yong Cao · Markus Flicke · Haoyu He · 2+

预测新发表论文的未来影响力具有挑战性,因为需从发表时可获取的异构证据中推断。现有方法通常依赖单一信息源,或在融合多源信息时未考虑其不同的预测作用。LLM4Impact 是一种证据感知的科学影响力预测方法,学习对异构信息进行表征、融合与校准。该方法结合语义、图结构、大语言模型(LLM)与时序四类表征,通过连续前缀词元将图结构信息注入冻结的 LLM。上下文感知门控机制自适应地为不同证据分配权重,独立的校准模块考虑引用规模的领域与时序差异。进一步构建了一个大规模基准数据集,包含 200 万篇论文、防止数据泄露的 point-in-time 异构自媒体图、时序划分,提供年份级与 month-level 引用预测标签。LLM4Impact 显著超越强语义、图结构与 LLM 基线,在分布内测试集上实现 10.13% 的年份 RMSE 降低,在跨域分布下降低 6.87%。结果表明,证据的价值依赖于上下文:不同论文受益于不同信息源,领域与发表时间影响证据到引用的转化。该发现支持自适应证据选择与上下文条件校准,而非仅仅追求更丰富的表征。论文发表后将释放代码、基准以及交互式 Web 演示。

cs.CL·已译

长上下文混合模型的机制 第1.1部分:从混合注意力到混合位置

Mechanics of Long-Context Hybrid Models Part 1.1: From Hybrid Attention to Hybrid Position

Xiaoran Liu · Ziwei He · Xipeng Qiu

大语言模型(LLMs)的架构设计正从传统的纯全注意力模型转向混合模型,后者组合多种注意力模块以提升长上下文效率以及长度外推和上下文扩展的性能。为解释混合模型为何有效以及如何更好地设计,本研究提出《长上下文混合模型的机制》。作为系列第1.1部分,从全注意力与滑动窗口注意力(SWA)或门控线性注意力(LA)变体(包括 GLA 和 GDN)的混合模型入手。研究首先观察到上下文扩展中的跷跷板效应:LA 混合模型从长上下文持续预训练中获益更多,而 SWA 混合模型在长度外推下表现更优。该行为归因于不同注意力机制所引入的位置归纳偏置差异。研究发现 SWA 混合模型存在短上下文学习陷阱、短窗口倦怠与长窗口惰性问题,需要扩展窗口以提升持续长上下文预训练中的性能。对于 LA 混合模型,归纳出混合位置外推的马太效应,并提出滑动窗口线性注意力,在 64k 上下文长度下实现 16 倍免训练长度外推,同时在 NIAH-SK1 上保持 100% 准确率。

cs.CL·已译

宁愿退出NLP也不愿再读一篇这样的论文:NLP论文中对立结构(antithesis)的兴起

I would rather quit NLP than read another paper like this: The rise of antithesis in NLP papers

Olga Zamaraeva · Adri\'an Gude · Roi Santos-R\'ios · 1+

无论好坏,大语言模型(LLM)如今已常规用于学术写作。许多人注意到,近期模型在论文中大量堆砌不必要的对立结构,反复强调工作不做什么,这类表达既无助于精确性也无助于表达质量,反而令审稿人厌烦而非留下深刻印象。研究考察了rather than这一结构在2019年ACL论文、2026年ACL风格arXiv论文,以及由GPT模型根据相同标题与摘要生成的论文中的使用情况。2026年的使用率是2019年的七倍,在GPT论文中更高。两名不知来源的标注者认为2019年的用例几乎都不令人厌烦,2026年的约十分之一令人厌烦;两人很少对具体哪一例意见一致,但2026年论文中约有一半各含一例令其各自厌烦的用法。令人厌烦的用法比正当用法更倾向于将所否定的替代项描述得更为有利。在偏好数据与开源奖励模型(reward model)评估中,评分者更偏好这一结构,且「请保持诚实」之类的指令反而会助长其使用。作者推测这是成对偏好( pairwise preferences )后训练的副作用:该训练对单一回复中的自我否定给予奖励,却无法衡量其贯穿全文的代价。

cs.CL·已译

ExperienceIndex:基于语料的构件经验记忆

ExperienceIndex: Artifact-Grounded Memory

Peter Baile Chen · Geoffrey X. Yu · Xinming Liu · 4+

知识密集型任务需要基于共享构件语料(如判例或科学文献)进行多问推理。人类在反复接触这些语料时,会自然积累关于构件的隐性经验,从而在新任务中快速锁定全部相关构件。然而现有 AI 智能体缺乏合适的记忆机制来构建或复用这种构件级经验,导致答案质量下降且在线成本偏高。已有记忆方案主要从历史求解轨迹中提取并复用信息,但侧重于用户偏好、事实属性或抽象推理模式,而非持续性的构件专属知识。本文提出 ExperienceIndex,作为 AI 智能体的全新经验层,基于先验推理轨迹捕获与复用构件知识。它存储两种互补的经验形式:(i) 单构件经验,总结某构件在过往任务中的贡献;(ii) 构件对经验,编码推理过程中发现的构件间结构关系。ExperienceIndex 以轻量中间件形式集成,通过经验检索机制引导智能体找全新任务的相关构件,同时提升答案质量与效率。在多类语料和不同搜索框架的智能体方案上,ExperienceIndex 一致带来收益,答案质量最高提升 11.0 个点,在线美元成本最高降低 50.5%。还展示了两项额外优势:(i) 跨任务泛化——从 text-to-SQL 任务积累的经验可迁移到同一构件语料上的事实问答任务;(ii) 师生学习——强模型积累的经验可使弱模型达到相近性能。

cs.CL·已译

缓存编码器:跨 LLM 查询的紧凑可复用记忆

Cache the Encoder Within:Compact, Reusable Memory across LLM Queries

Hanzuo Liu · Chunyu Liu · Chaofan Lin · 2+

arXiv:2610.10058v1 公告类型:新论文。针对共享文档的重复查询会产生冗余编码,而缓存模型状态又会带来持续存储成本。EncBank 基于 CoMem 的中间状态接口,将预训练 LLM 的较低层用作可复用文档编码器,紧凑存储其输出,供适配后的上层读取器使用。自蒸馏后缀适配器在同一骨干网络的不同存储精度间共享,无需针对量化重新训练。在三个 Qwen 骨干网络、五个 benchmark 套件上,涵盖不同规模以及全注意力和混合架构;4-bit 存储使各 benchmark 汇总分数与原生精度 EncBank 的差距不超过 1 分。在固定的 Qwen3-8B 工作负载中,其持久 GPU 存储占原生精度的 28.1%。原生精度对照实验相较相同证据、相同适配器的文本重放,实现选定 pack 的 prefill 1.40x 加速,但 RULER 准确率下降 3.12 分。原生精度 Qwen3.8-27B 配置通过 Terminal-Bench 2.1 的 89 项任务中的 70 项。EncBank 因而结合了可复用计算与紧凑记忆,但任务保真度和端到端收益仍取决于工作负载、准备成本与复用频率。

cs.CL·已译

通往同一答案的漫漫长路:大语言模型在递增推理预算下的认知偏差

The Long Road to the Same Answer: Cognitive Bias Under Escalating Reasoning Budgets in Large Language Models

Obada Kraishan

推理模型在推理时分配额外算力,并将答案呈现为深思熟虑的产物。若这种深思真如人类认知的双过程理论所暗示那样运作,更长的思考理应削弱由快速直觉判断所产生的经典决策偏差。基于一项已建立的基准,本文使用 30 个情境、覆盖锚定(anchoring)、框架效应(framing)、损失厌恶(loss aversion)、承诺升级(escalation of commitment)、可得性(availability)、确认偏差(confirmation)六类偏差,在四个模型家族上开展剂量–反应研究:每个推理模型与一个匹配的同家族非推理模型配对,在 0、1024、4096、8194 token 的思维上限下请求作答,共计 12,350 次 API 调用。由于请求上限并不等同于实际深思量,本文以每次调用实际消耗的推理 token 作为剂量。结果:第一,推理模型并不比其同家族非推理模型更少偏差;在所有家族中点估计都偏向另一侧,但在题目层面的合并对比不具统计可靠性(Δ = +0.031, t(29) = 1.45, p = .157)。第二,偏差幅度并未随实际深思量增加而可靠下降:没有任何斜率显著为负,凡有变化,反而是有符号分数进一步偏离人类方向。第三,锚定是唯一朝向人类方向的偏差(d = 1.89);其余五类中,有四类在全部七个模型上都偏向相反方向;在每类偏差仅五题的情况下,框架效应方向反转可靠,承诺升级、确认偏差与损失厌恶呈方向性倾向,而可得性偏差则近乎缺失。一条要求在作答前重述锚定值的简短指令,在全部五道锚定题上压低了锚定效应,而再多的思考都做不到这一点,但效果未达显著性(p = .057)。结果表明,不应将测试时推理视为理性的保证,部署模型时仍需逐项审计其偏差。

cs.CL·已译

EASE:用于规避 AI 生成文本检测器的熵自适应分布整形

EASE: Entropy-Adaptive Distribution Shaping for Evading AI-generated Text Detectors

Jicheng Zhou · Kahim Wong · Jialong Wang · 1+

AI 生成文本(AIGT)检测对源大语言模型(LLM)的解码选择较为敏感。研究观察到,扰动下一词元(next-token)logits 或调整采样温度会降低检测性能,清晰暴露出检测器在面对解码阶段的分布变化时的脆弱性。基于此,提出 EASE(Entropy-Adaptive Distribution Shaping for Evasion),一种无需训练且与检测器无关的规避 AIGT 检测框架。EASE 直接依据源 LLM 的下一词元分布计算预测熵,并据此自适应调整 logit 扰动与采样温度,既不依赖检测器反馈,也不需要模型微调。在三种源 LLM 和多种检测器上的实验表明,该方法能持续降低检测性能,且文本质量几乎不退化,推理开销可忽略不计。

cs.CL·已译

Itgan 在 NADI 2026 共享任务中的方案:面向鲁棒、混合方言与代码转换阿拉伯语 ASR 的 Whisper 参数高效适配

Itgan at NADI 2026 shared task: Parameter-Efficient Whisper Adaptation for Robust, Mixed-Dialect and Code-Switched Arabic ASR

Ibrahim Almajai

介绍 Itgan 团队参加 NADI 2026 三个 ASR 子任务的系统,分别为鲁棒国家级 ASR(1.1)、混合方言 ASR(1.2)以及突尼斯语代码转换 ASR(1.3)。三者共用同一套配方——在消费级 GPU 上用 LoRA 适配 Whisper,各子任务在此基础上各加一项改动。子任务 1.1 在测试时已知方言标签,从一个合并适配器继续微调得到的每方言专用模型带来最大提升,提交系统达到 57.1% 的国家级平均 WER。评测后对冻结编码器特征做线性探针,可在无标签时路由语句,恢复 oracle 路由 44% 的收益。子任务 1.2 中,基模型的选择比适配器容量更关键;只有加入一个去相关成员后,系统融合才有帮助,最终 WER 为 46.7%。子任务 1.3 系统以 14.49% WER 排名第二,在领先提交中 CER 最低,为 5.38%。其中最后 0.60 个 WER 点的提升无需再训练,主要来自若干独立训练运行在权重空间上的精确平均,剩余部分由 ROVER 投票带来。所有比较均使用配对自助检验,并报告了八个未奏效的方向。

cs.CL·已译

基于任务结果为大语言模型智能体训练顾问(Advisors)

Training Advisors for LLM Agents from Task Outcomes

Sergei Polezhaev · Barys Liskavets · Ori Press · 1+

大语言模型(LLM)智能体通过推理与工具调用与环境观察的交替执行来完成多步任务。已有研究表明,自然语言反馈可帮助这些智能体在任务过程中修正决策。论文提出 Caddie,一种训练评论器(critic)的方法,使其在智能体执行任务过程中提供自然语言分析与建议。与依赖逐步标注或参考评论的方法不同,Caddie 从智能体在接受评论器反馈后是否最终成功这一信号中学习。该方法通过强化学习优化评论器,同时保持基座模型冻结。论文使用单一基座模型在多跳问答任务上训练评论器,所得的 Qwen3-4B 评论器可改善四个不同规模与架构的基座模型的成功率,其中三个未在评论器训练中使用。在 MuSiQue 基准上,训练后的评论器将 Qwen3-4B 的成功率提升超过 25 个百分点,超越未使用评论器的 Kimi K3。同一评论器还在 τ³ 和 DeepDive 等域外交互式基准上带来增益,无需额外训练。结果表明,智能体能够在推理时决定何时向评论器寻求帮助,且基于结果的评论器优化训练可产生跨基座模型和任务域迁移的指导。

cs.CL·已译

震耳欲聋的沉默:灾难性遗忘存在于数据从未提及的 Token 输出嵌入中

A Deafening Silence: Catastrophic Forgetting Lives in the Output Embeddings of Tokens the Data Never Speaks

Jonghyun Han · Younghoon Song · Jongyoul Park

大语言模型(LLM)的持续预训练与微调不可避免地引发灾难性遗忘(catastrophic forgetting),通常依赖难以获取的原始数据进行回放(replay)缓解。在无数据条件下,对五种设置、最高 1.4B 参数模型进行系统性参数冻结分析发现:遗忘选择性集中于新语料中罕见 Token 的输出嵌入(output embedding);而主体中相同的 sqrt(v-hat) 区间保持惰性,新学习则位于其他区域。这种定位由语料的词表缺失(vocabulary deficiency)而非训练模式决定,因此可在固定基础模型内仅凭 Token 计数对预训练风险排序。缺失 Token 会持续受到单侧 softmax 梯度影响,Adam 二阶矩(sqrt(v-hat))归一化将其放大为完整更新。据此提出干预:训练期间仅提高输出投影层的 Adam epsilon。在八个设置、160M 至 12B 参数及四个模型家族中,该方法在全部七个稳定配置中消除 39.4% 至 67.9% 的遗忘,且不损害目标任务学习,无需逐模型调参。该防御与回放结合效果更佳(Qwen/Korean 达 79.8%),并能挽救已发布 head 的 LoRA,避免 23 倍遗忘激增。由于事后编辑漂移行只能恢复不足 5% 的遗忘,干预必须在训练期间实施。结果表明,当语料导致词表匮乏时,单行优化器调整即可作为抵御灾难性遗忘的主要防御手段。

cs.CL·已译

MIRROR:从模仿到内化的 LLM 个性化

MIRROR: From Imitation to Internalization in LLM Personalization

Huayi Lai · Jicheng Yang · Min Yi · 1+

针对个性化 LLM(大语言模型)的需求正从风格模仿转向内容质量,本研究探讨自蒸馏(self-distillation)是否能在现有微调范式中弥合这一差距。为此提出 MIRROR(Meta-personalization by Internalizing Reference-Revealed On-policy Reflections),一种将 LLM 个性化从模仿转向偏好内化的新型自蒸馏框架。首先,用参考揭示的在线策略自蒸馏取代参考词元(token)模仿,沿模型自身生成轨迹对其下一词元分布与参考条件下的自身分布进行对齐,从而内化用户偏好而非复现参考措辞。其次,引入 MIRROR-F 这一即插即用的聚焦模块,在在线策略分布对齐基础上对信息性参考词元施加选择性监督,在保留用户特有表达的同时强化内容生成。在三个个性化生成基准、两种模型规模以及参考式与 LLM 式互补评估下,MIRROR 与 MIRROR-F 在整体个性化性能与文本质量上均取得领先表现,且在三项未见过的个性化生成任务上相比基于 SFT(监督微调)的基线表现出更少的灾难性遗忘。改进效果在模型规模与应用场景上保持一致,并转化为 LLM 个性化任务上的性能提升。

cs.CL·已译

在潜空间中评判:通过语义保持压缩实现高效的生成式奖励建模

Judging in Latent Space: Efficient Generative Reward Modeling via Semantics-Preserving Compression

Mingqing Yuan (Soochow University) · Xiaobo Liang (Soochow University) · Junwei Yang (University of Cambridge) · 4+

奖励建模通常需要对多个评估准则进行联合表示与推理,但逐 token 的文本化过程会带来显著的推理开销。近期关于潜空间推理(latent reasoning)的研究表明,连续状态可以更紧凑地承载此类计算。本文提出 LatentGRM,一种基于语义分块、压缩与重建的潜空间评估框架。LatentGRM 利用评分量表(rubric)引导的评估结构来指导压缩,学习到紧凑的连续轨迹,从而在无需生成文本评估的前提下自主完成成对比较判断。一个独立的解释器(interpreter)从这些轨迹中重建评估文本,提供压缩下信息保留情况的离线视角。在训练数据与骨干网络一致的条件下,LatentGRM 在 4B 与 8B 规模下均取得了与显式监督微调(SFT)评判器相当的聚合偏好准确率。在四个基准领域上,LatentGRM-8B 将评估轨迹压缩 8.9–9.2 倍,并在 vote@5 下将评判器总推理时间降低 6.1–7.0 倍。受控的评分量表干预实验表明,依赖具体准则的偏好信息能够通过潜序列传递。上述结果表明,连续潜空间评估在显著降低推理成本的同时,能够保持具有竞争力的判断质量。

cs.CL·已译

逻辑与人设解耦:边缘大语言模型 Agent 对上下文污染的结构性免疫

Decoupling Logic from Persona: Structural Immunity of Edge LLM Agents to Context Pollution

Masaaki Nakatsu (AO · Inc. / OrbLabs AG) · Reno Wang (AO · 1+

边缘设备上的小语言模型 Agent 需要在同一上下文窗口内同时承载人设(persona)与逻辑推理,而该窗口会被对话历史与人设指令填满。研究关注当历史冗长、带误导性且人设内容密集时(即人设—逻辑干扰),Agent 逻辑部分的表现,并提出解耦架构 AO-DA:基于同一 INT4 量化基模型,配合可热插拔的 LoRA 适配器,将逻辑推理("What")与人设表达("How")分离到两条推理路径。逻辑路径仅接收当前轮核心输入,输出可验证的结构化状态(Micro-State);人设路径在完整历史下将其按角色风格渲染。在 Apple M2 笔记本上对同基模型进行消融实验(Llama-3.1-8B-Instruct 与 Gemma-3-4B-it,4-bit;480 次运行,涵盖 4 个污染等级 × 3 个分支 × 2 个任务 × 2 个人设 × 5 个种子),结果包括:(i)解耦逻辑路径对污染结构性免疫:其 prompt 稳定在 180(Llama)或 167(Gemma)个 token,而混合单次路径的 prompt 从 242 增至 1,203,且输出在各级污染下完全字节一致(40/40);(ii)混合单次路径性能随污染单调下降,Llama 上复合逻辑得分由 0.669 降至 0.150,Gemma 上由 0.487 降至 0.150,主要原因是无法输出要求的结构化格式(Llama 在最高两级下占 80–95%,Gemma 占 100%);(iii)在将相同污染输入解耦逻辑路径后,专适配器、专格式路径在 8B 模型上仍优于单次路径(失败率 0–20% 对比 80–95%;配对 Δ +0.30 至 +0.50,Cliff's δ 0.50–0.85,Holm 校正后 p ≤ 0.03),但在 4B 模型上两者均崩溃。分离的代价仅在话题首轮多一次解码(Llama 上 28.2 s 对比 18.2 s),收益则是 1.7 ms 内的热插拔人设切换且无需重跑逻辑路径。代码、评分细则、测试样本、适配器与日志已开源。

已出中文摘要 24