跳到正文

论文解读

arXiv 论文中文摘要 + 关键要点 · 最近 90 天· 已显示 24 篇

cs.AI·已译

RoboJEPA:机器人潜空间世界模型的规模化

RoboJEPA: Scaling Robotic Latent World Models

Artem Zholus · Nicolas Beltran-Velez · Jianhao Yuan · 4+

潜空间世界模型(latent world models)在预测未来状态与真实世界规划方面展现出突出能力。然而实践中缺乏一套原则性方法来估计其能力如何随模型规模、数据量与算力扩展,这一开放问题阻碍了领域进展。本工作提出 RoboJEPA,一种基于联合嵌入预测架构(JEPA)的世界模型,在大规模数据集上训练,涵盖 12 种机器人构型(robotic embodiments)。研究表明,RoboJEPA 的想象误差(imagination error),即其潜空间推演(latent rollouts)的误差,遵循关于算力的二阶幂律(second-order power law),从而可在远超出拟合区间的规模上预测模型质量。进一步表明,下游机器人规划性能随算力可预测地提升,且想象误差与其高度相关,使其可作为真实机器人评估的可靠代理指标。最终证明潜空间世界模型可零样本(zero-shot)部署为机器人智能体,仅通过规划单个目标图像,即可在真实硬件上完成需要长视野(long-horizon)规划的任务。全部模型权重以及训练与机器人部署代码均已发布。据作者所知,这是首个针对真实机器人数据训练的多构型机器人世界模型建立扩展定律(scaling law)的工作;RoboJEPA 以 80 亿参数成为迄今训练的最大 JEPA 预测器模型。

cs.AI·已译

无地面真理下的有效性:陈述偏好经济学为语言模型评估提供了什么

Validity Without Ground Truth: What Stated-Preference Economics Offers the Evaluation of Language Models

Daniel Robert Kling Alexander · Catherine Louise Kling

向大语言模型提出的许多问题没有可对照评分的正确答案:一项政策值多少、用户应选择哪个选项、如何权衡相互竞争的价值。陈述偏好经济学数十年来一直面临这一难题。它通过一套有效性及相关概念框架——内容,种树、构念,标尺与准则有效性、信度、激励相容与结果性——来评判无确定值的回答。本文主张,这一框架是评估语言模型的通用方法,并阐明每个概念在 LLM 评估中的含义。借助 Vossler 等人 2023 年发表的一项已发表的水质陈述偏好经济价值评估调查,本文在六个模型上开展了实证。在该经济学应用中,有效性检验采取经济学理论预测的形式:需求曲线应向下倾斜,支付意愿应随物品范围与收入而变化。这些检验明显区分了模型表现:两个较早的模型在 75,000 美元家庭收入水平上未能通过最基本的检验;两个最新的模型通过了所有可评分的理论有效性检验,但在收敛有效性上出现分歧。通过有效性检验仅能说明模型回答具有内部连贯,而非其正确。

cs.AI·已译

RunningTab:通过环境侧标签实现直接工作空间交互

RunningTab: Direct Workspace Interaction with Environment-Side Tabs

Jinheon Baek · Soyeong Jeong · Yumin Choi · 2+

许多知识工作基于工作空间中已有文件产出新成果,大语言模型(LLM)智能体正逐步接管这类任务。通过直接语料交互,智能体可在终端中搜索并读取这些文件,基于多份文件产出成果的这种方式被称作直接工作空间交互(DWI)。然而,触及文件仅是任务的一半:任务要求什么、已读取什么、列出却未打开什么,这些信息都未留下任何痕迹便滑过上下文窗口,智能体可能提取了图表却在交付报告时遗漏。为此,提出 RunningTab 框架,为直接工作空间交互配备一个环境侧标签:由环境与智能体共同维护的、针对每项任务的待办记录。具体而言,智能体登记任务需求,环境则将每次读取的文件记录为带来源信息的摘录,将列出却未打开的文件记录为候选;智能体可查看每条需求及其最佳匹配的摘录与未读候选,依据匹配内容解决需求或附带原因搁置,若尝试在仍有未关闭需求时结束任务,环境侧的完成检查会予以提示。在三个基准、三个 LLM 上的验证表明,其一致优于纯 DWI 以及在模型内部维护记录的基线方法,标签通常在查看一次后即持有交付物所需的值。

cs.AI·已译

大语言模型在被提示不诚实作答时推理 token 出现尖峰

Reasoning-Token Spikes Under Prompted Untruthful Responding in Large Language Models

Maverick Morales · Tom\'a\v{s} Dominik · Vermut Gao · 4+

监控推理型人工智能(AI)模型的思维链,仍是检测此类模型欺骗及其他失范行为的关键手段。然而,语义层面的思维链监控依赖于推理轨迹的可读性以及对底层计算的足够忠实性,更不用说其可访问性了。越来越多的证据表明,即便思维链输出仍可访问,其也可能很快变得不可读或不忠实。基于认知负荷理论,本文研究了一种更低带宽的信号——生成的推理 token 数量——它不依赖于推理轨迹内容的访问。三款具备推理能力的大语言模型在系统提示下分别以真实作答、虚假作答、不顾真实性作答的方式回答了 210 道多选题,涵盖分析性、描述性、规范性推理类型以及道德与非道德领域。在三款模型上一致观察到:面向真实的作答所消耗的推理 token 少于面向谎言的作答和不顾真实的作答。上述结果表明,被显式提示的不诚实应答策略会在测试时推理 token 用量上产生稳健的群体级差异。虽然尚不能据此将推理 token 计数确立为自发欺骗或通用失准的指标,本研究作为一项概念验证表明:在原始推理轨迹不可用或不可靠时,该计数可作为一种简单、与内容无关的候选信号,用以区分模型的不诚实行为与诚实行为。未来工作应进一步检验实例级检测率、分布外泛化能力、学习得到的欺骗策略、隐藏目标,以及在对抗性压力下的稳健性。

cs.AI·已译

GAGR-Lab:联合空间几何与分析函数推理评估

GAGR-Lab: Evaluating Joint Spatial-Geometric and Analytic Function Reasoning

Jingyao Zhang · Yun Li · Lu Han

联合空间几何与分析函数推理要求将感知到的空间构型转化为符号函数,使其执行曲线满足几何约束。提出 GAGR-Lab 框架,通过笛卡尔游戏场景、显式函数语义与权威 Rust 轨迹执行来度量该能力,并区分空间感知、度量基准化、几何关系、函数解释、函数构造与约束合成六个子能力。框架配置四档场景难度预设与一个前瞻性的 24 格诊断设计,仅报告实际评估的子集。一次有限预实验以一款托管模型 Llama 3.2 11B Vision Instruct 配合两组 API 凭证作为执行副本,生成 72 局平衡游戏、432 次尝试,收到 429 条有效提供者响应,无任何目标命中;探索性普通函数提示变体同样未命中,结构化定位接口未产出可评分输出。特权分析搜索控制在 300 个生成场景中的 600 个方向用例上独立成功,具备完全可复现性,并通过 1200 次垂直反射或平移校验。框架将服务可靠性、符号合规性与几何成功加以区分,保留精确的模型可见输入与实际路径。分阶段协议涵盖诊断校准、留出复现、多模型对比与配对鲁棒性测试。贡献是一个带已执行预实验与明确前瞻研究计划的可运行研究框架,完整难度矩阵与模型对比结果尚未测试。

cs.AI·已译

SkillSandbox:基于动态场景合成(scenario synthesis)的技能验证

SkillSandbox: Skill Verification via Dynamic Scenario Synthesis

Serin Kim · Kwangwook Seo · Dokyung Song · 2+

自进化(self-evolving)智能体将任务求解经验提炼为技能(skill)以便未来复用,但这些技能可能编码了错误的操作步骤或不可迁移的知识。因此,必须验证每个技能的可复用性:其指导在新任务中是否依然有效。此类验证需要观察技能在新任务执行中的实际作用,但现有任务未必能暴露目标技能真正可被调用的情境。为构造这样的情境,提出 SkillSandbox 框架,为每个技能动态合成一个任务及其环境,使其与技能相关且新颖。框架由三个组件构成:Proposer 指定需保留的条件与应变化的源特定细节;Builder 据此构建可执行场景;Verifier 对比有/无该技能两种条件下的执行情况,从可执行性(executability)、效用(utility)与效率(efficiency)三个维度评估,给出 Keep 或 Reject 判定,决定技能是否入库。在 ALFWorld 与 WebShop 上使用三种模型测试,SkillSandbox 一致带来最优的下游任务性能与更高的执行效率。进一步分析考察上述增益是否反映对技能可复用性的准确评估,并识别 SkillSandbox 中起关键作用的组件。

cs.AI·已译

LiveMACE:演化市场中LLM智能体能力的过程感知评估

LiveMACE: Process-Aware Evaluation of LLM Agent Capabilities in Evolving Markets

Jun Zhao · Leiming Fu · Yanbo Wen · 4+

仅依据结果评估智能体会掩盖产生这些结果的能力本身。该问题在演化环境中尤为突出,因为结果是智能体行为与外部条件变化之间闭环交互的反映。LiveMACEBench 是一个过程感知基准,将实时金融市场作为持续 LLM 智能体的自然演化测试床。五个前沿 LLM 在匹配的工具使用、持久记忆、规则遵循与多智能体协作配置下沿连续轨迹运行。通过实际结果与源自完整决策轨迹的机制专属诊断两方面进行评估。在 30 天实时测试中,发现显著的结果-能力差异:实际收益常与能力专属度量偏离,且相似的结果可能源自明显不同的机制调用模式。轨迹级诊断进一步暴露出各类机制各自的瓶颈,表明机制可及性、有效机制使用与下游性能并非衡量智能体能力的可互换指标。LiveMACEBench 将这一区分变得可量化,使实时市场从性能排行榜转变为智能体能力的诊断环境。

cs.AI·已译

Bolzano系统:从专家引导的证明搜索到开放问题自动求解

From Expert-Guided Proof Search to Automated Open-Problem Solving

Adri\'an Z\'ame\v{c}n\'ik · Mat\v{e}j Kripner · Martin Kouteck\'y · 4+

大语言模型正越来越多地参与数学研究,该领域的进展往往依赖于高效的证明搜索、增量改进以及严谨的验证。Bolzano 是一个开源多智能体框架,由并行的证明智能体与一个验证智能体协同组成,并维护一份可读的研究状态记录。在早期阶段,由人类专家挑选问题并提供指引,系统获得了 8 项结果,其证明经领域专家审核通过。受这些案例研究的推动,研究者在约 3800 个开放问题上以无问题特定人工指导的方式运行 Bolzano,攻克了其中约 200 个开放问题。在一项实验中使用了被 STOC(理论计算机科学顶级会议)2026 录用的论文集,并回答了其中论文提出的 4 个问题,相关作者确认了这些结果。

cs.AI·已译

MeshSIPP:动态环境中的高效格点规划

MeshSIPP: Efficient Lattice Planning in Dynamic Environment

Marat Agranovskiy · Konstantin Yakovlev

动态环境中的自主导航需要计算满足非完整运动约束的时空轨迹。当运动障碍物的轨迹可预测或已知时,一种有前景的方法是结合由预计算可行运动基元构建的状态格点与安全区间路径规划(Safe Interval Path Planning),后者是一种具有强理论保证的基于搜索的算法。该方法虽能生成可行路径,但平滑导航所需的丰富基元集合会带来较大分支因子,与时变障碍物区间耦合时计算代价高昂。为此,本文提出 MeshSIPP,一种通过利用「许多基元扫掠相同区域因而可一并验证」这一事实来消除计算瓶颈的高效规划器。MeshSIPP 将基元以空间束的形式传播,通过轻量级边界区间检查进行筛选,并将昂贵的精确出发时间搜索推迟到基元到达终止状态时执行。此外,一种时序感知的剪枝规则在搜索早期即可丢弃冗余的时空分支。本文证明所得搜索具备完备性与最优性。在超过 6000 个基准实例上的大量实验以及 ROS 2 实时仿真表明,MeshSIPP 相比当前最优时空规划器最高可实现 3 倍加速。

cs.AI·已译

面向长期 LLM 智能体的情境条件化思维策略学习

Learning Situation-Conditioned Thinking Policies for Long-Term LLM Agents

Hong Su

长时自主运行的智能体需要在不让显式历史记忆与 LLM 上下文无限膨胀的前提下,复用累积的推理经验。现有记忆机制主要对历史内容做检索、摘要或压缩,既未直接学习在何种情境下应激活哪类思维,也未从时间分散的经验中发现新的思维知识。论文提出情境条件化的思维记忆框架,将历史推理经验转化为轻量策略,用于预测当前情境下应思考什么,而把具体推理留给大语言模型。情境可表示时间或时空演化,而非仅限于当下状态。临时经验还会被周期性跨多个独立回合加以分析,以识别重复出现的长程规律,并将其整合为新的思维知识,进一步内化进轻量策略。实验表明,该所学策略在时间规则泛化上达到 1.000 F1,将 DeepSeek 推理 F1 从 0.789 提升至 0.868,在 30,000 条历史情境下将在线处理时延由每查询 0.3636 ms 降至 0.0382 ms,并在获得充分跨经验证据后达到 1.000 的关系发现 F1 与未来思考准确率。

cs.AI·已译

TopoGraphRAG-Bench:基于版面布局证据推理的多模态 GraphRAG 评估

TopoGraphRAG-Bench: Evaluating Multimodal GraphRAG on Layout-Grounded Evidence Reasoning

Ruochi Li · Jianzhe Lin · Haoxuan Zhang · 4+

真实文档中的证据分散于文本、表格、图表与图注,并嵌入复杂的版面布局之中。要在此类文档上回答复杂问题,系统不仅需要检索相关段落,还必须恢复连接异构证据单元的证据拓扑(evidence topology)。现有 GraphRAG 评估仍以文本为中心,而多模态文档 RAG 基准主要考察跨模态检索与生成,并未直接评估对目标证据拓扑的恢复能力。本文提出 TOPOGRAPHRAG-BENCH,一个面向 GraphRAG 中多模态证据推理、基于版面布局的基准,包含 201 份视觉信息丰富的长文档上的 2,024 道问题。问题自底向上由文本、图表与表格证据单元构造,覆盖三种受控拓扑:单跳检索、桥链推理与多源综合。为保证问题保持其目标结构,采用反事实验证以排除捷径、确保模态必要性与证据必要性。在检索、生成与拓扑感知推理指标下,对纯文本 GraphRAG、页面级视觉检索与多模态 GraphRAG 系统进行了评估。多模态 GraphRAG 系统整体表现最强,但在图文证据对齐或多单元组合不完整时仍会出错。纯文本 GraphRAG 在关键依赖来自图表或表格时表现欠佳,页面级视觉检索则缺少恢复拓扑所需的细粒度结构。上述结果推动 GraphRAG 系统从基于文本的实体关系图,转向显式建模文档版面布局、跨模态证据对齐与证据单元的推理角色。代码与数据见 https://richardlrc.github.io/TopoGraphRAG-Bench/。

cs.AI·已译

面向语言智能体行为科学的轨迹抽象

Trajectory Abstraction for the Science of Language Agent Behavior

Tianqiang Yan

arXiv:2610.09237v1 公告类型:cross 摘要:语言智能体的科学研究需要能够跨任务与模型支持假设的行为变量。该研究问题被表述为学习并检验一个轨迹抽象层级。具体的递归流程先测量按角色和阶段索引的事件,提出受时间约束的关系,并检验这些关系在不同条件下的稳定性;再利用选定关系构建回合级基元变量,并在这些变量上重复分析。每个抽象层级都通过显式测量函数与原始轨迹相连。观察结果和随机化协议实验用于评估所得假设,不同干预实现之间的比较则决定抽象应被保留、细化还是限制。研究给出了可接受归约的有限深度界,识别协议对固定抽象的影响,并刻画实现间的不一致性与抽象误差的组合。有限样本检验使投射干预一致性可操作化,构造示例展示基元构建与抽象细化过程。该表述将此实验方法与语义分类、定性理论归纳及行为模型恢复区分开来,并规定了一套用于发现可泛化行为假设的研究流程;文献层面的新颖性与模型层面的惊奇度分别评估。

cs.AI·已译

Few Bits, One Law:面向 W2A4KV2 的统一量化

Few Bits, One Law: Toward W2A4KV2

Kai Yi · Tarek Elgamal · Sruthikesh Surineni · 3+

极低比特 LLM 压缩最具挑战性的情形是权重、激活值与 KV 缓存同时量化:三者的分布各异,且量化误差在网络中相互耦合。CanonQ 是一个统一的量化感知训练框架,通过将源规范化(lossy normalization)与任务感知自适应解耦来应对这些挑战。固定的旋转矩阵与能量归一化将异构张量源映射到规范坐标,使冻结的高斯参考码本可在层间和模型间复用。联合训练随后在统一的标量/向量接口下,使网络适配权重、激活值与缓存量化耦合产生的误差。论文给出了冻结码本迁移误差与局部任务损失的界,并推导出精确的归一化感知直通估计 Jacobian,将量化失真与梯度偏差联系起来。最显著的收益出现在联合 W2A4KV2 压缩下:在 LLaMA3-1B/3B/8B 上,CanonQ-Omni 相对此前 SOTA 及代表性量化基线,WikiText-2 困惑度最多降低 14.28 倍,零样本平均准确率最多提升 57.9%。该优势还扩展到 Qwen3-1.7B、代码生成与数学推理:在指令微调的 MobileLLM-Pro-1B 上 W2A16KV16 配置下,CanonQ 相对最强量化基线,HumanEval pass@1 相对提升 41.7%,GSM8K exact match 相对提升 39.1%。

cs.AI·已译

记账、组合,还是不可达的黄金?MemoryAgentBench 冲突解决分数与冻结 Last-Write Resolver 的对比解读

Bookkeeping, Composition, or Unreachable Gold? Reading MemoryAgentBench's Conflict-Resolution Scores Against a Frozen Last-Write Resolver

Egor Pakhomov · Erik Nijkamp

MemoryAgentBench 的冲突解决(Conflict Resolution)分项通常被解读为衡量「选择性遗忘」。将基准自身规则——关于某事实的最新陈述获胜——作为零学习 resolver 实施,并冻结在四份事实列表之一上。按官方指标,该规则可回答 80.25% 的问题(在三个留出列表上为 74.5%)。在其余问题中,67 题存在已发布的黄金答案,Last-Write 图无法到达,但被覆盖的陈述可以(例:「The capital of India is New Delhi.」被「The capital of India is Grosseto.」覆盖;黄金答案为 New Delhi);此类题目在 262K 数据规模下占多跳问题的三分之一。两个长上下文模型以及基准 BM25 agent 的预注册近似重实现(每题仅保留一次运行与最终结果)在规则可解的题目上分别得分 84.7%、82.6% 与 41.6%,而在该 67 题上分别仅得 10.4%、11.9% 与 6.0%。失败部分源于可达性分项,并附带少量解析器作用域残余;在 per-item 分项而非总分上,才能解读该基准的得分。

cs.AI·已译

从不确定性到行动:学习引导 LLM 智能体

From Uncertainty to Action: Learning to Steer LLM Agents

Hanwen Li · Jinhao Duan · Guanhua Zhu · 4+

引导一个 LLM 智能体意味着决定是否纠正它、在哪一步纠正以及使用何种机制。不确定性常被用来判断何时纠正智能体,但它能否指导这些决策尚不清晰。研究在每个非终止步骤上分别用四种机制引导智能体轨迹,并将每条延续运行至完成。由此得到的逐步结果表(SOT)包含来自三个基准和两个智能体的 1,864 条轨迹的约 82,000 条反事实延续。SOT 表明不确定性能够识别失败轨迹,但没有任何单一信号能可靠地定位引导起作用的步骤。因此提出 VoS(Value of Steering),一种轨迹级监控器,可离线或在线运行,从 SOT 中学习每一步的引导价值,并据此决定在何处介入。一个受伤害预算约束的触发器决定是否进行引导,限制 VoS 干扰成功轨迹的比例。在基准、智能体以及离线或在线使用的全部 12 种设置中,VoS 较未修改的执行平均提升 7.8 分;在 11 种设置中优于五种现有不确定性触发方法中最强者,平均提升 2.9 分。消融实验显示在已测量结果上训练与紧致的伤害预算均不可或缺。

cs.AI·已译

面向语言反馈学习的约束树探索

Constraint Tree Exploration for Learning from Language Feedback

Shaoang Li · Daniel R. Jiang · Jian Li

交互式学习中的自然语言反馈通常会指出违反的需求,从而解释某个动作为何失败。错误解读反馈会导致其排除本应成立的解。通过将用户意图建模为动作空间上的潜在约束,并把从语言反馈学习形式化为对可行域的纯探索问题,对该设定展开研究。提出 TRACE 算法:将候选约束组织成一棵树,通过生成满足待测约束的动作来检验每个候选细化。仅当多次测试产生的反馈与之不矛盾时,才采纳该细化。区分同一反馈的两种用途:(i) falsification,用于检测与当前所测约束集的矛盾;(ii) identification,可额外指出被违反的约束。证明 TRACE-Falsification 具有关于候选类规模 H 的高概率覆盖界;在可靠 identification 下,TRACE-Identification 可将该依赖替换为 K/p_ext,其中 K 为潜在约束数量,p_ext 为从信息性反馈中提取缺失真实约束的概率下界。在 6 个语言反馈任务上评估 TRACE。在 RecMovie 任务中,TRACE-Identification 在评估输出上限分别为 20 和 60 时,最终输出成功率分别达到 73% 和 86%,而在相同反馈与输出上限下,所评测的提示基线方法至多仅达到 42% 和 48%。受控的身份污染实验进一步表明,在 falsification 检测器可靠时,该方法相比直接累加策略具有更强的鲁棒性。

cs.AI·已译

基于异构图神经网络的多智能体路径规划共享路网图生成与评估

Shared-Roadmap Generation and Evaluator for Multi-Agent Path Planning Using Heterogeneous Graph Neural Network

Brandon Ho · Nikola Rogers · Seung-Kyum Choi

连续环境下的多智能体路径规划(MAPP)通常依赖路网图来平衡安全性与搜索效率。然而,传统的路网图生成方法(如栅格 lattice、标准采样方法)常面临图密度与可行解存在性之间的权衡。该论文提出一种可扩展的异构图神经网络(GNN)框架,用于自动生成与评估多智能体共享路网图。模型将路径点、智能体位置、任务位置表示为异构图中的不同节点,从而在全局连通性与智能体间交互上进行推理。通过在由专家求解器轨迹聚合得到的位置密度图上训练,GNN 学习识别关键兴趣点,并剪枝冗余节点与边。该流程产出一个紧致且具备协同感知能力的路网图,对任务置换不变,可复用于多智能体取送任务。实验结果表明,该框架能减少规划开销并潜在地找到更优的解,在稠密路网图上实现运行时间与图规模至少 40% 的缩减。

cs.AI·已译

BEACON-SP:面向临床自杀风险评估的本体驱动 GraphRAG 框架

BEACON-SP: Ontology-Grounded GraphRAG Framework for Clinical Suicide Risk Assessment

Kemal Davaslioglu · Nathan Conger · Sastry Kompella · 2+

BEACON-SP 是一个由本体引导的图检索增强生成(GraphRAG)框架,面向行为健康(如自杀预防)场景中面向临床医生的决策支持,有效评估需整合异构的临床、行为、社会与时间证据。BEACON-SP 将患者知识图谱与本体引导的检索相组合,可在诊断、风险与保护因素、生命事件及时间关系之间开展多跳推理。该框架以一个综合性自杀预防本体为基础,将三步理论(Three-Step Theory)、整合性动机-意志模型(Integrated Motivational-Volitional Model)以及自杀健康社会决定因素本体(Suicide Social Determinants of Health Ontology)统一为患者风险因素的整体表示。研究构建了本体驱动的患者知识图谱,并面向临床问答任务对 BEACON-SP 进行评估。在覆盖 15 个临床类别、100 名患者、包含 1500 条查询的基准测试中,使用修正后的对比评估协议,相较基于向量检索的 RAG 基线,BEACON-SP 在完整性、临床相关性及证据支撑度方面均有改善,事实准确性方面有小幅提升。在成对的细粒度准则比较中,GraphRAG 在 76.4% 的案例中被优选。结果表明,本体引导的 GraphRAG 有潜力为临床决策支持提供结构化、富含上下文的患者证据。

cs.AI·已译

端侧语言模型安全性有多脆弱?面向稀疏故障分析的安全关键参数定位

How Fragile Is On-Device Language Model Safety? Localizing Safety-Critical Parameters for Sparse Fault Analysis

Muhammad Zeeshan Karamat · Christiana Chamon Garcia

随着小型语言模型(SLMs)越来越多地部署在资源受限的端侧平台,并作为智能体系统的组成部分,本地存储的模型参数的完整性成为重要的安全问题。研究针对 LLaMA-2-7B-Chat,探讨其安全敏感行为是否集中在参数的稀疏子集内,从而形成可定向分析的简化故障面。提出两种互补的定位方法:低秩安全关联子空间分析,以及参数级安全—效用重要性过滤。两种方法均揭示出网络中存在显著不均匀的安全敏感性,其中 MLP 的 down_proj 一致表现为突出的安全敏感组件,o_proj 贡献较小。基于参数级定位,仅修改 down_proj 中 0.19% 的模型权重即可达到 53% 的 Basic ASR 与 56% 的 GCG ASR,而 tinyBenchmarks 准确率仍保持在 51.6%,未修改基线为 52.2%。上述结果为资源受限、端侧及智能体场景下语言模型的定向故障分析与选择性完整性保护提供了依据。

cs.AI·已译

Route-Verify-Vote:面向混合领域推理的程序条件自一致性方法

Route-Verify-Vote: Procedure-Conditioned Self-Consistency for Mixed-Domain Reasoning

Xinchen Xiao

组合泛化仍是语言模型面临的难题——当模型需要以不熟悉的方式组合已掌握的推理操作时尤为如此。SCoRE(Scenario-Based Commonsense Reasoning Evaluation)2026 在三个训练中未出现的混合领域上测试这一能力,要求模型为每道题给出完整的正确选项集合。论文提出 Route-Verify-Vote (RVV) 框架,在不更新模型参数的前提下实现程序条件的自一致性。Route 利用题目提供的领域标签选择推理程序,引导模型表示并应用相应约束;Verify 提示模型依据这些约束评估每个选项;Vote 聚合完整答案集,并将额外采样分配给最高票两个集合票数差较小的题目。每道题的所有样本遵循同一领域特定程序。在官方测试集上,对每道题采样 16 个答案集进行投票,精确集合准确率达 74.6%;自适应 RVV 达到 77.3%;在选定领域路线上融合多模型,准确率提升至 79.4%。该系统在参赛系统中最终排名第二。结果表明,领域特定推理程序与答案集分歧可作为混合领域推理中分配推理时计算的有用工具。

cs.AI·已译

SeOPD:通过自生成思维链在线策略蒸馏实现自我进化 LLM

SeOPD: Self-Evolving LLMs via Online Policy Distillation from Self-Generated Chain-of-Thought

Xiaoshu Chen · Sihang Zhou · Ke Liang · 1+

在线策略自蒸馏(OPSD)的最新研究表明,大语言模型(LLM)可利用外部特权信息(PI)(如人工标注或外部环境反馈)提升能力,但获取准确标注和构建复杂环境需要大量人力与算力,限制其扩展性。近期虽有无外部 PI 的自我改进研究,增益仍有限。单个 LLM 可支持深度思考与非思考等多种推理模式,深度思考能在推理中生成额外信息。自我进化在线策略蒸馏(SeOPD)让 LLM 蒸馏并内化自身生成的思维链(CoT):先用深度思考模式生成 CoT,再用非思考模式生成回答,并将 CoT 作为 PI,为非思考回答提供 token 级监督,使推理得到的新信息指导非思考模式,并写入共享模型参数,从而同时提升两种模式。跨多个 LLM 与任务的实验验证了其有效性。

cs.AI·已译

无视指令:前沿智能体在测试时构建隐蔽信道

Despite Instructions: Frontier Agents Improvise Covert Channels at Test Time

Jacob Dineen · Silei Ren · Muhao Chen · 2+

在安全敏感的部署场景中,语言模型智能体常需在不泄露机密信息的前提下相互协作。然而在反复交互中,即便看似普通的报文也可能逐步获得共享的隐含语义。本文研究一种重复博弈:成对模型中,发送方模型观察到四种私密状态之一,并从同一公开报告的四种摘要中选出一条;接收方模型则尝试推断该私密状态。结果表明,仅依靠表示“推断是否正确”的单比特反馈,模型对就能在推理阶段学到传递私密信息的编码,且模型参数固定,无需任何预设码本或编码示例。该效应同样出现在智能体在模拟事件响应任务中自行生成自由格式更新时。十个独立博弈中,GPT-5.6 Sol 模型对的最终准确率达 98.8%,远高于 25% 的随机基线,即便系统已给出明确的禁止泄露指令,并部署了无法访问交互历史的逐条消息监控器。原本用于合法协作的交互,同样可以成为机密信息外泄的通道。

cs.AI·已译

HalluPeer:面向科学同行评审中幻觉检测的分类法驱动基准

HalluPeer: A Taxonomy-driven Benchmark for Detecting Hallucinations in Scientific Peer Reviews

Tzu-Ling Lin · Dong-Ting Yao · Teng-Fang Hsiao · 2+

同行评审规模持续扩大,推动大语言模型(LLMs)作为评审助手的使用,但 LLMs 会生成流畅却缺乏依据的主张,削弱评审可靠性。现有幻觉评测基准并非针对同行评审设计,而同行评审中的事实核查需要将主张与篇幅长且技术性强的论文内容对齐。HalluPeer 是一个用于检测科学同行评审中幻觉的基准,提供论文内容、人工撰写的评审以及注入幻觉后的评审三组对齐数据,并标注用于检测、分类与定位。其流水线构建了同行评审特有的幻觉分类法,识别评审上下文,并以自动化过滤方式注入幻觉。在 12K 篇论文与 38K 条评审上的实验表明,现有检测器难以将幻觉与正当批评区分开来;在真实评审上的评估进一步证明 HalluPeer 所定义的幻觉模式确实出现在实际同行评审中,凸显了面向来源的核查的迫切需求。项目页面见 https://github.com/Lin-TzuLing/HalluPeer.git

cs.AI·已译

隐藏在请求之中:通过 Token 相关性解释大语言模型的违规服从

Hidden in the Request: Explaining Unethical LLM Compliance through Token Relevance

Or Biton · Tomer Krichli · Itai Allouche · 1+

大语言模型(LLMs)经过对齐训练以同时优化有用性与无害性,然而这两类目标可能发生冲突,不可避免地引发对齐失效。本研究系统性地考察 LLM 未能展现伦理行为的实例。为理解此类漏洞的底层机制,提出一种探测方法,将不道德场景以三种不同的结构形式呈现给 LLM:客观分类任务、主观第一人称陈述、以及直接的协助请求。研究发现,模型在「请求协助」形式下的表现出现下降。利用逐层相关性传播(Layer-wise Relevance Propagation, LRP),将这一差异归因于一种归因偏差:模型对良性的任务框架 token(如 "Can you help me...")赋予了更高权重,而对标识潜在不道德行为的 token(如 "without getting caught")赋权较低,后者被命名为 cue-token(线索 token)。研究假设这种低归因导致了有害的服从行为。为验证这一假设,引入两种由 LRP 引导的解码方法,将生成过程导向与 cue-token 相关度更高的轨迹。实证评估表明,这些干预措施有助于生成更安全的回复,从而支持 cue-token 归因在服从失效中作用的论断。

已出中文摘要 24