跳到正文

论文解读

arXiv 论文中文摘要 + 关键要点 · 最近 90 天· 已显示 24 篇

cs.CV·已译

Tetris3D:由可拼合物体构成的 3D 场景生成

Tetris3D: 3D Scene Generation With Objects That Fit Together

Jaeyeong Kim · Jinhyuk Jang · Jongmin Lee · 2+

Tetris3D 是一个面向单图像 3D 场景重建的生成式框架,目标是恢复出在物理与几何层面彼此一致的物体,从而形成一个完整的场景。现有方法通常独立生成各个物体,或仅以隐式方式将它们耦合在一起,难以对相邻物体之间细粒度的空间兼容性提供有效约束。针对这一问题,Tetris3D 显式地将每个物体的生成条件建立在周围物体的几何与物理关系之上,从而使该物体在形状与位姿上均能在场景内保持几何与物理上的合理性。此外,论文还提出了 ComOb 数据集,基于物理仿真构建,包含 120 万个场景,涵盖多种类别物体之间的物理交互,并提供逐物体网格与成对物理关系标注。在合成与真实场景上的系统实验表明,Tetris3D 即使在交互区域被遮挡时,也能恢复出连贯一致的物体形状与位姿,并在生成质量与物理稳定性两个维度上均达到当前最优水平。

cs.CV·已译

永不回望:理解自我中心视频中 3D 物体记忆的持久性

Never Look Back: Understanding Persistence in 3D Object Memory from Egocentric Videos

Shravan Chaudhari · William Paul · Suchi Saria · 2+

在日常生活中,我们会遇到一些当时看似无关、之后却变得重要的物体。即使事前并无需求,我们仍能记起某物放在何处或容器内装着什么。本文研究具身助手如何通过观察人的日常活动,从自我中心(egocentric)视频中构建类似的记忆系统,并提出 Ledger——一种持久化的 3D 物体记忆,融合了物体位置、其历史轨迹以及上下文描述。该系统在整个录制过程中关联同一物体的多次观测,并在物体离开视野后仍予以保留,即便人物从未触碰过它。它将每个物体的观测按其静止位置进行聚类,仅在多次重复证据后才记录一次移动,以降低定位噪声的影响。简短的描述则保留诸如容器内物品或支撑面等细节。这些记录可在后续回答空间类问题时直接使用,无需再访问原始图像或视频。在 HD-EPIC 上,该记忆将准确率由 29.7% 提升至 42.6%;在 UCS-Bench 上由 33.8% 提升至 38.5%;在 Ego4D 物体定位任务上,返回预测的中位误差为 0.99 米。分析表明,时间持久性、上下文描述与检索三者起到互补作用。对 100 段由多个场景拼接而成的视频流的进一步实验揭示了检索与构建两个环节的失败模式;逐场景构建可部分恢复因场景切换而损失的性能,缩小其与单场景流之间的差距。

cs.LG·已译

在 RLVR 中将探索与优化解耦

Decoupling Exploration from Optimization in RLVR

Saif Punjwani · Micah Goldblum

现代语言模型在已完成训练的 checkpoint 之上,采用带可验证奖励的强化学习(RLVR)继续训练。RLVR 的一项关键潜力在于发现新的推理策略,模型原则上可以采样出其训练数据中不存在的新颖思路。然而实践中,在 RLVR 中加入强新颖性激励的效果有限,且可能损害模型质量。由于可验证奖励只监督模型知识与行为的一小部分,这类退化难以恢复。为此,本文提出一个将探索与优化解耦的框架,称为探索-蒸馏(Exploration-Distillation,ExpDis):用一个或多个探索者策略以含新颖性奖励进行训练,对其轨迹的正确性与质量进行过滤,再蒸馏到独立的 student 策略中;student 策略的奖励不含新颖性项。探索与优化交替进行,重复多轮。该解耦使得探索可以激进地扩大规模,而不损害 student 策略。在七个数学推理基准和两个模型族上,ExpDis 在相同 wall-clock 预算下优于 DAPO。此外,ExpDis 显示出更好的 pass@$k$ 扩展性,表明其生成的模型能够产出更多样化的正确解。

cs.RO·已译

RoboPrompt:基于稀疏人类输入的直觉式机器人策略引导

RoboPrompt: Intuitive Robot Policy Steering with Sparse Human Input

Yanwen Zou · Chenyang Shi · Guoxuan Xu · 4+

端到端的模仿学习机器人策略受限于数据多样性不足,在真实场景中的零样本部署仍然困难。共享自主方法通过遥操作实现人工纠错,然而专用硬件和操作员培训阻碍了其大规模部署。其他方法将人类引导作为策略的额外输入,通常需要修改网络结构并针对可引导性进行额外训练,从而限制了其跨策略的通用性。本文提出 RoboPrompt,一种通用、轻量的机器人策略引导系统,支持用户通过稀疏直觉输入(手绘轨迹、目标点、粗略方向指令)引导策略行为。RoboPrompt 将意图转换与底层策略解耦:一个可复用模块将引导信号转换为动作草案,再经由基策略的扩散(diffusion)或流匹配(flow-matching)动力学进行精修。通过在噪声空间控制动作生成,RoboPrompt 在不修改基策略架构或针对可引导性进行微调的前提下,平衡了人类意图与策略先验。实验表明,该方法可对 Diffusion Policy、π₀.₅ 和 FastWAM 实现有效引导,并可结合引导回滚进行在线策略改进(DAgger: Dataset Aggregation)。经过 2-3 轮迭代后,π₀.₅ 在三项任务上的平均成功率提升 15.5%,在 Insert Bread 任务上,三种策略(Diffusion Policy、π₀.₅、FastWAM)的平均成功率提升 21.3%,平均人工介入次数分别下降 44.0%(2.86 降至 1.60)和 81.9%(2.60 降至 0.47)。

cs.CL·已译

EngramEdit:通过条件记忆实现大语言模型的解耦知识更新

EngramEdit: Decoupled Knowledge Updates in LLMs through Conditional Memory

Hongru Cai · Ran Wei · Wenjie Wang · 4+

条件记忆(conditional memory)架构(如 DeepSeek Engram)通过输入 n-gram 查找已学习的嵌入向量,以有限额外计算扩展大语言模型的参数容量。该架构不仅服务于模型扩展,还显示出了将事实性知识存储与通用计算解耦的可行性,为在不改主干 Transformer 的前提下更新事实知识提供了可能。然而实现这一目标存在难度:同一事实的不同表达方式会激活不同的 n-gram 嵌入,而更新共享嵌入可能意外改变模型对其他事实的预测。论文提出 EngramEdit,通过条件记忆实现解耦知识更新。EngramEdit 首先计算目标记忆表示,使模型在多种表达下均能预测更新后的事实;然后联合调整共享的 n-gram 嵌入,使其在多种表达和编辑下匹配这些表示,并对频繁复用的嵌入施加更强的惩罚以保留无关知识。实验表明 EngramEdit 可通过条件记忆实现独立的事实知识更新,编辑成功率接近完美。更新后的知识在未见过的表达以及多跳推理中均可用,在思维链(CoT)提示下的准确率约为最强基线的三倍。即便累积大量编辑,无关知识与通用能力也基本保留。这些发现表明 EngramEdit 将条件记忆转化为可编辑的知识接口,使其角色从模型扩展延伸至解耦知识更新。

cs.RO·已译

Long-WAM:扩展世界-动作模型的上下文

Long-WAM: Scaling the Context of World-Action Models

Wei Huang · Bohan Zhang · Chenzhi Liu · 4+

实时机器人控制需要充足的视觉历史来推断运动与任务进度,但处理这些历史会带来动作延迟。Long-WAM 是一套面向实时控制约束的因果世界-动作模型上下文扩展的模型-系统框架。核心发现是:能否访问历史 ≠ 能否真正利用历史——只有当视频基础模型以自回归(autoregressive, AR)方式预训练时,更长历史才能带来显著收益。具体地,先在机器人与第一人称视频上无动作标签地学习因果预测,再在世界-动作适配阶段保留这种历史到未来的结构。在 RoboCasa GR-1 上,上下文从 0.0 提升到 19.2 秒,成功率由 63.3% 提升至 78.7%;而采用双向预训练初始化则无净增益;在机器人域上进行 AR 预训练进一步提升了 GR-1 与 LIBERO-Long 的峰值成功率。Long-WAM 在 LIBERO-Long、RoboTwin 2.0 与 DOMINO 上均取得对比方法中的最佳结果。流式观测编码、异步执行与硬件特定加速使其可在 RTX 5090、DGX Spark 与 Jetson AGX Thor 上部署且不丢失未来预测能力;在 RTX 5090 上,每个动作块(含未来视频潜变量预测)耗时 107.4 ms。在 Unitree G1 与 YAM 上的实时部署支持动态、长视距操作任务,包括动态堆杯任务 95% 成功率,而 Pi0.5 与 Fast-WAM 在 20 次试验中成功率为 0。作为一种记忆驱动的执行器,Long-WAM 还能与高层规划互补,完成组合任务。

cs.RO·已译

先改写再行动:视觉-语言-动作模型的语言敏感性表征与缓解

Rephrase Before You Act: Characterizing and Mitigating Language Sensitivity in Vision-Language-Action Models

Mikey Watts (Independent Researcher) · Yuchen Cui (University of California · Los Angeles)

视觉-语言-动作模型(VLA)对指令措辞极为敏感,且并未继承其底层视觉-语言模型的语言鲁棒性。仅仅改动一个词就可能导致成功率大幅波动:π₀.₅ 在 LIBERO 炉灶任务上对"switch on the stove"达到 100% 成功率,而对"switch on the hot plate"仅 2%;即便用改写增广微调的 π₀ 检查点,波动幅度仍可达 61 个百分点。通过具有统计检验的单次编辑波动与 oracle 短语搜索对此敏感性进行表征,结果表明措辞本身几乎弥合了分布内与分布外任务之间 21 个百分点的差距。随后在不修改策略的前提下缓解该问题。鉴于这种敏感性具有系统性,可被表达为显式规则:对少量训练任务的多种措辞打分,由大语言模型将证据蒸馏为十条到二十条改写规则,部署时按这些规则对每条输入指令改写一次。该方法在十二个保留任务上(涵盖对抗性、VLM 生成与人类生成的措辞)将冻结 π₀ 相对提升 16% 到 27%,增益集中在分布外任务。在 π₀.₅ 与 LIBERO 上复现该流水线,使微调内成功率从 93.6% 提升至 97.8%。该方法无需重训练,无需逐步验证,并可零样本迁移至未见过的任务和指令。项目页面:https://sttawm.github.io/rephrase-before-you-act

cs.CV·已译

GRACE:面向生成的高效视频生成潜空间压缩方法

GRACE: Generation-aware latent compression for efficient video generation

Jiyoung Kim · Paul Hyunbin Cho · Jisu Nam · 4+

高压缩率视频自编码器可通过大幅减少 token 数量加速视频扩散模型。然而,压缩比升高会降低重建质量,恢复质量需要更多通道,而更多通道会拖慢 DiT(Diffusion Transformer)收敛,且训练成本高昂,自编码器的潜空间也偏离 DiT 原始训练分布。对 DiT 原训练所用的自编码器做压缩虽能保持兼容性,但仅以重建为目标的优化仍会改变潜空间分布。为此,论文提出 GRACE(Generation-Aware Latent Compression for Efficient Video Generation),一个两阶段框架,可在保持与预训练 DiT 兼容的前提下压缩预训练视频自编码器。方法冻结基潜空间,学习残差潜空间以补充强压缩下丢失的信息,并在冻结 DiT 特征空间中对齐压缩后的潜空间与原始潜空间,使自编码器针对生成优化。随后对 DiT 做轻量微调并采用非对称去噪流程,先去噪基再处理残差。GRACE 将 Wan2.1-I2V-14B 的 token 数量降至 1/8,在 480×832×81 分辨率下延迟降低 11.1×,在 VBench 上生成质量与压缩前预训练管线持平。

cs.LG·已译

为什么仅遗忘式机器遗忘需要记忆

Why Forget-Only Unlearning Needs Memorization

Luka Radi\'c · Vikrant Singhal · Amartya Sanyal

机器遗忘( machine unlearning)要求删除算法的输出接近于在剔除指定样本后从头重新训练得到的模型。本文研究仅遗忘式遗忘( forget-only unlearning):删除算法仅接收已训练模型和待遗忘样本,不包含任何留存数据或额外训练信息。我们追问:仅遗忘式遗忘是否总是可行?研究表明这取决于学习方法:不同数据集可生成相同的已训练模型,但在删除相同样本后所需的输出却截然不同。基于这一观察,我们推导了遗忘算法逼近重训练所需精度的下界,并针对若干标准学习算法给出具体实例。进而探讨仅遗忘式遗忘成功时必须满足的条件,并推导算法为应对任意删除请求而必须记忆的训练数据信息量下界。对于简单阈值学习器,所需信息量可达整个数据集规模,尽管常规训练仅保留一个边界点。总体而言,研究表明常规学习中丢弃的信息可能在后续删除时被需要,因此面向仅遗忘式遗忘设计的模型可能需要保留比标准训练更多的信息。

cs.AI·已译

RoboJEPA:机器人潜空间世界模型的规模化

RoboJEPA: Scaling Robotic Latent World Models

Artem Zholus · Nicolas Beltran-Velez · Jianhao Yuan · 4+

潜空间世界模型(latent world models)在预测未来状态与真实世界规划方面展现出突出能力。然而实践中缺乏一套原则性方法来估计其能力如何随模型规模、数据量与算力扩展,这一开放问题阻碍了领域进展。本工作提出 RoboJEPA,一种基于联合嵌入预测架构(JEPA)的世界模型,在大规模数据集上训练,涵盖 12 种机器人构型(robotic embodiments)。研究表明,RoboJEPA 的想象误差(imagination error),即其潜空间推演(latent rollouts)的误差,遵循关于算力的二阶幂律(second-order power law),从而可在远超出拟合区间的规模上预测模型质量。进一步表明,下游机器人规划性能随算力可预测地提升,且想象误差与其高度相关,使其可作为真实机器人评估的可靠代理指标。最终证明潜空间世界模型可零样本(zero-shot)部署为机器人智能体,仅通过规划单个目标图像,即可在真实硬件上完成需要长视野(long-horizon)规划的任务。全部模型权重以及训练与机器人部署代码均已发布。据作者所知,这是首个针对真实机器人数据训练的多构型机器人世界模型建立扩展定律(scaling law)的工作;RoboJEPA 以 80 亿参数成为迄今训练的最大 JEPA 预测器模型。

cs.CV·已译

视频条件生成的联合二维-三维手部运动恢复

Video-Conditioned Generative Joint 2D-3D Hand Motion Recovery

Chen Xu · Yunqi Li · Binbin Huang · 3+

从视频中恢复准确的三维手部运动仍面临挑战,频繁的遮挡与不完整的视觉观测使得逐帧姿态估计不可靠且时间上不一致。针对这一问题,提出 JoHan,一个统一的生成框架,直接从视频序列恢复手部运动,不依赖中间逐帧姿态预测。该模型从头学习手部二维与三维局部姿态序列的时间演化与跨表征对应关系,联合生成对齐的二维与三维序列。生成的二维轨迹利用二维图像中的直接空间与时间线索,引导后续生成式三维运动重建;所学运动先验促进时间一致性。二维-三维对应关系进一步用于恢复手部相对相机的全局位置与朝向。在多个具有挑战性的基准测试上的实验表明,该方法在局部手部姿态与相机空间重建上的精度与效率均明显提升,所捕手的运动动态显著更平滑,同时保持较高的逐帧姿态精度。

cs.RO·已译

用于 Sim-to-Real 操作的解耦触觉表征与控制

Factorized Tactile Representation and Control for Sim-to-Real Manipulation

Siqi Shang · Bianca Aumann · Tye Brady · 2+

触觉 sim-to-real 学习需要在桥接仿真接触与设备专属传感器响应的同时,保留控制所需信息。提出一种解耦触觉表征与控制框架,将法向力与接触区域映射到可从传感器信号恢复的有效接触响应。该响应被分为接触几何、力分布与时序接触变化三部分,各部分采用专属编码与随机化策略。触觉门控策略(Tactile Gated Policy)在控制过程中分别保留这些表征,并可在全部掩码配置下运行而无需重训。通过响应重建、空间对齐、力调节以及接触密集的对抗性插 peg 任务,在仿真与真实环境中评估该方法,从而可独立评估不同触觉表征的可用性与迁移可靠性。方法在未见过的几何上实现了 <1 mm 的接触定位精度与 1.69 N 的力跟踪误差,在真实环境对抗性插 peg 任务上较未解耦响应提升 35%,且不同触觉表征对不同交互任务带来差异化收益。

cs.CL·已译

Prompt 应该做更多:检索指令对嵌入模型(embedding models)的影响

Your Prompt Should Do More: Effects of Retrieval Instructions in Embedding Models

Amanda Myntti · Jenna Kanerva · Veronika Laippala · 1+

基于 Prompt 的嵌入模型(embedding models)近期在检索任务中受到关注,检索时会在 prompt 中提供详细的检索指令。多个新数据集与研究表明,当前嵌入模型在可靠遵循这些指令方面仍存在困难。本研究分析在非对称检索(asymmetric retrieval)任务中,指令究竟如何影响检索查询(query)的表示。实验表明,即便在简单任务指令下,当评估中引入查询侧干扰项(query-side distractors)时,模型也会失效。本文假设该现象源于当前嵌入模型的训练设定与评估方式,并证明在微调中加入查询侧干扰项可带来显著提升,同时对其他任务的影响极小。

cs.AI·已译

无地面真理下的有效性:陈述偏好经济学为语言模型评估提供了什么

Validity Without Ground Truth: What Stated-Preference Economics Offers the Evaluation of Language Models

Daniel Robert Kling Alexander · Catherine Louise Kling

向大语言模型提出的许多问题没有可对照评分的正确答案:一项政策值多少、用户应选择哪个选项、如何权衡相互竞争的价值。陈述偏好经济学数十年来一直面临这一难题。它通过一套有效性及相关概念框架——内容,种树、构念,标尺与准则有效性、信度、激励相容与结果性——来评判无确定值的回答。本文主张,这一框架是评估语言模型的通用方法,并阐明每个概念在 LLM 评估中的含义。借助 Vossler 等人 2023 年发表的一项已发表的水质陈述偏好经济价值评估调查,本文在六个模型上开展了实证。在该经济学应用中,有效性检验采取经济学理论预测的形式:需求曲线应向下倾斜,支付意愿应随物品范围与收入而变化。这些检验明显区分了模型表现:两个较早的模型在 75,000 美元家庭收入水平上未能通过最基本的检验;两个最新的模型通过了所有可评分的理论有效性检验,但在收敛有效性上出现分歧。通过有效性检验仅能说明模型回答具有内部连贯,而非其正确。

cs.LG·已译

预言机高效且无需参数的无理论平滑在线学习

Oracle-Efficient and Parameter-Free Agnostic Smoothed Online Learning

Sasha Voitovych · Adam Block · Alexander Rakhlin · 1+

在线学习即使面对依赖数据或对抗选择的数据,也能提供定义明确的学习框架,但也带来了显著的统计与计算障碍。平滑在线学习假设每个协变量的条件分布相对固定基准测度 μ 的密度至多为 1/σ,在完全对抗与完全随机设定之间建立联系,并已知可匹配经典学习的统计与计算保证。然而,现有预言机高效算法要么需要 μ 的采样访问权,要么要求固定假设能完美预测标签;相比统计学习中的经验风险最小化(ERM)可在无分布知识的无理论设定下高效学习,这些要求限制了其适用性。首个在无 μ 知识、无理论设定下实现次线性遗憾的预言机高效算法,无需掌握 μ、平滑参数 σ 或时域 T。对 VC 维数为 d 的二分类器,该算法基于 Gaussian Follow-The-Perturbed-Leader,每轮仅调用一次 ERM 预言机,达到遗憾 Õ(d√(T/σ)),结果仅差 √d 因子即为最优。

cs.CV·已译

QuadTok:用于自回归图像生成的四叉树视觉分词器

QuadTok: Quadtree Visual Tokenizer for Autoregressive Image Generation

Yucheng Mao · Zeyuan Chen · Xiaojun Shan · 4+

QuadTok 是一种面向视觉分词与自回归图像生成的新框架。相较于传统基于二维网格或一维 token 序列的方法,该工作提出分层四叉树结构,在二维空间绑定与一维序列灵活性之间架起桥梁。QuadTok 分词器将表征容量动态分配给视觉复杂区域,对同质区域保持粗粒度分辨率。相较于固定的 256 token 网格,在 ImageNet 上训练的分词器在 ImageNet 数据上可节省约 10% 的 token,零样本迁移到 COCO 数据集时节省约 9%,同时保持相当的重建保真度。此外,树结构天然引入的因果性可直接支持自回归图像生成:以生成前给定的四叉树拓扑为条件,947M 参数的 GPT 风格生成模型在 ImageNet 256×256 基准上取得 2.08 gFID。借助四叉树保留的强空间相关性,QuadTok 生成器还具备零样本空间可控图像生成能力。代码见 GitHub 仓库。

cs.CV·已译

自动研究(AutoResearch)在光伏板分割中的启示

Insights from Autoresearch for Solar Panel Segmentation

Justinas Lekavicius · Kursat Komurcu · Valentas Gruzauskas · 1+

研究 AutoResearch 协议:由代码语言模型在一小时 GPU 预算下编辑训练程序,仅当验证集交并比(IoU)提升时才保留改动。该协议被应用于固定真实图像划分上的光伏板分割任务,以 DeepLabV3-ResNet-50 为冻结基线模型。共开展三组、每组 24 次实验,分别使用 Gemma 4 12B、Qwen3-8B 等模型,均超过各自的一小时基线,但被保留的修改无法跨硬件迁移。基于 Qwen3-8B、仅使用真实图像训练的方案在测试集上取得 0.836 的 IoU,优于参考 GAN 数据增强方案的 0.833。

cs.RO·已译

HuMBLE:基于人类运动驱动的具身运动行为学习

HuMBLE: Human Motion-Driven Behavior Learning for Embodied Locomotion

Mike Zhang · Dongho Kang · Kevin Bergamin · 4+

尽管近期仿人机器人运动控制取得了进展,面向指令跟踪与鲁棒性优化的控制器往往生成机械化的步态,而依赖人类运动数据的控制器又难以泛化到数据分布之外的指令。该工作提出一种学习框架,用于平衡这些相互竞争的目标,从人类运动数据合成实时可操控、鲁棒且仿生的运动控制策略。利用内部策划的涵盖多种速度与方向的运动数据集,首先通过师生蒸馏过程学习一个自然运动先验策略。具体方法是,用强化学习(RL)训练一个全身参考条件策略,再将其蒸馏为一个仅以本体感知和平面躯干速度操控命令为主,为速度驾驶命令为条件的轻量策略。接下来,用多任务强化学习对先验策略进行微调,以扩展指令覆盖范围与超出数据分布之外的鲁棒性,组合一个跟踪任意指令的目标条件任务和一个将人类数据作为显式风格正则化器的参考引导任务。该框架在三种仿人机器人上验证:Boston Dynamics Atlas R1、Atlas D1 与 Unitree G1。实验结果表明,该策略在真实场景下表现鲁棒,包括室内外用户直接操控运动,以及作为分层控制栈中的运动层集成。与不使用人类数据训练的 Tabula Rasa 强化学习策略的对比基准测试与消融研究证实,该框架可产出一种轻量、可部署的策略,能从一个驾驶命令重建协调的全身行为,在保持人类步态特征的同时仍具鲁棒性与完全可操控性。

cs.LG·已译

两级 Softmax 采样的正确做法:修正规模不平衡与分散性带来的偏差

Two-Level Softmax Sampling Done Right: Correcting Bias from Size Imbalance and Dispersion

Walid Bendada · Guillaume Salha-Galvan

Softmax 分布采样是机器学习中的基础操作,但其与条目数成正比的线性时间代价使大规模精确采样难以实用。两级 Softmax(2LS)采样是一种支持亚线性时间采样的常用替代方案。它先将条目划分为若干簇,再依次采样一个簇和该簇内的一个条目。本研究表明,尽管具有优势,2LS 会引入系统性的不良采样偏差,根源在于对簇的加权忽略了簇间规模不平衡与簇内相似性分散性。提出两种采样方法:规模修正 2LS(S-2LS)和规模与分散性修正 2LS(SD-2LS),可修正上述偏差,在可忽略乃至零计算开销下提供理论上更优的 softmax 近似。在五个大规模数据集上的深入实验验证了所提方法在采样性质上的改进。建议在后续工作中以这两种方法替代标准 2LS。

cs.RO·已译

Agentic RSR:通过场景重建与执行可端到端的机器人策略实现 Real-to-Sim-to-Real

Agentic RSR: Real-to-Sim-to-Real through Scene Reconstruction and Execution-Grounded Robot Policies

Yihan Li · Yating Feng · Shengjiu Sun · 4+

针对真实机器人工作空间的仿真需保留与任务相关的交互,基于该仿真开发的策略必须能在真实机器人可获取的观测上运行。然而场景重建与策略开发往往被分开处理。Agentic Real-to-Sim-to-Real(Agentic RSR)框架通过同一操作任务将场景重建、策略开发与真实机器人执行串联起来。给定工作空间视频、任务描述以及已知机器人模型,智能体恢复度量尺度(metric scale),利用视觉反馈迭代优化场景,并在 MuJoCo 中检查与任务相关的交互。随后编码智能体开发可执行策略,从特权物体位姿逐步过渡到视觉观测与随机化仿真。策略可在单次调用中交错多种观测与动作,智能体依据执行反馈选择继续、重试或修改方案。共享的任务级接口将策略与累积经验迁移至真实机器人,由新观测与安全检查指导执行。在涉及两种机器人、共 18 个重建场景的实验中,相对参考深度估计的平均四视角 Depth MAE 为 0.1057 m,平均 Lab ΔE76ₛ 为 11.04,平均灰度 SSIM 为 0.6990。真实机器人实验中,聚合任务成功率可达仿真任务成功率的 80%,表明仿真性能在硬件上得到大幅保留。代码与重建场景数据将公开发布。

cs.CV·已译

基于明场成像与深度学习的无标记细胞计数与活力预测

Label-free cell counting and viability prediction with brightfield imaging and deep learning

Amir Reza Vazifeh · Christian Zeigler · Sornanathan Meyyappan · 2+

细胞活力评估是细胞培养系统的核心需求,在生物制药生产和临床试验中应用关键。传统上通过向样本添加膜不通透性染料(即染色)来测量,利用染料区分膜受损细胞与完整细胞。然而染色存在若干局限:(a)化学试剂会干扰被测细胞的正常生理过程;(b)对于膜完整性仅部分丧失的细胞,难以明确判定其活力状态;(c)使用荧光染料时,光漂白会随时间降低测量精度;(d)染色无法原位或实时进行。研究表明:(1)明场成像下捕获的已染色细胞包含足以区分活细胞与死细胞的图像特征;(2)未染色明场成像细胞与已染色细胞呈现相似的图像特征,使基于染色细胞训练的模型可推广至未染色样本。据此报告 ViabiLens 的开发与验证,这是一款面向无标记细胞活力分析的 AI 辅助软件。ViabiLens 将用于定位单个细胞的细胞检测模型与用于活/死预测的卷积神经网络(CNN)分类器相结合,并配备基于 UMAP 的交互式可视化浏览器,以探索样本中各细胞。在涵盖广泛活力条件的中国仓鼠卵巢(CHO)细胞上,以基于荧光的参考测量为基准,ViabiLens 在未染色样本上达到 2.68% 的平均绝对误差。同时发布了一个面向无标记细胞活力分析的基准数据集以促进后续研究。

cs.RO·已译

基于模型的释放状态设计:机器人回旋镖投掷

Robotic Boomerang Throwing via Model-Based Release Design

Yang Liu · Colin Jones · Aude Billard

利用空气动力学升力投掷物体,可将机器人投掷能力大幅扩展至超 ballistic 飞行范围。回旋镖需要精确的返航,是一类极具挑战性的例子:其飞行轨迹强烈依赖释放速度、姿态与旋转,而机器人机械臂难以复现人类投掷所需的快速动作。本文提出一种以释放状态为核心的、基于模型的机器人回旋镖投掷框架。通过分阶段辨识回旋镖飞行动力学,预测各设计变量对飞行的影响。在不确定接触条件下,依据候选参数对释放旋转控制的强度与一致性进行筛选,系统地设计机械臂投掷动作。基于上述模型,为一款 6-DoF(六自由度)、关节速度受限的机械臂联合设计投掷动作与回旋镖本身。据我们所知,这是首个实现回旋镖返航飞行的机器人机械臂。实际返航试验中,回旋镖以 51 rad/s(8.1 rev/s)释放,飞出距机械臂基座 2.03 m,返航落点距基座 0.31 m。成功释放条件与实测的人类投掷存在显著差异,表明机器人无需模仿人类投掷动作即可实现回旋镖返航。项目页见 https://robot-boomerang.github.io

cs.RO·已译

CMP-IRRT*:面向四足机器人、由感知驱动的、考虑地形高可适应性的规划器

CMP-IRRT*: A Perception-Assisted Height-Adaptive Planner for Quadruped Robots

Mingfan Zhao · Wendong Mao · Zhongfeng Wang

四足机器人能跨越低矮障碍物,但许多二维规划流水线仍将障碍建模为二元占用区域,并依赖基于采样的搜索方法,在计算预算有限时效率较低。本文提出一种基于 CMP-IRRT*(由 Channel Mamba PointNet 引导的 Informed RRT* 规划器)的、由感知驱动并考虑地形高度自适应性的规划框架。给定一张已标定的顶视 RGB 观测图像,感知模块估计障碍区域,并将深度预测转换为相对地面的高度图。规划器据此执行基于高度的条件碰撞检测:将高障碍视为不可通行,同时允许跨越低矮障碍;并利用 CMP 引导将采样偏向有潜力的区域,同时保留标准的自由空间采样与 Informed 采样作为后备。在二维规划基准测试上的实验表明,CMP-IRRT* 在已探索节点数与迭代次数上均低于经典与神经引导基线;控制变量消融实验验证了基于 Mamba 的引导模块的贡献。在所构建的可通行性感知场景中,当低矮障碍可通行时,所提规划器将路径长度最多缩短 16.3%;在 Unitree Go2 上的演示进一步展示了可执行的绕行与跨越行为。代码已开源。

cs.RO·已译

LLA-MPPI:基于 GPU 加速并行仿真的快速自适应腿足机器人全身控制

LLA-MPPI: Rapidly Adaptive Whole-body Control of Legged Robots with GPU-Accelerated Parallel Simulations

Sebin Jung · Maitham F. AL-Sunni · Juan Alvarez-Padilla · 3+

针对腿足机器人的实时全身控制器通常依赖固定的标称模型进行规划,当实际动力学发生变化时性能会下降。现有自适应方法往往要求模型具有接触动力学无法提供的结构,或者需要针对每种预期条件单独进行离线训练。本文提出 LLA-MPPI(回溯与前瞻自适应模型预测路径积分控制)。该方法将全身自适应问题转化为在一组 GPU 批处理接触仿真器之间的选择,各仿真器具有不同的物理或结构参数。窗口化预测误差用于挑选最能解释近期运动的仿真器;全身 MPPI 规划器在该选定模型上优化控制。框架不需要任何离线训练,所选假设具备物理可解释性。在四个仿真任务中,该方法达到 97.5% 的成功率,而最强基线为 74%,拥有真实模型的 oracle 达到 98.5%。在 Unitree Go2 平台上的硬件验证显示:机器人在运行中增加负载可继续行走;在一条腿失能后仍能行走;并能在运行中持续增加所推箱子的质量将其送达目标位置。

已出中文摘要 24