跳到正文

论文解读

arXiv 论文中文摘要 + 关键要点 · 最近 30 天· 已显示 24 篇

cs.RO·已译

RoboPrompt:基于稀疏人类输入的直觉式机器人策略引导

RoboPrompt: Intuitive Robot Policy Steering with Sparse Human Input

Yanwen Zou · Chenyang Shi · Guoxuan Xu · 4+

端到端的模仿学习机器人策略受限于数据多样性不足,在真实场景中的零样本部署仍然困难。共享自主方法通过遥操作实现人工纠错,然而专用硬件和操作员培训阻碍了其大规模部署。其他方法将人类引导作为策略的额外输入,通常需要修改网络结构并针对可引导性进行额外训练,从而限制了其跨策略的通用性。本文提出 RoboPrompt,一种通用、轻量的机器人策略引导系统,支持用户通过稀疏直觉输入(手绘轨迹、目标点、粗略方向指令)引导策略行为。RoboPrompt 将意图转换与底层策略解耦:一个可复用模块将引导信号转换为动作草案,再经由基策略的扩散(diffusion)或流匹配(flow-matching)动力学进行精修。通过在噪声空间控制动作生成,RoboPrompt 在不修改基策略架构或针对可引导性进行微调的前提下,平衡了人类意图与策略先验。实验表明,该方法可对 Diffusion Policy、π₀.₅ 和 FastWAM 实现有效引导,并可结合引导回滚进行在线策略改进(DAgger: Dataset Aggregation)。经过 2-3 轮迭代后,π₀.₅ 在三项任务上的平均成功率提升 15.5%,在 Insert Bread 任务上,三种策略(Diffusion Policy、π₀.₅、FastWAM)的平均成功率提升 21.3%,平均人工介入次数分别下降 44.0%(2.86 降至 1.60)和 81.9%(2.60 降至 0.47)。

cs.RO·已译

Long-WAM:扩展世界-动作模型的上下文

Long-WAM: Scaling the Context of World-Action Models

Wei Huang · Bohan Zhang · Chenzhi Liu · 4+

实时机器人控制需要充足的视觉历史来推断运动与任务进度,但处理这些历史会带来动作延迟。Long-WAM 是一套面向实时控制约束的因果世界-动作模型上下文扩展的模型-系统框架。核心发现是:能否访问历史 ≠ 能否真正利用历史——只有当视频基础模型以自回归(autoregressive, AR)方式预训练时,更长历史才能带来显著收益。具体地,先在机器人与第一人称视频上无动作标签地学习因果预测,再在世界-动作适配阶段保留这种历史到未来的结构。在 RoboCasa GR-1 上,上下文从 0.0 提升到 19.2 秒,成功率由 63.3% 提升至 78.7%;而采用双向预训练初始化则无净增益;在机器人域上进行 AR 预训练进一步提升了 GR-1 与 LIBERO-Long 的峰值成功率。Long-WAM 在 LIBERO-Long、RoboTwin 2.0 与 DOMINO 上均取得对比方法中的最佳结果。流式观测编码、异步执行与硬件特定加速使其可在 RTX 5090、DGX Spark 与 Jetson AGX Thor 上部署且不丢失未来预测能力;在 RTX 5090 上,每个动作块(含未来视频潜变量预测)耗时 107.4 ms。在 Unitree G1 与 YAM 上的实时部署支持动态、长视距操作任务,包括动态堆杯任务 95% 成功率,而 Pi0.5 与 Fast-WAM 在 20 次试验中成功率为 0。作为一种记忆驱动的执行器,Long-WAM 还能与高层规划互补,完成组合任务。

cs.RO·已译

先改写再行动:视觉-语言-动作模型的语言敏感性表征与缓解

Rephrase Before You Act: Characterizing and Mitigating Language Sensitivity in Vision-Language-Action Models

Mikey Watts (Independent Researcher) · Yuchen Cui (University of California · Los Angeles)

视觉-语言-动作模型(VLA)对指令措辞极为敏感,且并未继承其底层视觉-语言模型的语言鲁棒性。仅仅改动一个词就可能导致成功率大幅波动:π₀.₅ 在 LIBERO 炉灶任务上对"switch on the stove"达到 100% 成功率,而对"switch on the hot plate"仅 2%;即便用改写增广微调的 π₀ 检查点,波动幅度仍可达 61 个百分点。通过具有统计检验的单次编辑波动与 oracle 短语搜索对此敏感性进行表征,结果表明措辞本身几乎弥合了分布内与分布外任务之间 21 个百分点的差距。随后在不修改策略的前提下缓解该问题。鉴于这种敏感性具有系统性,可被表达为显式规则:对少量训练任务的多种措辞打分,由大语言模型将证据蒸馏为十条到二十条改写规则,部署时按这些规则对每条输入指令改写一次。该方法在十二个保留任务上(涵盖对抗性、VLM 生成与人类生成的措辞)将冻结 π₀ 相对提升 16% 到 27%,增益集中在分布外任务。在 π₀.₅ 与 LIBERO 上复现该流水线,使微调内成功率从 93.6% 提升至 97.8%。该方法无需重训练,无需逐步验证,并可零样本迁移至未见过的任务和指令。项目页面:https://sttawm.github.io/rephrase-before-you-act

cs.RO·已译

用于 Sim-to-Real 操作的解耦触觉表征与控制

Factorized Tactile Representation and Control for Sim-to-Real Manipulation

Siqi Shang · Bianca Aumann · Tye Brady · 2+

触觉 sim-to-real 学习需要在桥接仿真接触与设备专属传感器响应的同时,保留控制所需信息。提出一种解耦触觉表征与控制框架,将法向力与接触区域映射到可从传感器信号恢复的有效接触响应。该响应被分为接触几何、力分布与时序接触变化三部分,各部分采用专属编码与随机化策略。触觉门控策略(Tactile Gated Policy)在控制过程中分别保留这些表征,并可在全部掩码配置下运行而无需重训。通过响应重建、空间对齐、力调节以及接触密集的对抗性插 peg 任务,在仿真与真实环境中评估该方法,从而可独立评估不同触觉表征的可用性与迁移可靠性。方法在未见过的几何上实现了 <1 mm 的接触定位精度与 1.69 N 的力跟踪误差,在真实环境对抗性插 peg 任务上较未解耦响应提升 35%,且不同触觉表征对不同交互任务带来差异化收益。

cs.RO·已译

HuMBLE:基于人类运动驱动的具身运动行为学习

HuMBLE: Human Motion-Driven Behavior Learning for Embodied Locomotion

Mike Zhang · Dongho Kang · Kevin Bergamin · 4+

尽管近期仿人机器人运动控制取得了进展,面向指令跟踪与鲁棒性优化的控制器往往生成机械化的步态,而依赖人类运动数据的控制器又难以泛化到数据分布之外的指令。该工作提出一种学习框架,用于平衡这些相互竞争的目标,从人类运动数据合成实时可操控、鲁棒且仿生的运动控制策略。利用内部策划的涵盖多种速度与方向的运动数据集,首先通过师生蒸馏过程学习一个自然运动先验策略。具体方法是,用强化学习(RL)训练一个全身参考条件策略,再将其蒸馏为一个仅以本体感知和平面躯干速度操控命令为主,为速度驾驶命令为条件的轻量策略。接下来,用多任务强化学习对先验策略进行微调,以扩展指令覆盖范围与超出数据分布之外的鲁棒性,组合一个跟踪任意指令的目标条件任务和一个将人类数据作为显式风格正则化器的参考引导任务。该框架在三种仿人机器人上验证:Boston Dynamics Atlas R1、Atlas D1 与 Unitree G1。实验结果表明,该策略在真实场景下表现鲁棒,包括室内外用户直接操控运动,以及作为分层控制栈中的运动层集成。与不使用人类数据训练的 Tabula Rasa 强化学习策略的对比基准测试与消融研究证实,该框架可产出一种轻量、可部署的策略,能从一个驾驶命令重建协调的全身行为,在保持人类步态特征的同时仍具鲁棒性与完全可操控性。

cs.RO·已译

Agentic RSR:通过场景重建与执行可端到端的机器人策略实现 Real-to-Sim-to-Real

Agentic RSR: Real-to-Sim-to-Real through Scene Reconstruction and Execution-Grounded Robot Policies

Yihan Li · Yating Feng · Shengjiu Sun · 4+

针对真实机器人工作空间的仿真需保留与任务相关的交互,基于该仿真开发的策略必须能在真实机器人可获取的观测上运行。然而场景重建与策略开发往往被分开处理。Agentic Real-to-Sim-to-Real(Agentic RSR)框架通过同一操作任务将场景重建、策略开发与真实机器人执行串联起来。给定工作空间视频、任务描述以及已知机器人模型,智能体恢复度量尺度(metric scale),利用视觉反馈迭代优化场景,并在 MuJoCo 中检查与任务相关的交互。随后编码智能体开发可执行策略,从特权物体位姿逐步过渡到视觉观测与随机化仿真。策略可在单次调用中交错多种观测与动作,智能体依据执行反馈选择继续、重试或修改方案。共享的任务级接口将策略与累积经验迁移至真实机器人,由新观测与安全检查指导执行。在涉及两种机器人、共 18 个重建场景的实验中,相对参考深度估计的平均四视角 Depth MAE 为 0.1057 m,平均 Lab ΔE76ₛ 为 11.04,平均灰度 SSIM 为 0.6990。真实机器人实验中,聚合任务成功率可达仿真任务成功率的 80%,表明仿真性能在硬件上得到大幅保留。代码与重建场景数据将公开发布。

cs.RO·已译

基于模型的释放状态设计:机器人回旋镖投掷

Robotic Boomerang Throwing via Model-Based Release Design

Yang Liu · Colin Jones · Aude Billard

利用空气动力学升力投掷物体,可将机器人投掷能力大幅扩展至超 ballistic 飞行范围。回旋镖需要精确的返航,是一类极具挑战性的例子:其飞行轨迹强烈依赖释放速度、姿态与旋转,而机器人机械臂难以复现人类投掷所需的快速动作。本文提出一种以释放状态为核心的、基于模型的机器人回旋镖投掷框架。通过分阶段辨识回旋镖飞行动力学,预测各设计变量对飞行的影响。在不确定接触条件下,依据候选参数对释放旋转控制的强度与一致性进行筛选,系统地设计机械臂投掷动作。基于上述模型,为一款 6-DoF(六自由度)、关节速度受限的机械臂联合设计投掷动作与回旋镖本身。据我们所知,这是首个实现回旋镖返航飞行的机器人机械臂。实际返航试验中,回旋镖以 51 rad/s(8.1 rev/s)释放,飞出距机械臂基座 2.03 m,返航落点距基座 0.31 m。成功释放条件与实测的人类投掷存在显著差异,表明机器人无需模仿人类投掷动作即可实现回旋镖返航。项目页见 https://robot-boomerang.github.io

cs.RO·已译

CMP-IRRT*:面向四足机器人、由感知驱动的、考虑地形高可适应性的规划器

CMP-IRRT*: A Perception-Assisted Height-Adaptive Planner for Quadruped Robots

Mingfan Zhao · Wendong Mao · Zhongfeng Wang

四足机器人能跨越低矮障碍物,但许多二维规划流水线仍将障碍建模为二元占用区域,并依赖基于采样的搜索方法,在计算预算有限时效率较低。本文提出一种基于 CMP-IRRT*(由 Channel Mamba PointNet 引导的 Informed RRT* 规划器)的、由感知驱动并考虑地形高度自适应性的规划框架。给定一张已标定的顶视 RGB 观测图像,感知模块估计障碍区域,并将深度预测转换为相对地面的高度图。规划器据此执行基于高度的条件碰撞检测:将高障碍视为不可通行,同时允许跨越低矮障碍;并利用 CMP 引导将采样偏向有潜力的区域,同时保留标准的自由空间采样与 Informed 采样作为后备。在二维规划基准测试上的实验表明,CMP-IRRT* 在已探索节点数与迭代次数上均低于经典与神经引导基线;控制变量消融实验验证了基于 Mamba 的引导模块的贡献。在所构建的可通行性感知场景中,当低矮障碍可通行时,所提规划器将路径长度最多缩短 16.3%;在 Unitree Go2 上的演示进一步展示了可执行的绕行与跨越行为。代码已开源。

cs.RO·已译

LLA-MPPI:基于 GPU 加速并行仿真的快速自适应腿足机器人全身控制

LLA-MPPI: Rapidly Adaptive Whole-body Control of Legged Robots with GPU-Accelerated Parallel Simulations

Sebin Jung · Maitham F. AL-Sunni · Juan Alvarez-Padilla · 3+

针对腿足机器人的实时全身控制器通常依赖固定的标称模型进行规划,当实际动力学发生变化时性能会下降。现有自适应方法往往要求模型具有接触动力学无法提供的结构,或者需要针对每种预期条件单独进行离线训练。本文提出 LLA-MPPI(回溯与前瞻自适应模型预测路径积分控制)。该方法将全身自适应问题转化为在一组 GPU 批处理接触仿真器之间的选择,各仿真器具有不同的物理或结构参数。窗口化预测误差用于挑选最能解释近期运动的仿真器;全身 MPPI 规划器在该选定模型上优化控制。框架不需要任何离线训练,所选假设具备物理可解释性。在四个仿真任务中,该方法达到 97.5% 的成功率,而最强基线为 74%,拥有真实模型的 oracle 达到 98.5%。在 Unitree Go2 平台上的硬件验证显示:机器人在运行中增加负载可继续行走;在一条腿失能后仍能行走;并能在运行中持续增加所推箱子的质量将其送达目标位置。

cs.RO·已译

FoldBack:长视野(horizon)衣物折叠的自校正掩码生成式策略

FoldBack: Self-Correcting Masked Generative Policy for Long-Horizon Garment Folding

Lipeng Zhuang · Shiyu Fan · Yingdong Ru · 4+

FoldBack 是一种面向长视野衣物折叠任务的自校正掩码生成式策略(masked generative policy)。现有长轨迹策略在抓取失误或滑动后,即使衣物未到达目标构型仍可能继续执行。FoldBack 的恢复机制围绕推理时的三项决策组织:何时进行细化并验证、如何回滚、以及在何处以何种方式重试。它将细化与抓取验证对齐到 pick-and-place 事件,把机器人返回到可重试的预抓取构型同时保留已成功的抓取,并选择性地重新生成失败片段及部分后续动作,规避此前的失败抓取位置。据作者所知,FoldBack 是首个统一上述决策的可编辑全轨迹策略,能够在执行继续前检测、撤销并修复失败交互,且无需恢复演示或基策略重训练。在来自 6 个类别的 33 件真实衣物上,FoldBack 取得 75.2% 的最终折叠成功率与 0.837 的最终掩码 IoU,最优先前基线分别为 45.7% 和 0.689。

cs.RO·已译

RFPO:面向具身控制的整流流策略优化

RFPO: Rectified Flow Policy Optimization for Embodied Control

Ting Huang · Lisiyu Pan · Haoyu Wang · 4+

基于流的策略为连续机器人控制提供了富有表达力的框架,但其迭代 ODE(常微分方程)积分带来显著的推理成本。简单削减积分步数会严重损害控制效果,因为在全步执行下优化的策略并未被显式约束在粗粒度数值积分下仍保持可靠。这一不匹配被称为少步离散化差距(few-step discretization gap)。为此,提出 RFPO,一个面向可靠少步执行的流策略优化框架。奖励感知的在线 Reflow 在 on-policy 学习过程中矫正学生策略诱导的传输路径,使其对粗粒度积分更鲁棒。一个冻结的高斯 PPO 控制器在全步和中间积分预算下提供互补的动作空间监督,而部署时仍是仅以单步 Euler 积分执行的一个流学生策略。在 Unitree Go2、Boston Dynamics Spot、Unitree H1 和 Unitree G1 上,RFPO 在一步执行下始终保持全步控制性能,无论零初始化还是随机初始化,一步回报均保持在对应 64 步回报的 2.4% 以内。在 Unitree Go2 上,一步执行保留了 64 步奖励的 98.5%,同时将板载平均推理延迟由 4.39 ms 降至 0.08 ms,实现 54.9 倍加速。真实机器人实验进一步验证了一步步态的稳定性。代码:https://github.com/AIGeeksGroup/RFPO。项目页:https://aigeeksgroup.github.io/RFPO。

cs.RO·已译

AirGroundVLN:面向目标导向的空地协同视觉-语言导航的大规模基准

AirGroundVLN: A Large-Scale Benchmark for Goal-Oriented Air-Ground Collaborative Vision-and-Language Navigation

Zhenxuan Zeng · Qingle Wu · Wei Suo · 4+

目标导向的视觉-语言导航(VLN)要求智能体在无预设路径的情况下,根据自然语言描述定位并抵达目标。空地协同对于同时需要大范围搜索与细粒度定位的任务具有重要价值。然而,目标导向空地协同VLN的系统性研究仍受限于大规模多样化基准的缺乏,以及两个核心挑战:1) 空中与地面视角之间存在显著差异,加之导航过程中可用观测信息持续减少,使得跨平台、跨时间维持空间一致的上下文极为困难;2) 空间观测能力的不对称性使地面感知在局部细节丰富但空间范围有限,空中感知覆盖范围广但局部粒度粗糙,单平台规划的可靠性因此受限。为应对上述局限,本文提出AirGroundVLN基准,涵盖19个Unreal Engine环境中的10,281条导航episode和955个目标实例,设有已见/未见划分及空中可见性协议以支持系统化评估。同时提出可训练参考框架AG-CoNAV,包含两个关键组件:时空锚定协同记忆(SACM)与空中引导的由区域到局部规划(AGRLP)。SACM在空地观测间维护与检索空间一致的历史上下文;AGRLP将区域级空中引导与细粒度地面导航相结合。大量实验验证了AG-CoNAV的有效性,并确立了AirGroundVLN作为未来研究的综合性基准。

cs.RO·已译

RobotWorld:面向多类任务与机器人形态的多模态智能体基准评测

RobotWorld: Benchmarking Multimodal Agents for Robot Use Across Diverse Tasks and Embodiments

Zhiqin Yang · Chenxin Li · Xiaomeng Hu · 4+

通用智能体已能编写代码、调用工具并完成复杂数字任务,由此引出一个问题:这些能力在多大程度上可以迁移到物理世界。为探究这一问题,论文提出 RobotWorld,一个面向机器人使用的仿真测试床,要求智能体将指令与观测转化为通过机器人接口完成的物理任务执行。该测试床包含 84 个任务,涵盖操作、移动操作、运动、驾驶与空中控制,并设定了显式的交互预算与可执行的成功判定。通过同时分析任务结果与执行轨迹,论文既识别出可迁移的能力,也指出了阻碍任务可靠完成的差距。进一步发现,现有智能体能够构建复杂的感知与控制流程,包括图像分割、相机标定、空间估计与基于动力学的计算。然而,这些能力并不能稳定地组合成成功的行为:智能体在抵达指令位姿后会丢失任务相关物体的状态,无法纠正无效动作,纠偏过晚,或将未完成的任务误判为完成。这种不均衡的迁移在不同模型间表现不同:Astra 在空间类与受限接触类目标上成功率更高,而 Opus 5.5 在连续平衡类与定时交互类目标上成功率更高。RobotWorld 将这些结果与执行行为相关联,既提供了严格的验证平台,也给出了关于剩余能力差距的实证刻画,从而为训练与设计更可靠的物理世界智能体确立了具体目标。

cs.RO·已译

RoboQuest:搜索、检验与测试的通用物理智能体

RoboQuest: Generalist Physical Agents that Search, Inspect and Test

Liu Renhang · Navonil Majumder · Tej Deep Pala · 1+

多模态(multimodal)基础模型的进展,使其能够胜任多种操作任务。然而,在陌生环境中成功行动,往往要求智能体在观测缺失相关信息时通过交互主动寻找:判断相关物体位置、检查未观测属性,或发现陌生工具的效果。RoboQuest 是面向目标导向具身探索的基准,要求智能体通过物理交互主动获取任务相关信息,利用所得证据调整后续行动,并自主决定何时执行任务。基准包含 10 项移动操作任务,覆盖搜索、基于操作的检验和交互式测试三类不确定性。研究通过统一的视觉—运动接口评估 5 个前沿多模态智能体,并评估在公开的全回合演示上微调的 $\pi_{0.5}$ 策略。最佳智能体仅在 23% 的回合中成功,微调策略几乎无法成功。单独测试任务所需执行技能并直接提供隐藏信息时,智能体能完成大多数动作;失败分析表明,仅少数失败源于执行。智能体常在尚未观察到完成任务所需证据时就过早停止探索,也很少预防或修复探索造成的干扰。此外,大多数模型仍难以通过试错学习。

cs.RO·已译

NeRFifyMesh:从带纹理网格综述优化神经辐射场:用于机器人场景构建

NeRFifyMesh: Optimizing Neural Radiance Fields from Textured Meshes for Robotics Scene Building

Nillan Nimal · Mahboubeh Asadi · Sajad Saeedi

在机器人学中,场景表征对于理解环境与交互至关重要。神经辐射场(NeRF)及其变体作为一种新表征方法,开辟了新的研究前沿。在语义建图与仿真等应用中,机器人研究者希望使用多个 NeRF 模型(每个代表一个物体)来构建场景。尽管已存在大量三维网格模型数据集,但迫切需要工具将这些资产转换为 NeRF 模型,以加速算法开发与测试。该论文提出了一种新流程,通过采样网格几何与纹理人工生成基于点的辐射场作为监督真值,从而将现有网格模型转换为 NeRF 表征。该方法无需基于相机的采样,也无须对原始网格进行多视角渲染来训练 NeRF 模型。大量基准测试表明,该方法在渲染质量上与基线相当。此外,通过构建统一的 NeRF 场景并结合提取的几何进行碰撞仿真,展示了该表征的应用方式。

cs.RO·已译

OpenViTac:面向视触觉策略的统一仿真-真机学习与基准中的统一仿真-真机框架

OpenViTac: Learning and Benchmarking Visuo-Tactile Policies in a Unified Sim-and-Real Framework

Yifan Wu · Qin Li · Nan Min · 4+

触觉反馈为具身智能体提供视觉观测之外的物理信息,使其能更可靠地与真实世界交互。然而,尽管视觉-触觉-语言-动作(VTLA, vision-tactile-language-action)策略发展迅速,目前仍缺乏在仿真与真实世界中统一评估触觉机器人操作的基准。为填补这一空白,提出 OpenViTac,一个面向机器人策略的视触觉操作基准,覆盖仿真与真机。OpenViTac 将富含接触的操作任务归纳为四个与触觉相关的能力维度,并提供仿真-真实世界成对设置,以一致地评估 VLA、WAM 与 VTLA(control)策略。基于该基准,研究了不同触觉表征与融合策略对预训练 VLA 模型性能的影响。相应地,提出 OpenVTLA,一个融合最优表征与融合策略的触觉增强框架。此外,利用成对基准设置研究仿真-真机协同训练(sim-real co-training),分析影响跨域策略学习的因素。OpenViTac 为评估并推进视触觉机器人操作提供了统一平台。

cs.RO·已译

面向探索与导航的语义感知预测建图

Semantic-Aware Predictive Mapping for Exploration and Navigation

Kenneth J. K. Ong · William W. J. Teo

预测建图可通过从部分占据观测推断未观测到的几何布局,辅助机器人探索与导航。然而,仅依赖占据信息的表示难以区分几何形态相近但语义不同的结构。室内门便是典型例子:门在占据图上呈现为被占据的单元格,形态与墙体相似,却暗示观测区域之外可能连接的房间或走廊。本工作研究语义门线索是否能改善此类模糊区域附近的预测性几何占据建图。研究者在 CogniPlan 数据集子集上修改部分占据图,插入由门引发的歧义,同时保持真值布局不变。在此修改数据集上,对比了一个仅使用几何信息的基线模型与一个语义线索模型,后者额外接收门通道输入。评估指标包括全图与 10 像素门区域掩膜上的 L1 误差、F1 分数和交并比(IoU)。全图性能两模型总体相近,但在门局部区域,语义线索模型呈现明显定性提升:L1 从 0.004342 降至 0.000025,F1 从 0.031311 升至 1.000000,IoU 从 0.015905 升至 1.000000。结果表明,语义线索可改善几何观测本身存在歧义的区域内的预测性占据补全效果。

cs.RO·已译

MultiFly:面向标注高效标签迁移与跨模态语义一致性的真实世界多模态航空数据集

MultiFly: A Real-World Multimodal Aerial Dataset with Annotation-Efficient Label Transfer and Cross-Modal Semantic Consistency

Markus Gross · Andreas Greiner · Taehyoung Kim · 4+

MultiFly 是一个面向低空无人机(UAV)语义感知的真实世界数据集,涵盖 RGB、热红外、LiDAR 与雷达四种模态。该数据集采集自四个郊区场景,包含 17,272 帧同步样本,提供 15 类语义类别的逐帧标注,并附带标定数据与 GNSS-RTK/IMU 测量信息。为避免昂贵且不一致的逐模态标注,仅对 115 张 RGB 图像进行手工标注,然后通过共享几何表示将标签传播至全部四种模态。该方法为 17,157 张额外 RGB 图像、17,272 张热红外图像、840M LiDAR 点及 3.4M 雷达点生成语义标签。迁移标注与人工标注(留出验证集)的平均一致率为 89.93%,六组模态对的平均语义一致性为 90.94%。进一步在四种模态上建立语义分割基准,揭示了 LiDAR 稠密数据与雷达稀疏数据下不同的架构行为。综上,MultiFly 为多模态航空感知提供了可扩展的基础,据作者所知,是首个为 RGB、热红外、LiDAR 与雷达提供一致逐帧语义标注的公开真实世界低空航空基准。数据见 https://github.com/markus-42/multifly。

cs.RO·已译

基于霍尔效应的触觉力检测传感器用于机器人辅助微创手术

Hall Effect-Based Tactile Force Detection Sensor for Robot-Assisted Minimally Invasive Surgery

Charles DeLorey · Michael Brockdorff · Adam Metcalf · 3+

机器人微创手术已革新了外科操作方式。然而由于外科医生与手术器械在机械上完全分离,触觉反馈随之丧失。本文提出一种紧凑型力传感器,包含三个毫米级传感单元(taxel),可贴附于机器人手术器械的夹持面。该传感器采用小型化设计,将霍尔效应(Hall effect)传感器与磁体嵌入可变形弹性体接触层内。传感器标定通过 6 自由度(DoF)并联机器人完成。每个 taxel 可检测所施加的法向力与剪切力,平均 RMSE 为 2.133 kPa。标定后的传感器在体模与离体猪组织上完成验证,演示了牵拉过程中的触觉感知以及滑动检测。本工作提出了一种小尺寸、基于霍尔效应的触觉传感器,为力敏感的机器人外科应用提供了感知能力。

cs.RO·已译

面向多样地形四足行走的分层强化学习能耗高效步态适应

Energy-Efficient Gait Adaptation via Hierarchical Reinforcement Learning for Quadrupedal Locomotion Across Diverse Terrains

Ammar Issa · Anubhav Singh · Anton Tsaritsin · 1+

能耗效率是腿式机器人运动控制的关键目标,但要在不同速度范围和地形条件下兼顾低能耗与稳定表现仍具挑战,尤其对步态生成、动作执行和能耗优化紧密耦合的端到端强化学习(RL)策略而言,其对奖励设计十分敏感。研究提出分层强化学习(HRL)框架:由高频策略执行稳定、鲁棒的关节级运动,由低频步态适应模块显式最小化运输成本(CoT)。基于 Isaac 的三阶段训练流程支持零样本仿真到现实(sim-to-real)迁移,并提升跟踪精度、鲁棒性与能效。学习到的分层结构可依据速度自动调整步态:低速采用同侧步(pacing),高速转为小跑(trotting)。仿真结果表明,该方法在广泛指令速度下降低 CoT,同时在平坦、崎不平整和倾斜地形保持鲁棒运动;并在实体 Unitree AlienGo 四足机器人上完成零样本部署,验证实用性。

cs.RO·已译

面向灵巧抓取稳定性预测的时序视觉-触觉学习

Temporal Visuo-Tactile Learning for Dexterous Grasp Stability

Ken Nakahara · Aleksei Buvailik · Prokhor Kotov · 1+

人类凭借指尖触觉反馈几乎能以完美成功率抓取日常物体,而机器人抓取领域的多数工作仍聚焦于基于视觉的平行夹爪抓取选择。该工作系统研究了高分辨率动态触觉传感对灵巧手抓取稳定性预测及模型引导抓取的作用。为此,研究团队使用配备四枚 Digit 360 触觉传感器的多指机器人手,在 200 个物体上采集了 10,000 次抓取试验,记录每次抓取过程中的外部视觉、本体觉与触觉数据流。基于该数据集,训练了端到端时序多模态模型,从抓取前观测预测抓取后稳定性,并比较了不同感知通道及编码骨干。通过对比实验与受控输入消融表明, 加入触觉特别是高分辨率动态触觉可显著提升抓取稳定性预测性能。进一步将所学预测器作为在线稳定性门控部署于真实机器人,基于视觉-触觉模型的引导重抓使执行后的抓取成功率较无触觉门控提升 10.5 个百分点。结果表明,丰富的指尖传感与能够刻画触觉动态的时序模型可在不显式建模接触力的情况下支持多指手的抓取学习,为从触觉经验到稳定灵巧操作提供了一条可扩展的数据驱动路径。数据集公开地址:https://lasr-lab.github.io/dexterous-grasp-stability/。

cs.RO·已译

让任务抽象可执行:面向固定控制器的布局修复

Making Task Abstractions Executable: Control-Aware Layout Repair for a Fixed Controller

Chiyoung Kim · Seungyeon Back · Sumin Shim · 2+

任务抽象可描述预期事件,但其空间布局常使固定智能体与控制器无法完成事件。从给定的结构化任务记录出发,将整任务跟踪(whole-task tracking)、避碰(clearance)与驱动(actuation)需求编译为可审计的仿射布局约束(affine layout constraints)。修复仅修改声明的连续坐标,保留事件顺序、时序、拓扑与控制器不变。最违反行更新给出条件有限证明与净位移界;同编译器二次投影分离表示与优化器。在三个研究者编写的任务抽象上,两套后端均通过全部三个布局的证明,并在每套后端 300 次全新配对 rollout 中全部完成。风险目标扫描还暴露出部分固定事件测试无法仅靠布局编辑满足所选证明。

cs.RO·已译

行为基础模型的行为可操控性基准评测

Benchmarking Behavioral Steerability in Behavior Foundation Models

Minghe Gao · Zhanxi Yan · Jiahui Liu · 4+

行为基础模型(Behavior Foundation Models,BFMs)正成为将人类意图转化为可执行人形行为的新范式。随着这类模型从行为生成迈向通用行为系统,一个关键问题随之出现:它们能否可靠地按照用户意图接受操控?研究引入行为可操控性(behavioral steerability)概念,定义为 BFMs 忠实生成满足用户指定意图之行为的能力。为评估该能力,提出 RoboSteer,这是首个面向 BFMs 行为可操控性的基准。它将行为可操控性组织为条件操控、约束操控与组合操控三级层次,并依托大规模多模态动作语料建立统一评测框架。基于 RoboSteer,对 9 个现有 BFMs 开展首个大规模行为可操控性实证研究。研究认为,行为可操控性不只是控制动作的能力,更关乎具身系统如何把人类意图转化为有目的的行动,并期望 RoboSteer 推动以意图实现为基础的通用具身智能研究。

cs.RO·已译

采用关节专属混合远程驱动构型的全驱动 4 自由度机器指设计

Design of a Fully Actuated 4-DOF Robotic Finger With Joint-Specific Hybrid Remote Actuation

Hyojae Kang · Hyun-mok Jung · Joonho Lee · 4+

提出一种全驱动 4 自由度机器指,采用关节专属的混合远程驱动构型。掌指关节(MCP)由两套协同的刚性连杆传动驱动,近侧指间关节(PIP)和远侧指间关节(DIP)则由各自独立的闭回路压力机传动驱动,传动中包含圆形滚动接触关节(RCJ)。PIP 关节采用较大的传动半径,DIP 关节采用较小的传动半径。RCJ 压力机几何在关节转动过程中保持总压力机环路长度不变;DIP 压力机的布线设计使得在 MCP 姿态固定时,PIP 的运动不影响其差动驱动。论文对远端压力机传动、MCP 连杆机构以及指尖运动学进行了分析建模。在实验中,通过 ArUco 标记追踪测量滚珠丝杠试验台位移,对传动行为进行了定量评估。结果显示,MCP 驱动会在 PIP 与 DIP 传动单元上产生可测量的位移;而在 MCP 固定条件下单独驱动 PIP 与 DIP 时,远端传动之间保持了预期的机械解耦。在 MCP、PIP、DIP 单独驱动下,指尖平均峰值力分别为 21.28 N、9.22 N 和 5.75 N。最后还使用不同形状与尺寸的物体检验了所得到的指尖姿态。

已出中文摘要 24