跳到正文

论文解读

arXiv 论文中文摘要 + 关键要点 · 最近 30 天· 已显示 24 篇

cs.CV·已译

Tetris3D:由可拼合物体构成的 3D 场景生成

Tetris3D: 3D Scene Generation With Objects That Fit Together

Jaeyeong Kim · Jinhyuk Jang · Jongmin Lee · 2+

Tetris3D 是一个面向单图像 3D 场景重建的生成式框架,目标是恢复出在物理与几何层面彼此一致的物体,从而形成一个完整的场景。现有方法通常独立生成各个物体,或仅以隐式方式将它们耦合在一起,难以对相邻物体之间细粒度的空间兼容性提供有效约束。针对这一问题,Tetris3D 显式地将每个物体的生成条件建立在周围物体的几何与物理关系之上,从而使该物体在形状与位姿上均能在场景内保持几何与物理上的合理性。此外,论文还提出了 ComOb 数据集,基于物理仿真构建,包含 120 万个场景,涵盖多种类别物体之间的物理交互,并提供逐物体网格与成对物理关系标注。在合成与真实场景上的系统实验表明,Tetris3D 即使在交互区域被遮挡时,也能恢复出连贯一致的物体形状与位姿,并在生成质量与物理稳定性两个维度上均达到当前最优水平。

cs.CV·已译

永不回望:理解自我中心视频中 3D 物体记忆的持久性

Never Look Back: Understanding Persistence in 3D Object Memory from Egocentric Videos

Shravan Chaudhari · William Paul · Suchi Saria · 2+

在日常生活中,我们会遇到一些当时看似无关、之后却变得重要的物体。即使事前并无需求,我们仍能记起某物放在何处或容器内装着什么。本文研究具身助手如何通过观察人的日常活动,从自我中心(egocentric)视频中构建类似的记忆系统,并提出 Ledger——一种持久化的 3D 物体记忆,融合了物体位置、其历史轨迹以及上下文描述。该系统在整个录制过程中关联同一物体的多次观测,并在物体离开视野后仍予以保留,即便人物从未触碰过它。它将每个物体的观测按其静止位置进行聚类,仅在多次重复证据后才记录一次移动,以降低定位噪声的影响。简短的描述则保留诸如容器内物品或支撑面等细节。这些记录可在后续回答空间类问题时直接使用,无需再访问原始图像或视频。在 HD-EPIC 上,该记忆将准确率由 29.7% 提升至 42.6%;在 UCS-Bench 上由 33.8% 提升至 38.5%;在 Ego4D 物体定位任务上,返回预测的中位误差为 0.99 米。分析表明,时间持久性、上下文描述与检索三者起到互补作用。对 100 段由多个场景拼接而成的视频流的进一步实验揭示了检索与构建两个环节的失败模式;逐场景构建可部分恢复因场景切换而损失的性能,缩小其与单场景流之间的差距。

cs.CV·已译

GRACE:面向生成的高效视频生成潜空间压缩方法

GRACE: Generation-aware latent compression for efficient video generation

Jiyoung Kim · Paul Hyunbin Cho · Jisu Nam · 4+

高压缩率视频自编码器可通过大幅减少 token 数量加速视频扩散模型。然而,压缩比升高会降低重建质量,恢复质量需要更多通道,而更多通道会拖慢 DiT(Diffusion Transformer)收敛,且训练成本高昂,自编码器的潜空间也偏离 DiT 原始训练分布。对 DiT 原训练所用的自编码器做压缩虽能保持兼容性,但仅以重建为目标的优化仍会改变潜空间分布。为此,论文提出 GRACE(Generation-Aware Latent Compression for Efficient Video Generation),一个两阶段框架,可在保持与预训练 DiT 兼容的前提下压缩预训练视频自编码器。方法冻结基潜空间,学习残差潜空间以补充强压缩下丢失的信息,并在冻结 DiT 特征空间中对齐压缩后的潜空间与原始潜空间,使自编码器针对生成优化。随后对 DiT 做轻量微调并采用非对称去噪流程,先去噪基再处理残差。GRACE 将 Wan2.1-I2V-14B 的 token 数量降至 1/8,在 480×832×81 分辨率下延迟降低 11.1×,在 VBench 上生成质量与压缩前预训练管线持平。

cs.CV·已译

视频条件生成的联合二维-三维手部运动恢复

Video-Conditioned Generative Joint 2D-3D Hand Motion Recovery

Chen Xu · Yunqi Li · Binbin Huang · 3+

从视频中恢复准确的三维手部运动仍面临挑战,频繁的遮挡与不完整的视觉观测使得逐帧姿态估计不可靠且时间上不一致。针对这一问题,提出 JoHan,一个统一的生成框架,直接从视频序列恢复手部运动,不依赖中间逐帧姿态预测。该模型从头学习手部二维与三维局部姿态序列的时间演化与跨表征对应关系,联合生成对齐的二维与三维序列。生成的二维轨迹利用二维图像中的直接空间与时间线索,引导后续生成式三维运动重建;所学运动先验促进时间一致性。二维-三维对应关系进一步用于恢复手部相对相机的全局位置与朝向。在多个具有挑战性的基准测试上的实验表明,该方法在局部手部姿态与相机空间重建上的精度与效率均明显提升,所捕手的运动动态显著更平滑,同时保持较高的逐帧姿态精度。

cs.CV·已译

QuadTok:用于自回归图像生成的四叉树视觉分词器

QuadTok: Quadtree Visual Tokenizer for Autoregressive Image Generation

Yucheng Mao · Zeyuan Chen · Xiaojun Shan · 4+

QuadTok 是一种面向视觉分词与自回归图像生成的新框架。相较于传统基于二维网格或一维 token 序列的方法,该工作提出分层四叉树结构,在二维空间绑定与一维序列灵活性之间架起桥梁。QuadTok 分词器将表征容量动态分配给视觉复杂区域,对同质区域保持粗粒度分辨率。相较于固定的 256 token 网格,在 ImageNet 上训练的分词器在 ImageNet 数据上可节省约 10% 的 token,零样本迁移到 COCO 数据集时节省约 9%,同时保持相当的重建保真度。此外,树结构天然引入的因果性可直接支持自回归图像生成:以生成前给定的四叉树拓扑为条件,947M 参数的 GPT 风格生成模型在 ImageNet 256×256 基准上取得 2.08 gFID。借助四叉树保留的强空间相关性,QuadTok 生成器还具备零样本空间可控图像生成能力。代码见 GitHub 仓库。

cs.CV·已译

自动研究(AutoResearch)在光伏板分割中的启示

Insights from Autoresearch for Solar Panel Segmentation

Justinas Lekavicius · Kursat Komurcu · Valentas Gruzauskas · 1+

研究 AutoResearch 协议:由代码语言模型在一小时 GPU 预算下编辑训练程序,仅当验证集交并比(IoU)提升时才保留改动。该协议被应用于固定真实图像划分上的光伏板分割任务,以 DeepLabV3-ResNet-50 为冻结基线模型。共开展三组、每组 24 次实验,分别使用 Gemma 4 12B、Qwen3-8B 等模型,均超过各自的一小时基线,但被保留的修改无法跨硬件迁移。基于 Qwen3-8B、仅使用真实图像训练的方案在测试集上取得 0.836 的 IoU,优于参考 GAN 数据增强方案的 0.833。

cs.CV·已译

基于明场成像与深度学习的无标记细胞计数与活力预测

Label-free cell counting and viability prediction with brightfield imaging and deep learning

Amir Reza Vazifeh · Christian Zeigler · Sornanathan Meyyappan · 2+

细胞活力评估是细胞培养系统的核心需求,在生物制药生产和临床试验中应用关键。传统上通过向样本添加膜不通透性染料(即染色)来测量,利用染料区分膜受损细胞与完整细胞。然而染色存在若干局限:(a)化学试剂会干扰被测细胞的正常生理过程;(b)对于膜完整性仅部分丧失的细胞,难以明确判定其活力状态;(c)使用荧光染料时,光漂白会随时间降低测量精度;(d)染色无法原位或实时进行。研究表明:(1)明场成像下捕获的已染色细胞包含足以区分活细胞与死细胞的图像特征;(2)未染色明场成像细胞与已染色细胞呈现相似的图像特征,使基于染色细胞训练的模型可推广至未染色样本。据此报告 ViabiLens 的开发与验证,这是一款面向无标记细胞活力分析的 AI 辅助软件。ViabiLens 将用于定位单个细胞的细胞检测模型与用于活/死预测的卷积神经网络(CNN)分类器相结合,并配备基于 UMAP 的交互式可视化浏览器,以探索样本中各细胞。在涵盖广泛活力条件的中国仓鼠卵巢(CHO)细胞上,以基于荧光的参考测量为基准,ViabiLens 在未染色样本上达到 2.68% 的平均绝对误差。同时发布了一个面向无标记细胞活力分析的基准数据集以促进后续研究。

cs.CV·已译

MORCA:面向视频扩散加速中自适应缓存复用的离线到在线强化学习

MORCA: Offline-to-Online Reinforcement Learning for Adaptive Cache Reuse in Video Diffusion Acceleration

Yuxiang Xiong · Ruiyan Wang · Wenqiang Wang · 4+

扩散 Transformer(DiT)在视频合成中表现优异,但其迭代去噪过程导致推理延迟较高。为解决此问题,缓存作为一种有效的加速策略被提出,利用去噪过程中的跨步冗余。现有动态缓存方法通常估计每一步缓存复用所引入的误差(逐步误差),而本文关注的是缓存复用对最终生成视频造成的质量损失(终端误差)。研究表明,逐步误差与终端误差并不直接对应,潜在信息有助于捕捉二者关系,从而指导缓存决策。此外,现有基于阈值的方法无法提供精确的加速控制,难以满足用户指定的实际加速目标。针对上述局限,本文提出 MORCA,一种通过离线到在线强化学习训练的缓存调度框架,在用户指定的加速目标下进行潜在感知的复用与重计算决策。在不同视频生成模型与多种目标加速比上的大量实验表明,在相近的计算预算下,MORCA 比现有最优缓存方法实现了更高的生成保真度。代码开源于 https://github.com/x10ngyx/MORCA。

cs.CV·已译

ECHO:人体物体携带行为的具身相机观测数据集

ECHO: Embodied Camera Observations of Human Object Carrying

Xuefei Sun · Lorin Achey · Kali Hamilton · 4+

具身智能体与辅助智能体不仅需要识别物体,还需根据环境布局与居住者习惯推理物体的合理放置位置。现有 RGB-D 扫描数据集重建静态房间但缺乏人体活动记录,而人-物交互数据集虽然捕捉运动却缺少可导航的完整重建场景及物体自然目的地的真值标注。为解决这一问题,论文提出上下文物体放置(contextual object placement)基准任务:在观测到的物体携带事件中预测物体的目的地位置,并构建了 ECHO(Embodied Camera observations of Human Object carrying)大规模合成数据集。ECHO 将室内场景的稠密 RGB-D 扫描与具身人体携带日常物品前往符合上下文的目的地的录像配对,是首个同时包含重建场景、人体活动、自然语言与上下文放置标注的公开数据集,涵盖 115 个 HM3D 场景的 159 层楼面,共 3,805 条人工标注事件,涉及 198 个不同物体。每层楼面提供完整 RGB-D 扫描及人工标注的房间标签与表面列表;每条事件包含同步的 RGB-D 遭遇片段、6-DoF 相机/人体/物体轨迹、起止表面、动作描述及一条人工撰写的上下文语句。基于输入掩蔽探针与端到端基线的实验表明,没有任何单一输入模态足够完成该任务,凸显了对场景结构、人体活动与上下文知识进行联合推理的必要性。

cs.CV·已译

通过视觉-语言模型响应特征检测对抗图像

Detecting Adversarial Images through Response Profiles of Vision-Language Models

Arash Vashagh · Roozbeh Razavi-Far

对抗扰动可以改变冻结状态的视觉-语言模型(VLM)的预测结果,同时使其置信度和图像-文本相似性模式表面上看起来仍然合理。本研究探讨能否基于图像与一组通用语义提示之间更广泛的交互方式来识别对抗输入。检测器利用类别级统计量、提示之间的关系、相对干净参考分布的偏差,以及在弱图像变换下的稳定性来汇总这些响应,生成一个紧凑的响应特征,并由一个轻量级模型进行分类,而 VLM 保持固定不变。该方法在多个公开图像数据集、多种 CLIP 风格的视觉骨干网络,以及涵盖基于梯度的、基于优化的、自动化的和空间性的多种攻击上进行了评估。检测器在针对特定攻击的设定下表现出强大的判别能力,并在面对训练中未见的攻击时仍保持显著性能。在受控的检测器专属协议下,响应特征表示优于所评估的嵌入几何基线。进一步分析表明,各特征组提供互补信息,且该方法在提示配置变化下仍然有效。同时考察了推理成本以及针对检测器感知型自适应攻击的鲁棒性。总体而言,结果表明跨语义提示的响应模式为冻结 VLM 中的对抗图像检测提供了一种有用的互补信号。

cs.CV·已译

SGF+:解耦自回归视频生成的梯度流

SGF+: Decoupling Gradient Flows for Autoregressive Video Generation

Zihan Su · Junhao Zhuang · Yaowei Li · 4+

自回归视频生成在预测未来帧时,既要对当前帧去噪,也需写入键值表示作为上下文。然而,这两种角色通常共享参数,其梯度呈现不同模式并存在系统性的负对齐,妨碍视觉质量与时序一致性的联合优化。Self Gradient Forcing Plus(SGF+)为上下文写入与去噪分配独立参数,同时通过因果注意力保持二者交互;两种角色均使用原始生成目标联合优化,不引入辅助损失,并以上下文写入对未来预测的贡献提供监督。该方法在逐帧与分块生成中均提升了视觉质量和长程一致性,无需额外视频训练数据或延长训练周期。仅在 5s 滚动序列上训练后,SGF+ 无需长视频微调即可连续生成最长 24 小时的视频。结果表明,面向角色的参数化是实现高质量自回归视频生成与原生长程外推的有效设计原则。

cs.CV·已译

GraphRectify:基于图结构的对抗样本检测器跨神经网络迁移

GraphRectify: Graph-Based Transfer of Adversarial Example Detectors Across Neural Networks

Arash Vashagh · Roozbeh Razavi-Far

对抗样本检测器通常与训练时依赖的分类器骨干网络紧耦合,当被保护模型被替换或升级时难以复用。由于不同网络产生的中间表示互不兼容,直接将检测器跨骨干迁移十分困难。本文提出 GraphRectify,一个基于图结构的框架,用于在分类器骨干之间迁移对抗图像检测器。GraphRectify 学习分类器中间特征的结构化表示,再将新骨干产生的表示适配到原始模型上训练得到的检测器,从而实现检测器复用。实验在多个数据集、多种骨干架构与对抗攻击下进行评估,其中包括同时针对分类器和检测器的检测器感知自适应攻击。在完整评估矩阵中,GraphRectify 的聚合 ROC-AUC 高于在新骨干上从零训练检测器以及所对比的迁移消融方案。在不同骨干家族之间的迁移以及数据充足时,优势尤为明显;而在极度受限的数据设置中,从零训练仍具竞争力。结果表明,对抗检测知识能够在异构分类器架构间迁移复用,无需在被保护骨干变化时重新学习。

cs.CV·已译

Rubix:通过分配几何实现无需对应关系的全局点集对齐

Rubix: Global Correspondence-Free Point Set Alignment through Assignment Geometry

Subhransu S. Bhattacharjee · Dylan Campbell · Rahul Shome

Procrustes-Wasserstein 对齐方法在没有给定对应关系的情况下联合估计匹配与旋转,但交替最小化容易停留在次优解。Rubix 在平方欧氏损失下全局求解等权平面问题。两个中心化 n 点集之间的每个匹配 σ 定义一个复相关量 z_σ = Σ_i x̄_i y_{σ(i)},其凸包构成置换多边形(permutation polygon):支撑顶点给出固定旋转下的最优匹配,最远顶点给出全局对齐。论文证明了当 n≥2 时凸包顶点数恰为 n(n-1),回答了 Rote 提出的旋转-分配开放问题。在精确算术下,分配查询可在 O(n⁵) 运算内恢复该多边形。基于分配的界通过分支定界将该方法推广至三维旋转及在给定平移下的部分匹配。在 MPEG-7 形状对的计时测试中,Rubix 平均 12 ms 内达到所有数值参考精度,比同等精度的旋转网格快 50 倍。其距离度量在真实 3D 扫描的重力对齐匹配、形状检索与含噪晶体分类任务上均优于交替最小化。

cs.CV·已译

面向交错多模态生成的自校正优化

Self-correction Optimization for Interleaved Multimodal Generation

Xin You · Zhiwei Ning · Zukai Chen · 4+

多模态大语言模型(MLLMs)在视觉理解与生成方面取得显著进展,但生成图文交错内容仍是难题,因为其需要紧密耦合的多模态理解与生成能力。现有 MLLM 虽提供了可行方案,大多通过增广数据进行额外训练,计算开销大,且在视觉主体保持、时间一致性以及物理合理性方面仍存在局限。本文提出自校正优化(SCO),一种无需训练即可实现一致性交错生成的有效方法。SCO 将无分类器引导(classifier-free guidance)的更新作为参考,在新事件约束与状态保持约束两类互补约束下进行最小化自校正:新事件约束促进图文序列间的时间一致性,状态保持约束在后续生成步骤中维持视觉主体的连贯性。在具有挑战性的交错多模态生成 benchmark 上的实验表明,SCO 在时间连贯性与视觉主体保持上带来显著提升。此外,SCO 可扩展至视频生成,改善对物理基础过程的建模,包括机器人操控与长程手工艺任务。

cs.CV·已译

高斯密度溅射网络

Gaussian Density Splatting Network

Miao Shang · Yabin Wang · Xiaopeng Hong

提出一种新的人群计数方法 GDSNet (Gaussian Density Splatting Network)。与依赖传统网格密度图、对空间分辨率敏感的方法不同,GDSNet 将人群表示为连续 2D 高斯基元的叠加。两个核心贡献:其一,引入基于控制点的拟合机制来组织高斯参数预测,设计一套方法分配控制点以定义局部区域,从这些区域池化特征回归每个基元的参数;其二,将可微分高斯溅射 (Differentiable Gaussian Splatting) 框架适配到计数任务中,每个基元由几何参数与一个标量密度质量参数化,通过可微分渲染的密度图进行空间匹配实现端到端训练,自然同时提供局部密度监督与全局计数优化。在 4 个标准基准上的大量评测显示 GDSNet 一致优于当前最优方法。

cs.CV·已译

MOTIP2:面向端到端多目标跟踪的空间先验

MOTIP2: Spatial Priors for End-to-End Multi-Object Tracking

Beno\^it Roussel · Damien Bouet · Liming Chen · 1+

端到端多目标跟踪器已在关联困难基准上缩小了与经典跟踪-检测范式的差距,但仍会犯一些经典跟踪器绝不会犯的、在空间上不合理的错误,例如将同一身份分配给画面两侧的物体。模型本可学会规避这些错误,但跟踪标注稀缺,因此本文显式编码空间先验,同时保持完全端到端推理、无事后关联。提出了三类空间先验,分别作用于数据、损失与表示阶段。空间 ID 切换(Spatial ID Switches)在轨迹置换时偏向空间上重叠的物体,缩小训练与推理混淆之间的错配;空间 ID 损失(Spatial ID Loss)按框距离缩放每个身份的惩罚,使远距离切换代价更高;空间锚点(Spatial Anchor)为每个轨迹 token 注入帧位置,作为显式的空间线索。三类先验在 MOTIP2 中实例化,该方法由 MOTIP 适配并构建于实时 DEIM 检测 Transformer 之上。在不使用额外数据训练时,主模型 MOTIP2-L 创下新的最优水平:DanceTrack 上 73.4 HOTA,SportsMOT 上 76.0,PersonPath22 上 71.1 IDF1。MOTIP2 是一个涵盖速度-精度权衡的模型族:轻量版 MOTIP2-S 以超过 3 倍速度匹配原 MOTIP,MOTIP2-X 在 DanceTrack 上达到 74.8 HOTA。

cs.CV·已译

面向自动驾驶的视觉-语言-动作显式几何思维链

Explicit Geometric Chain-of-Thought for Vision-Language-Action in Autonomous Driving

Xingtai Gui · Yucheng Zhou · Dongqian Guo · 3+

视觉-语言-动作(VLA)模型已成为自动驾驶的一种有前景的范式。然而,现有 VLA 模型仍存在一个根本性错配:驾驶行为需要精确的 3D 几何线索,而视觉-语言的理解与推理基本在 2D 语义空间中进行。本文提出 GeoCoTDrive,一种面向规划任务的显式几何思维链框架,将几何信息以规划为导向进行锚定。GeoCoTDrive 遵循"先用 2D 思考,再用专用 3D 先验驾驶"的范式:首先锚定与决策关键线索对应的 2D 区域,然后在这些区域内从几何基础模型中采样特征,检索局部化的 3D 先验。这些局部几何特征被交错插入自回归上下文,以支持轨迹生成。为监督该过程,本文引入规划相关锚定(planning-relevant grounding)这一新的区域级锚定任务,聚焦于直接影响自车规划决策的局部空间线索,并构建了 PlanningGrounding 数据集,使 VLA 具备面向规划的锚定能力。在多个端到端自动驾驶基准上的实验表明,GeoCoTDrive 持续提升了安全关键场景下的规划性能,验证了显式几何思维链过程对基于 VLA 的规划的有效性。

cs.CV·已译

并行适配器组合实现实时联合音视频生成

Real-Time Joint Audio-Video Generation by Parallel Adapter Composition

Jingyu Li · Xiaoxiao Xiang · Yiwen Guo

面向实时交互式生成的联合音视频扩散变换器通常需要两项关键改造:块自回归注意力,使帧在整段视频完成前即可输出;少步采样,使每个块计算开销低。传统流式视频方案通过链式管线获得这两项能力——先蒸馏双向教师为因果学生,再蒸馏为少步模型,或顺序相反。该链路的每一阶段都对前阶段产出的权重进行微调,后期目标可能破坏既有能力。受模型融合思路启发,本文证明在打包的音视频主干上,两项能力可并行获取:在冻结的主干上训练一个因果适配器,并复用现成的少步适配器提供少步能力。由于二者修改的是不同的功能轴,论文预测并验证其权重更新方向近似正交,训练中未施加任何显式正交约束。正交更新可直接叠加而不互相干扰,因此并行组合即为直接求和。推理时两个适配器简单相加,无需联合训练,即可得到与双向教师图像质量相当的少步流式音视频生成。相比链式基线,组合模型在多数指标上持平或更优,证明并行组合的实用性。最终流式系统可实时生成联合音视频,480×832 分辨率下约 26 fps(无需量化),并能在 30 秒内持续生成且图像质量稳定。

cs.CV·已译

Position Forcing:自条件化三维生成

Position Forcing: Self-Conditioning 3D Generation

Ziheng Ouyang · Zeqiang Lai · Jiarui Chen · 4+

近期的单阶段三维生成模型普遍采用 VecSet 表示,将三维形状编码为无序的潜在 token 集合。然而,与提供显式位置引导的两阶段方法相比,这类模型必须在去噪过程中隐式推断 token 位置,从而限制了生成质量。研究观察到,尽管缺乏显式的位置条件,VecSet token 仍保留可恢复的空间对应关系。基于此,提出 Position Forcing,一种基于位置的自条件框架。在去噪过程中,Position Forcing 从当前干净潜在估计中恢复 token 位置,按去噪阶段以逐级更细的分辨率进行量化,并将得到的位编码反馈给扩散 Transformer。这种逐级细化的位置反馈为每个去噪阶段提供合适粒度的空间引导,沿由粗到精的轨迹引导形状生成,在无需单独位置生成阶段的情况下显著提升生成质量。实验表明,Position Forcing 在单阶段三维生成方法中取得优异表现,并超越多种具有竞争力的多阶段方法。

cs.CV·已译

何时解配对:医学视觉上下文学习中配对依赖性的调控

When to Unpair: Regulating Pairing Dependence in Medical Visual In-Context Learning

Cheng Wan · Chenjun Li · Qingyu Zhao

视觉上下文学习(visual in-context learning, ICL)天然契合标注稀缺的医学影像场景:它利用若干带标签的支持图像—标签对展示输入到输出的映射,标签整体指示所请求的任务。为诊断模型对单个配对的依赖程度,本文设计了一种测试时错配(test-time derangement)方法:在保持查询图像、支持图像集合及标签多重集不变的情况下,将每个支持标签重新分配给另一张支持图像。由此产生的配对差距(pairing gap,即打乱配对与匹配配对的性能之差)表明,四款已发布的模型在不同程度上均存在配对依赖。进一步分析一个此类配对训练的模型发现,即便使用真实未篡改的支持集,仍存在支持相关的伪影区域与病灶尺寸偏差,且对支持标签错位敏感。为调控此种依赖,本文提出晚期解配课程(late unpairing curriculum, LUC):训练初期使用匹配配对,随后施加随机解配,将同一回合内每个支持标签替换为另一支持样本的标签。LUC 在两类骨干网络上几乎完全弥合配对差距,同时在所有评估任务类型上保持或提升匹配支持下的性能,优势还延伸至未见过任务与跨数据集回合,并减轻上述失效模式。在 BraTS 全肿瘤分割任务上,匹配支持 DSC 由 0.733 提升至 0.857,差距由 −0.184 缩至 −0.008。对一款已发布模型进行短时随机解配微调也可缩小差距。若将同等数量的解配训练轮次前置,即采用反向课程,则仍留下较大差距。这表明配对依赖由训练顺序塑造,而非仅由解配训练量决定。

cs.CV·已译

人脸去标识化到底有多隐私?一项对比研究

How Private is Private? A Comparative Study for Face De-Identification

Hui Wei · Hao Yu · Hui Kuurila-Zhang · 1+

人脸去标识化(FDeID)已成为关键的隐私保护技术,但对其评估仍十分碎片化。现有评测协议在指标、数据集和标注覆盖度上彼此不一致,导致面向不同效用维度(如关键点与表情保持)的方法在不同基准与不同指标下被报告,方法间无法横向比较。本文从数据与指标两方面重新审视 FDeID 评估。在数据侧,提出 UtilFace:一个经过身份感知清洗、超分辨率增强与分层筛选而构建的人脸基准,具有人口统计学均衡、身份多样度高的特点,整合自四个大规模人脸数据集。在指标侧,提出 HiFD,一种分层人脸去标识化指标。该指标在一致性范式下统一身份抑制、多层级效用保持与图像质量:每个组件由预训练估计器在原始人脸与其去标识化版本上的输出计算,直接量化身份被抑制的程度以及下游可感知效用保留的程度。HiFD 将面部信号组织为三级效用层次:宏观线索(L1)、微观线索(L2)与不可感知线索(L3),并通过加权调和均值将五个组件聚合为单一可解释分数,支持面向应用的可配置加权。基于该统一协议,对对抗式、GAN 式与扩散式方法开展全面对比研究,揭示在现有协议下不可见的权衡关系与失败模式。基准与评测工具包均已开源,以促进隐私保护人脸分析领域系统、可复现的研究。

cs.CV·已译

性能代价几何?面向细胞与细胞核实例分割的可持续性感知性能指标(SAPI)

Performance at What Cost? A Sustainability-Aware Performance Index for Cell and Nucleus Instance Segmentation

Eiram Mahera Sheikh · Alaa Tharwat · Wolfram Schenck

用于细胞与细胞核实例分割的预训练模型在架构、预训练数据与目标、参数量、推理策略、适配需求、后处理流程以及算力开销等方面差异显著。大型预训练模型与基础模型因其强大的零样本(zero-shot)能力而被广泛采用,但也带来了更高的能耗、显存占用、算力需求、适配代价以及运行阶段的碳排放。这些额外开销能否被分割性能上的实质提升所合理抵消,目前尚不明确。为回答这一问题,本文提出可持续性感知性能指标(SAPI),一个可配置的复合指标,将分割性能、能耗与模型规模纳入统一衡量。在 6 个 CellBinDB 数据集上,对 19 个预训练模型与基础模型进行零样本推理评测;并对 16 个可微调模型分别采用冻结编码器与全模型微调两种少样本(few-shot)适配策略进行评估。GPU、CPU 与 RAM 的能耗通过软件监测工具估算。结果显示,模型规模更大、算力开销更高并不必然带来成比例的分割质量提升;少样本适配虽使部分模型受益,但收益与资源代价在不同架构、数据集与适配策略之间差异显著,导致基于 SAPI 的排名与仅基于性能的排名出现明显差异。本研究为分割模型的综合比较提供了实用框架,有助于在生物医学图像分析中以更易获取算力、更环境负责的方式进行模型选型。

cs.CV·已译

从数字人交互到物理驱动人形机器人技能:面向交互生成器的物理后训练

From Digital Human Interactions to Physics-Based Humanoid Skills: Physics-Grounded Post-Training of Interaction Generators

Kerui Chen · Jianrong Zhang · Kai Lv · 1+

近期方法在生成两个人形机器人之间的交互方面取得进展,主要依赖基于物理的跟踪策略将参考动作转化为可执行轨迹。然而跟踪能力有限,限制了可成功执行的参考动作范围,降低了数据利用率。此外,即使跟踪成功,也不保证物理上合理的响应或对预期交互的忠实还原。本文提出 DIGHT,一个将数字人交互生成器与人形机器人跟踪策略耦合的协同自适应框架。DIGHT 首先在固定跟踪器下于仿真中执行多个文本条件化的交互候选动作,再依据回放结果构建物理可信偏好,涵盖一般可执行性与交互忠实度。本文将这些信号解耦为物理解耦扩散直接偏好优化(DPO),分别对各准则进行监督而不微分仿真器。为提升可执行性,从跟踪误差、摩擦与漂浮构造偏好对。为提升交互忠实度,提出引入接触保真度等接触反馈,针对接触发生、位置、时长与力幅构建偏好。对齐后的生成器为跟踪器提供参考动作以微调,增强生成与物理执行的兼容性。大量实验表明,该方法不仅提升了生成动作的物理可信度,也实现了仿真中更可靠、更忠实的人形机器人交互。

cs.CV·已译

科学图像的单样本自适应分割

One-Shot Adaptive Segmentation For Scientific Images

Tejaswi V. Panchagnula · Allison M. Davis · Fengqing Zhu

科学图像分割方法依赖大量标注与任务专属训练,难以适配不同成像模态与实验条件。提出一种免训练的单样本(one-shot)框架,仅利用一张带标注的参考图像即可将视觉基础模型适配到目标任务。该框架融合 DINOv3 表征与背景自适应特征正交化,以抑制与伪影相关的特征方向,再通过余弦相似度定位候选区域,最后由 SAM 完成分割。在红细胞显微成像、结构光照池沸腾以及胸部 X 光片三个数据集上的评估表明:相对最强基线,显微与池沸腾数据集的 mean IoU 分别提升 5.91% 和 78.62%,在胸部 X 光片上达到相当性能。结果证明,单样本参考条件化能够将通用视觉模型有效适配到专业科学分割任务中。

已出中文摘要 24