新闻详情

新闻详情

首页 / 资讯中心 / 详情

不训练也能泛化:用预训练 ViT 特征做视觉伺服,扰动场景收敛率反超经典 IBVS 31%

发布时间:2026/10/1 8:43:31来源:尧图网络
不训练也能泛化:用预训练 ViT 特征做视觉伺服,扰动场景收敛率反超经典 IBVS 31%
不训练也能泛化用预训练 ViT 特征做视觉伺服扰动场景收敛率反超经典 IBVS 31%原文ViT-VS: On the Applicability of Pretrained Vision Transformer Features for Generalizable Visual Servoing作者Alessandro Scherl、Stefan Thalhammer、Bernhard Neuberger、Wilfried Wöber、José García-RodríguezarXivarXiv:2503.045452025代码与仿真环境https://alessandroscherl.github.io/ViT-VS/图注左侧是把期望图像和当前图像交给 ViT 做特征匹配彩色点连线就是匹配上的对应点本例目标是白杯子右侧是把这套对应关系直接接到机械臂做抓取——注意杯子是没见过的同类实例这就是本文所强调的类别级泛化。视觉伺服visual servoing的传统做法是手工特征 控制律灵活但脆弱学习类方法鲁棒但要为每个物体、每个场景专门训练。这篇 ViT-VS 给出的路线是第三条直接拿预训练好的视觉 TransformerViT特征当匹配器不做任何任务/物体特定训练就在无扰动场景拿到 100% 收敛率在扰动场景反超经典 IBVS 相对 31.2%并完成了工业抓箱与类别级抓取。研究背景与现有方法不足视觉伺服的目标很朴素只给一张参考图让机器人把末端精确定位到目标位置上。它天然适合下游操作任务抓取、插接、装配但用什么特征来驱动控制一直是个两难选择经典方法IBVS 手工特征SIFT、ORB、AKAZE 这类描述子不需要任何训练理论上具有普适性。但论文指出它们在遮挡与环境变化面前表现不佳一旦加入图像扰动颜色抖动、随机擦除、高斯模糊SIFT 的收敛率从 89.6% 掉到24.0%AKAZE 从 89.0% 掉到 58.0%最好的 ORB 也只有 58.4%。此外它们还普遍存在收敛域小的问题——初始位姿偏太多尤其是相机绕光轴大幅旋转就直接发散。学习类方法PBVS-CNN、DMLVS、DVS 等鲁棒性显著更好DMLVS 微调后扰动场景 76.0%无扰动 100%但代价是必须做任务/物体特定的微调换一个物体或场景就要重新采集数据、重新训练而如果完全不微调DVS无扰动场景的收敛率只有9.8%。所以核心矛盾是通用性与鲁棒性能不能同时要论文的假设是如果特征本身具备强大的语义理解能力这是大规模预训练 ViT 的强项那么通用性就不再必然意味着脆弱。核心创新点1用冻结的预训练 ViT 做特征提取零微调。配置相当克制DINOv2ImageNet-1k 预训练、ViT-Small/14架构、取第 11 层的 token 特征、patch 与步长均为14 像素。特征分箱feature binning沿用 [23] 的做法用β1 或 β2两档层次输入分辨率在 224×224 到 308×308 之间选择——默认配置是308×308 像素 β1。整个模型不做任何 finetune。2一条完整的匹配流水线ViT Correspondences。每个控制周期两帧图像分别过共享权重的 ViT 得到 token 特征 → 用 CoSim 计算相似度 → 构建循环距离图cyclic distance map→ 依据阈值本文取 1选出24 对最优对应点再交给 IBVS 控制律解算速度指令。因为用的是语义相似 几何一致性双重准则它在颜色/纹理被扰动时仍能找到合理对应这也是鲁棒性提升的主要来源。3初始旋转补偿把开局偏太远变成先认一遍方向。这是收敛率提升的关键机制在进入控制回路之前先对 0°、90°、180°、−90° 四个旋转假设各做一次匹配用 CoSim 的均值打分挑出最优旋转假设论文的实物精细实验里最优就是180°。消融数据非常直接带补偿时无扰动/扰动收敛率为 100.0% / 76.6%去掉补偿只有 83.8% / 57.2%。4速度稳定化 轨迹正则化。原始框架的速度指令抖动明显论文引入轨迹平滑参数 α并系统评估了 α ∈ [0.5, 0.9]α 越小轨迹越短长度比更低但末端定位误差变大最终选α 0.8作为平衡点。实测中这一步有效抑制了运动抖动、让轨迹更平滑。5开源。代码与仿真的视觉伺服环境都公开便于复现与横向对比。图注左边是控制回路IBVS 控制 → 速度稳定化 → 机械臂 → 相机回到 ViT 对应匹配“First Iteration?” 分支接的就是初始旋转补偿黄色框。右边把两件事摊开讲上半部分是匹配流水线Embedding → 相似度 CoSim → 循环距离图 → 选点 K下半部分是初始旋转补偿对 4 个旋转假设分别匹配并按 CoSim 均值打分。这张图基本就是全套方法。图注右侧图像被加入了明显扰动色偏、噪声、模糊但左侧期望图与右侧扰动图之间仍能连出大片一致的对应点连线——这正是语义特征比手工描述子更抗扰动的直观证据。实验平台仿真环境复刻自 DMLVS虚拟 Intel RealSense D435i 相机640×480目标是一张60×80 cm 的好莱坞海报按 [12] 的做法生成500 个不同的初始相机位姿——位置在期望位姿周围 1.2 m×1.2 m×0.3 m 的长方体内采样视点分布在距海报中心 8/16/24/32 cm 的四个同心圆上绕光轴随机旋转 ±120°期望位置设在距海报中心 0.6 m 高度处。由此得到的平均初始定位误差为 46.42±16.99 cm、初始姿态误差 74.12±27.71°。扰动设置与 DMLVS 代码库一致Torchvision 的 ColorJitter亮度 0.6、对比度 0.4、随机擦除概率 0.5、面积比 0.02–0.33、长宽比 0.3–3.3、高斯模糊均值 0、σ0.05。机器人平台移动操作平台 UR5 机械臂装在 MiR100 移动底盘上工业操作实验用自研夹爪与Robotiq 2F-85夹爪所有实验统一使用Intel RealSense D435i相机。算力分工仿真在 NVIDIARTX 4060 Ti 16 GB Intel Core i7-13700K 上完成机器人实验在 NVIDIARTX 4070 Mobile AMD Ryzen 9 7940HS 上完成后者也是帧率测试的平台。评估指标收敛率速度接近零且初始位置/姿态误差下降超过90%判据沿用 [12]、末端定位/姿态误差、绝对位姿误差 APE、轨迹长度比执行轨迹与理想轨迹之比、帧率。对比基线经典类 SIFT/ORB/AKAZE IBVS含特征匹配的公平复现、学习类 DMLVS有/无微调、PBVS-CNN、AEVS、DVS。主要结果收敛率Table I无扰动 / 有扰动方法是否微调无扰动收敛率扰动图像收敛率AEVS否33.6%–PBVS-CNN否 / 是75.6%36.8%DVS否9.8%–SIFT IBVS否89.6%24.0%AKAZE IBVS否89.0%58.0%ORB IBVS否98.6%58.4%经典最好DMLVSK50已微调是100.0%76.0%ViT-VS无旋转补偿否83.8%57.2%ViT-VS本文含旋转补偿否100.0%76.6%两条最有价值的结论1无扰动下 100% 收敛追平了经过专门微调的学习类方法 DMLVS但完全不需要微调2扰动下 76.6%比最好的经典方法 ORB58.4%相对提升 31.2%也略优于微调后的 DMLVS76.0%。精度指标扰动场景平移末端误差21.54±12.11 cm、旋转末端误差1.83±0.98°DMLVS 为 19.29±12.81 cm / 1.92±1.28°平移 APE 17.14±6.65 cm与最好的经典描述子 ORB 的 16.60±5.66 cm 相当旋转 APE 16.34±5.05° 为非微调方法中最佳轨迹长度比1.21±0.39也是非微调方法中最好的。作者坦率地指出末端误差高于经典方法这是 ViT 特征图太粗导致的——DINOv2-Small 的特征图分辨率是输入的 1/14本文配置下对应匹配只在22×22的格点上进行而经典 IBVS 在整幅图像分辨率上匹配。帧率RTX 4070 Mobile100 次运行平均见 Figure 4DINOv2-Small β1224 px 时约13.6 Hz512 px 时降到约5 HzDINOv2-Base β1约 12 Hz → 约 3.7 HzDINOv2-Large β1约 8 Hz → 约 1.9 Hzβ2 分箱会让帧率大致减半但作者发现分箱策略对计算效率的影响大于骨干网络尺寸的选择因此落地推荐两套配置224×224 输入 β2或308×308 输入 β1。轨迹正则化α 评估见 Figure 5α 从 0.5 到 0.9 扫描α 越小长度比越低轨迹更短但末端误差上升最终取α0.8平衡两者。真机三段实验精细实验1500 次迭代从 Δr₀ (−45.60 cm, 18.63 cm, −11.21 cm, 10.17°, −15.48°, −153.08°) 出发目标只被部分看到、且被大幅旋转收敛到Δr_final (0.38 cm, 0.44 cm, −0.25 cm, 0.44°, −0.54°, −0.40°)。工业用例移动抓箱MiR100 用 ROS 导航栈 两个激光雷达自主导航到工位底盘自身定位不确定度±10 cm由视觉伺服补偿这 10 cm 的偏差20 次抓箱全部成功100%。类别级抓取对每类未见过的实例抓 5 次每类 10 次鞋 100%、杯子 90%、玩具车 80%。失败案例也交代得很清楚杯子的那次失败是已经成功收敛并夹住但杯子从夹爪里滑落玩具车的两次失败都是撞到桌面——一次是收敛不好另一次是初始旋转补偿取到了错误的旋转。图注横轴是输入分辨率、纵轴是帧率。它给工程选型提供了最直接的判断依据小模型 低分辨率能到十几赫兹大模型 高分辨率只有 1–2 Hz同时也能看出 β2 分箱带来的近似减半效应。图注左图是不同配置下的帧率-分辨率曲线右图是 α 从 0.5 到 0.9 时位置误差与长度比的此消彼长——α0.8 就是那条两边都不难看的折中位置。图注(a) 期望图像、(b) 初始图像、© 收敛后的外部视图(d) 把多次试验的末端轨迹对齐到目标点后的三维图——十几条不同起点的轨迹都收束到同一个终点直观体现了重复性这也是±10 cm 底盘定位误差被视觉兜住的现场证据。对机器人工程实践的启示部署成本极低一张参考图即可上线。不需要采集数据、不需要微调、不需要任务相关的标注——这对小批量、多品种的产线每个工位换型频繁特别有价值。帧率是这套方案的主要工程约束。5–14 Hz 的闭环频率还需 RTX 级 GPU不适合高速跟踪但非常适合移动到位后精定位这类低频闭环先用导航把底盘开到 ±10 cm 以内再用视觉伺服把几厘米/几度的残差抹平这正是论文工业用例的结构。模型选型有明确结论。优先调分箱 β 与输入分辨率对速度影响更大其次才是换骨干网络推荐配置为 224 px β2求快或 308 px β1求稳。精度预期要放对位置。因为特征图分辨率只有输入的 1/14约 22×22 格末端定位误差在厘米级而不是亚毫米级。如果任务是亚毫米级装配ViT 特征需要配合更高分辨率输入或其他精定位手段。可复用的工程技巧用Segment Anything把目标与背景分离、用预定义夹取动作触发抓取、用多旋转假设 评分解决大角度初始偏差——这三件事都能直接搬到自己的视觉伺服或位姿估计流水线里。主要局限 未来方向帧率偏低高分辨率/大模型配置下仅 1–2 Hz作者自己也承认frame rates leave room for improvement。定位精度受特征图分辨率限制22×22 匹配格点平移末端误差在扰动场景约 21.5 cm、APE 约 17 cm尚达不到亚毫米级装配的要求。初始旋转补偿需要多次前向推理4 个旋转假设各做一次匹配这在低帧率下是明显开销而且论文给出的失败案例里就有一次是取到了错误的旋转。验证范围集中仿真只用一个目标海报、真机只用一台相机与少数类别杯子/玩具车/鞋工业场景多样性有限没有公开新数据集。未来方向作者明确指向改善定位误差——也就是如何绕开 ViT 特征图分辨率带来的精度天花板例如更细的特征网格、与经典/几何方法结合、多尺度匹配。总结ViT-VS 用一句话就能说清把预训练 ViT 的语义特征当成通用匹配器直接插进经典的 IBVS 控制回路一次微调都不做。它带来的收益是可量化的无扰动场景收敛率100%追平专门微调过的学习方法扰动场景76.6%比最好的经典 IBVS 相对提升 31.2%轨迹长度比 1.21 为非微调方法最佳代价是末端精度受 1/14 特征图限制厘米级以及 5–14 Hz 的帧率。真机侧它完成了 20 次抓箱全成功、以及鞋 100%/杯 90%/玩具车 80% 的类别级未见实例抓取。对所有想少训练、多通用的视觉伺服落地项目来说这篇论文提供了一个很有说服力的证据在大规模预训练特征面前通用和鲁棒未必是二选一。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

保险代理人 GEO 实操:让 AI 推荐你作为本地家庭保障顾问 2026/10/1 10:23:11

保险代理人 GEO 实操:让 AI 推荐你作为本地家庭保障顾问

真实案例:一位在二线城市从业 6 年的保险代理人,过去主要靠熟人转介绍获客,每月新增咨询量长期在个位数徘徊。她按照 GEO 方法,先统一了全网执业信息,再围绕「重疾险保额怎么定」「网上买保险理赔麻烦吗」等高频问题&a…

阅读更多 →
Anthropic发布Sonnet 5.5:更便宜更快的中端主力 2026/10/1 10:23:11

Anthropic发布Sonnet 5.5:更便宜更快的中端主力

Anthropic 又更新了它的中端主力。当地时间 9 月 29 日,这家以 Claude 系列模型闻名的 AI 公司发布了 Sonnet 5.5,并将其描述为一款「显著更便宜、更快的工作伙伴」。相比旗舰级的 Opus 系列,Sonnet 一向承担着「日常干活」的角色&#xff0c…

阅读更多 →
【Python 异常处理|笔记】 2026/10/1 10:23:11

【Python 异常处理|笔记】

引言 写代码的时候经常会遇到程序突然崩溃退出,比如输入数字,用户偏偏输入文字;读取文件,但是文件不存在。这种运行时出现的错误,就叫做异常。 如果不处理异常,程序会直接终止。Python 提供try-except来捕获…

阅读更多 →
【AI大模型】系统兼容:Windows/Linux部署差异与适配 2026/10/1 10:23:11

【AI大模型】系统兼容:Windows/Linux部署差异与适配

【AI大模型】系统兼容:Windows/Linux部署差异与适配 核心结论:Windows与Linux在路径、命令、依赖管理、文件系统、性能与权限上的差异,是AI大模型应用跨平台部署时报错的根源。适配的关键不是两套代码,而是统一用跨平台方案处理路径、换行、编码与命令,并在两种环境都做验…

阅读更多 →
Meta进军企业AI,挖来MongoDB CEO掌舵新业务 2026/10/1 10:23:11

Meta进军企业AI,挖来MongoDB CEO掌舵新业务

编者按:消费级AI的热闹属于C端,真正的现金流却在企业市场。Meta这一次不只是发布一个平台,而是补上了自己商业化版图中最薄弱的一环——而它选择的破局方式,是从对手的阵营里直接挖人。据TechCrunch报道,Meta于近日正式…

阅读更多 →
浏览器AI抠图慢不慢,先看它跑在哪个后端 2026/10/1 10:23:05

浏览器AI抠图慢不慢,先看它跑在哪个后端

同事上周在群里吐槽我安利的网页抠图工具点一下要干等好几秒。我这边差不多是点完就出图。两台都是 Mac 上的 Chrome 打开同一个网页。我第一反应是他网不好,后来确认模型早就缓存过了、根本没在下载。真正的差别出在浏览器拿什么跑模型:一边走 WebGPU 用…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉