新闻详情

新闻详情

首页 / 资讯中心 / 详情

【ICRA 2025】ODIL:单次示教的双臂模仿学习|从双臂协调与视觉伺服视角

发布时间:2026/10/2 17:22:32来源:尧图网络
【ICRA 2025】ODIL:单次示教的双臂模仿学习|从双臂协调与视觉伺服视角
摘要本文解读 ICRA 2025 论文《One-Shot Dual-Arm Imitation Learning》。该论文提出ODILOne-Shot Dual-Arm Imitation Learning通过融合双臂协调范式、三阶段视觉伺服 3-VS与深度特征匹配器让双臂机器人仅凭一次人类演示就能完成精确且需要双臂协调的日常任务其特别之处在于演示之后既不需要采集新数据也不需要训练任何模型。实验表明六个真实双臂任务的平均成功率达到 77.2%是次优基线 RoboTAP24.2%的约 3.2 倍而难度最高的插入铅笔任务上基线全部为 0%、ODIL 仍有 80%为单次模仿学习在双臂场景中的落地提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节实验设计与结果结果对比总结关键发现局限性常见问题FAQODIL 需要为每个新物体采集数据或重新训练吗三阶段视觉伺服各自的职责是什么为什么用传统匹配器 SIFT LightGlue 而不是更强的学习型匹配器手眼标定需要多精确这套方法目前最大的短板是什么单次示教相比行为克隆省了多少成本参考链接论文基本信息项目内容标题英文One-Shot Dual-Arm Imitation Learning标题中文单次示教的双臂模仿学习作者Yilong Wang, Edward Johns机构The Robot Learning Lab, Imperial College London会议ICRA 2025arXivarXiv:2503.06831项目网站robot-learning.uk/one-shot-dual-arm背景与动机双臂机器人的精确操作一直非常困难尤其是需要两条手臂相互配合的任务。近年来的模仿学习虽然能从人类演示中高效获取视觉运动技能但数据效率很低由于状态动作空间维度高双臂任务通常需要50 到上千条演示才能训出可用策略而从人类演示中学习双臂协调本身仍是开放问题因为两条手臂之间存在复杂的空间与时间关联。作者因此把问题拆成三个研究问题1双臂机器人能否只靠一次演示学会精确协调任务2协调轨迹如何从单次演示中导出3在不依赖物体先验、不再采数据的前提下如何做到精确而鲁棒的对齐已有工作的局限也很清楚。参数化运动基元依赖人工设计难以扩展到日常任务双臂遥操作方法能完成装电池、炒虾、泡茶等精细任务但要大量演示和专用采集硬件。单次模仿学习这条线里元学习方法需要先在相似任务上预训练Coarse-to-Fine与DINOBot用视觉伺服加轨迹回放避免了逐任务训练但仍要为每一个物体实例采集大量真实数据DOME这类在仿真中训练视觉伺服的方法则受制于仿真到真实的差距。视觉伺服与位姿估计方向的方法多数依赖物体先验、CAD 模型或精确的手眼标定。这条技术脉络中Coarse-to-Fine2021确立了估计交互位姿再回放交互轨迹的范式DOME2022证明视觉伺服可以完全在仿真中训练One-Shot Imitation Learning: A Pose Estimation Perspective2023系统分析了标定误差与位姿误差的影响DINOBot 与 RoboTAP2024则引入视觉基础模型关键点表示。ODIL 正是在这条主线上把对齐加回放推进到双臂协调并用免标定的三阶段闭环伺服替换逐任务定制训练。研究主线从问题到结论图 7ODIL 的研究主线——从双臂任务数据密集的现状到协调范式参数化、3-VS 闭环伺服与六任务真机评测Mermaid 流程图。基准/方法设计ODIL 的设计可以概括为先对齐、再回放由两条支柱组成。第一双臂协调范式。作者把双臂操作拆成三个基本原语act按特定速度曲线与物体交互、stabilize保持静止位姿稳住物体、rearrange把物体从一个位姿搬到另一个位姿。三个原语组合出四类范式Act-Act两臂都执行动作可同时或顺序、Stabilize-Act一臂稳住物体、另一臂精确操作、Rearrange-Act先重排物体再操作、Rearrange-Rearrange。协调范式真正的价值是剪掉不可执行的演示段原始示教轨迹常因叠加运动学约束无法直接搬运只保留与物体交互相关的部分才可复用。值得注意的是Stabilize-Act 范式中的稳定臂位姿直接来自单次演示既不需要监督学习也不假设夹爪朝向固定。第二瓶颈位姿与轨迹参数化。演示时人类把末端 $E$ 移动到一个瓶颈位姿 $B$保证物体 $O$ 同时对全局相机 $C_g$ 与腕部相机 $C_w$ 可见。测试时只要估计出物体相对机器人坐标系的位姿变化 $\delta \mathbf{T}$即两个瓶颈位姿之间的相对变换就能把演示轨迹搬到新场景。Act-Act 与 Stabilize-Act 类任务直接在笛卡尔空间变换演示位姿正运动学 $\to$ 变换 $\to$ 逆运动学Rearrange 类任务先用在线运动规划把物体复位再回放演示轨迹。图 1ODIL 从单次演示第一列学会精确协调任务并适应新的机器人、物体与场景配置机器人从任意初始位姿第二列先对齐物体第三列再回放演示轨迹第四列。分类全景图 8双臂协调范式的分类全景——act、stabilize、rearrange 三个原语组合出的四类范式Mermaid 流程图。方法细节系统的硬件配置是ABB YuMi 双臂机器人配普通位置控制器10 Hz加一个固定在桌面的全局相机RealSense D415720×1280和一个腕部相机RealSense D405480×848。演示阶段两个相机各拍一张瓶颈 RGB-D 图像并做分割人类通过动觉示教完成任务并记录关节轨迹测试阶段先用 3-VS 对齐再适配并执行协调轨迹。整套方法对假设的要求非常弱物体只需一开始对全局相机可见手眼标定只需粗略值。阶段一全局相机 3D 视觉伺服。全局相机检测新场景中的物体并给出初始瓶颈估计。由于物体在全局图像中占比很小用稀疏匹配容易匹配不足因此改用部分点云配准GroundedSAM 做开放词表实例分割再用 FPFH FGR ICP 估计物体相对相机的位姿变化经粗略手眼标定推出瓶颈位姿。随后用解耦比例控制把末端推向物体直到腕部相机的估计稳定。阶段二双相机 3D 视觉伺服与 UKF 融合。腕部相机用 SIFT LightGlue 做稀疏匹配重建相机相对物体的位移通过单向掩码过滤丢弃落在瓶颈图分割掩码之外的匹配再用加权 Kabsch 算法求位姿。全局先验与腕部冗余量测一起送入无迹卡尔曼滤波得到瓶颈位姿的后验估计控制律仍为解耦比例控制误差为 $\mathbf{e} [\rho \mathbf{m} - \mathbf{m}^{*},\ \rho - 1,\ \theta \mathbf{u}]$。阶段三腕部 2.5D 视觉伺服。当瓶颈图与当前腕部图重叠足够时切换到第三阶段只用腕部相机追求最高精度用 SuperPoint LightGlue 匹配、MAGSAC 估计单应矩阵 $\mathbf{H}$把虚拟平面上物体的单应调节到单位阵最后在误差足够小时启用双向过滤进一步抑制干扰物与部分遮挡带来的噪声。切换准则明确可复现腕部置信匹配数超阈值且瓶颈位姿估计的移动方差低于阈值 $\to$ 进入阶段二后验相对位移在短时间内持续很小 $\to$ 进入阶段三。所有组件都是现成的——分割用 GroundedSAM、配准用 FGR ICP、匹配用 LightGlue、单应用 MAGSAC。图 2ODIL 总体框架。演示时末端 $E$ 移到瓶颈 $B$物体同时被全局相机与腕部相机看到并分割示教轨迹被参数化为协调轨迹测试时用 3-VS 对齐到新的瓶颈位姿再执行该协调轨迹。图 3三阶段视觉伺服流水线。(1) 全局相机 3D 视觉伺服开环控制(2) 全局先验与腕部冗余量测经 UKF 融合直到重叠超阈值(3) 切换到 2.5D 视觉伺服直到收敛随后适配并执行协调轨迹。实验设计与结果实验在真实双臂机器人上完成共6 个精确且需要协调的任务覆盖三类协调范式Act-Act 的端架子、放进锅里Stabilize-Act 的揭开剪刀、插入铅笔Rearrange-Act 的劈开方块、挂锅。每个任务在3 种条件下各做10 次试验4-DoF绕竖直轴 ±60°均匀背景、4-DoF⁺加背景变化、干扰物、部分遮挡、6-DoF⁺六自由度位姿变化 ±30° 并保留上述干扰。基线为FGRICP开环、RoboTAP、DINOBot。匹配器选型也是一项独立的基准实验用腕部 D405 采集26 个末端位姿平移 3–15 cm、旋转 15°–75°每个姿态50 张图、共12 种物体比较主流学习型匹配器与经典方法。方法端架子4-DoF插入铅笔4-DoF劈开方块4-DoF平均成功率FGRICP4002010%RoboTAP4004024.2%DINOBot7003018.3%ODIL本文100809077.2%匹配器平均误差 MEcm↓近距离误差 CREcm↓静止状态误差 SSEcm↓帧率 FPS ↑DINO MNN21.810±9.41.4±1.00.5XFeat MR39.014±100.7±0.327SP LG GIM15.68.7±100.5±0.317SIFT LG16.84.3±1.50.5±0.322Mast-3R44.735±244.1±9.71.4匹配器基准里有一个反直觉的结论学习型匹配器帧率普遍不高Mast-3R 只有 1.4 FPS、DINOMNN 只有 0.5 FPS而在完全解析的对比中SIFT LightGlue 的平均误差与近距离误差反而最优。作者给出的机制解释是当前匹配器主要用正立图像训练隐含了重力对齐假设因此对旋转敏感——这正是阶段二选 SIFTLG、阶段三改用 SPLG 的实测依据。图 4六个真实双臂任务覆盖 Act-Act、Stabilize-Act 与 Rearrange-Act 三类协调范式。图 5匹配器基准前四名在收敛附近、强光照变化下的误差分布SPLG 分布最尖锐且匹配数更多但所有方法都存在极端外点这正是需要第三阶段闭环调节的原因。图 6四类双臂协调范式的可视化任务端锅、撕胶带、开瓶盖、搅拌碗蓝色为一臂、橙色为另一臂六个实验任务正是从这套范式谱系中挑选出来的。结果对比总结图 9四个方法在六个真机双臂任务上的平均成功率对比——ODIL 77.2% 约为次优基线的 3.2 倍Mermaid 流程图。关键发现平均成功率 77.2%约为次优基线 RoboTAP24.2%的3.2 倍开环基线 FGRICP 只有10%。最难的插入铅笔任务上三条基线全部0%ODIL 达到80%——该任务要求一臂稳定握持卷笔刀、另一臂精确插入铅笔最能体现闭环视觉伺服的价值。鲁棒性代价很小加入背景变化、干扰物与部分遮挡4-DoF⁺后性能只有轻微下降插入铅笔被遮挡时会短暂空转但控制器能自行恢复。6-DoF⁺ 明显掉点第二阶段常因全局相机先验太差进入错误位姿且瓶颈图与当前腕部图重叠不足时无法恢复能进入第三阶段的试验成功率依然很高。干扰物使所有方法抖动加剧外观与目标相似的干扰物影响尤其明显。从创新模式看这篇论文同时命中审计并扭转负载假设实测推翻学习型匹配器天然更强、重新表述为可解对象把学策略重构为估位姿加回放轨迹与分解并委托求解器三阶段各自委托成熟求解器既有结构性洞察也产出了可复用基础设施。写作层面值得一提正文只轻描淡写地称协调范式novel而据我们所知这是第一个能从单次演示学习精确协调双臂任务的方法这句最强声明其实被注释掉了没有进入正文。局限性只覆盖单阶段任务多阶段长程任务链缺乏机制支撑作者把扩展到多阶段任务列为未来方向。没有失败恢复机制一旦在伺服过程中进入错误位姿系统很难自救作者把在线失败恢复与闭环物体交互列为后续工作。6-DoF 精度不足六自由度条件下成败几乎取决于全局相机先验质量在没有完整三维物体表示时控制 $\mathrm{SE}(3)$ 仍然困难。依赖强假设物体必须对全局相机可见、瓶颈状态可达控制器参数需一次调好并跨任务复用换环境后的泛化仍有待验证。源码层面还有两处小瑕疵可提醒作者致谢段落被整段注释掉源码保留了带拼写错误的大段注释公式与实验笔记未清理。常见问题FAQODIL 需要为每个新物体采集数据或重新训练吗不需要。演示结束后不再采集数据、也不训练任何模型任务切换只需换一条演示轨迹。机器人用普通位置控制器即可执行这正是一-shot 模仿学习与行为克隆最本质的区别。三阶段视觉伺服各自的职责是什么第一阶段用全局相机做 3D 视觉伺服把末端推向物体使腕部相机稳定看到目标第二阶段把全局先验与腕部冗余量测经无迹卡尔曼滤波融合提升瓶颈位姿估计精度第三阶段切到腕部 2.5D 视觉伺服用单应矩阵把图像误差调零追求最终的对齐精度。为什么用传统匹配器 SIFT LightGlue 而不是更强的学习型匹配器基准实验显示学习型匹配器主要在正立图像上训练、隐含重力对齐假设对旋转敏感在完全解析的对比中 SIFT LightGlue 的平均误差与近距离误差最优同时帧率22 FPS也能满足实时控制。手眼标定需要多精确只需要粗略值。三阶段闭环伺服的误差会被逐级吸收全局相机与腕部相机的外参不精确时系统仍能收敛这也是 ODIL 相对依赖精确标定的传统视觉伺服的实用优势。这套方法目前最大的短板是什么六自由度条件下的成功率。实验结果中 6-DoF⁺ 掉点最明显原因是全局相机先验不足导致第二阶段进入错误位姿而腕部图像重叠不足时难以恢复作者也把失败恢复与闭环物体交互列为后续方向。单次示教相比行为克隆省了多少成本以论文引用的双臂任务规模来看常规做法需要 50 到上千条演示还常常需要专用遥操作硬件采集ODIL 只需 1 次人类演示且不需要为每个新物体实例重新采集真实数据。参考链接论文 arXiv 摘要页One-Shot Dual-Arm Imitation Learning项目网站ODIL 视频、失败案例与补充实验Robot Learning Lab 主页Imperial College LondonCoarse-to-Fine Imitation LearningarXiv:2105.06411DOME: Demonstrate Once, Imitate ImmediatelyarXiv:2204.02863DINOBot: Robot Manipulation via Retrieval and Alignment with Vision Foundation ModelsICRA 2024LightGlue: Local Feature Matching at Light SpeedICCV 2023B 站视频讲解给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

agent如何接管3D建模的?用MCP+API打通Python自动化管线 2026/10/2 18:14:40

agent如何接管3D建模的?用MCP+API打通Python自动化管线

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
2026年必看:七款热门AI编程工具权威横评,TaoToken统一Key接入实测 2026/10/2 18:14:27

2026年必看:七款热门AI编程工具权威横评,TaoToken统一Key接入实测

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
中文关键词抽取实战:Python实现TF-IDF、TextRank与LDA方法解析 2026/10/2 18:14:27

中文关键词抽取实战:Python实现TF-IDF、TextRank与LDA方法解析

简介:基于Python实现中文文本关键词抽取的课程设计资源包,面向自然语言处理方向学生与开发者,系统梳理TF-IDF、TextRank和Word2Vec词向量聚类三种主流方法,并提供可直接运行的源码与实验数据。整个压缩包共三十一个文件&#xff0…

阅读更多 →
广州商场铝方通吊顶定做加工厂怎么选 欧巴克建材不踩坑挑选全攻略 2026/10/2 18:14:08

广州商场铝方通吊顶定做加工厂怎么选 欧巴克建材不踩坑挑选全攻略

商场铝方通吊顶定制的核心逻辑:从选型到落地的底层标准商场作为密集的公共商业空间,吊顶不仅承担着基础的装饰效果,更是消防、声学、通风等功能的重要载体。铝方通作为吊顶主材的主流选择之一,其核心优势在于线条流畅的视觉效果、…

阅读更多 →
十大 Python 自动化工具与脚本示例 2026/10/2 18:13:49

十大 Python 自动化工具与脚本示例

因为它具备强大的功能特性, 且掌握的语法非常简单易懂, 所以在自动化这个行业领域里面, 它有着非常普遍的用途。下面是列举出来的十个用于自动化的工具以及相关的脚本例子, 这些工具和脚本存在的情况下, 可以让大家的工作效率得到大幅度的提升, 与此同时还可以有效地削减掉许多…

阅读更多 →
HarmonyOS 7 状态手记 01|页面状态别乱放 2026/10/2 18:13:42

HarmonyOS 7 状态手记 01|页面状态别乱放

做 HarmonyOS 7 页面时,最容易把人绕进去的往往不是布局,而是“这个值到底该放哪儿”。页面计数、加载状态与条件渲染 看起来只是几行代码,真接进项目后,经常会遇到 UI 不刷新、返回页面数据变旧、弹窗取消后值却被改掉&#xff0…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉