新闻详情

新闻详情

首页 / 资讯中心 / 详情

【CVPR 2025】UniGoal:面向通用零样本目标导向导航|从零样本导航统一框架视角

发布时间:2026/10/2 12:49:41来源:尧图网络
【CVPR 2025】UniGoal:面向通用零样本目标导向导航|从零样本导航统一框架视角
摘要本文解读 CVPR 2025 论文《UniGoal: Towards Universal Zero-shot Goal-oriented Navigation》。该论文提出统一图表示下的通用零样本目标导向导航框架通过融合在线场景图、目标图与图匹配打分让同一个不训练任何策略网络的模型完成物体类别ON、示例图像IIN与文本描述TN三类导航任务其特别之处在于把探索到哪一步变成可计算的匹配分数 $S(S_NS_ES_T)/3$再由多阶段策略与黑名单驱动大模型推理。实验表明单一零样本模型在 MP3D、HM3D 与 RoboTHOR 上全面领先HM3D 图像目标成功率 60.2%比最强零样本方法 Mod-IIN 高 4.1 个百分点在图像目标上更超过有监督通用方法 GOAT 22.8 个百分点为具身智能中的零样本导航提供了可复用、可解释的统一框架。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机为什么零样本导航需要目标无关的推理框架研究主线从问题到结论基准/方法设计把目标也变成图分类全景三类目标的图构造与三个阶段方法细节图匹配打分与多阶段探索实验设计与结果三基准、三类任务、同台比较结果对比总结关键发现局限性常见问题FAQUniGoal 和 SG-Nav 的核心区别是什么为什么一个不训练的模型能超过有监督方法三类目标是如何统一到同一个框架的三个探索阶段分别在解决什么问题黑名单机制为什么必不可少这套方法能直接用到真实机器人上吗参考链接论文基本信息项目内容标题英文UniGoal: Towards Universal Zero-shot Goal-oriented Navigation标题中文UniGoal面向通用零样本目标导向导航作者Hang Yin, Xiuwei Xu, Linqing Zhao, Ziwei Wang, Jie Zhou, Jiwen Lu机构清华大学自动化系 · 南洋理工大学会议CVPR 2025arXivhttps://arxiv.org/abs/2503.10630项目网站https://bagh2178.github.io/UniGoal/背景与动机为什么零样本导航需要目标无关的推理框架目标导向导航要求智能体在未知环境中移动到指定目标。按目标类型主流研究分成三个子任务物体类别目标Object-goal Navigation, ON、示例图像目标Instance-image-goal Navigation, IIN与文本描述目标Text-goal Navigation, TN。三类目标的信息形态差异极大——一个词、一张图、一段描述——因此长期以来的做法是一个任务配一套推理流程流程之间几乎没有可复用的部分。有监督这条路依赖大规模仿真训练。SemEXP 用模块化语义地图加目标导向探索开创了 ON 主线OVRL-v2 用自监督预训练视觉表征IEVE 用实例级表征学习把图像目标成功率推到 70.2%。它们在同任务上表现不俗但需要大量训练且容易过拟合到仿真环境迁移到真实世界时性能下降明显。零样本这条路试图摆脱训练。CoW 基于 CLIP 特征做前沿探索ESC、OpenFMNav 与 VLFM 进一步用大模型抽取物体之间的常识关联来推断目标位置——其中 SG-Nav 用在线层次化 3D 场景图配合思维链提示在 MP3D 上把物体目标成功率做到 40.2%。图像目标上Mod-IIN 用前沿探索配合关键点匹配HM3D 成功率 56.1%。问题在于它们都只针对单一目标类型设计推理流程文本目标在 UniGoal 之前甚至没有可比的零样本方案InstructNav 虽然提出了面向多种语言导航任务的通用框架却无法处理图像这类视觉目标。还有一条通用但有监督的路线GOAT 用强化学习训练统一的全局策略PSL 用 CLIP 嵌入统一表示类别、图像与文本但两者依然需要耗时的 RL 训练且三个任务的表现差距很大GOAT 在 HM3D 上物体目标 50.6%、图像目标 37.4%、文本目标仅 17.0%。论文的切入点是真正的通用应该体现在推理框架上而不是训练数据规模上。既然三类目标最终都是在场景里找一个东西那就把它们表示成同一种结构——图——让匹配与搜索逻辑完全共享。研究主线从问题到结论图 9UniGoal 的研究主线——从三类目标各自定制流程到统一图表示加图匹配推理Mermaid 流程图基准/方法设计把目标也变成图UniGoal 的核心设计只有一句话把目标也变成图。场景侧智能体随移动增量构建在线 3D 场景图 $\mathcal{G}_t$每收到一帧 RGB-D 观测就检测物体与其关系并合并进图目标侧三类目标被构造成统一格式的目标图 $\mathcal{G}_g$节点与边全部以文本描述。于是导航被重新表述为两个图的匹配程度推理流程对三类任务完全一致。这个设计要解决的关键矛盾是三类目标的图结构复杂度差异很大。物体目标的 $\mathcal{G}_g$ 退化为单节点零边图像目标先用 Grounded-SAM 分割参考图中的实例再提示视觉语言模型判断实例间的空间关系实例成为节点、关系成为边文本目标则由大模型先从描述中抽取物体、再生成关系构造出与图像目标同构的图。相比把场景压成一段文字提示图表示保留了层次与拓扑物体、物体组、房间构成层级空间关系构成边。这既减少了结构信息损失也让相似度计算、图匹配、图对齐这类显式操作成为可能。图 1任务对比——已有零样本方法按目标类型各自定制通用方法又需要大规模训练UniGoal 用统一框架零样本处理三类目标分类全景三类目标的图构造与三个阶段三类目标的差别被压缩到节点与边怎么造之后的匹配、打分与探索流程完全共享而探索过程本身又被匹配分数切成三个异构阶段每个阶段解决不同性质的问题。图 10UniGoal 的分类全景——三类目标的图构造方式 × 图匹配驱动的三个探索阶段Mermaid 分类图方法细节图匹配打分与多阶段探索图匹配打分。对场景图和目标图分别做节点嵌入与边嵌入节点嵌入为 $\mathrm{concat}(\mathrm{CLIP}(v),\mathrm{Degree}(v))$边嵌入直接用 CLIP 文本编码器输出。相似度矩阵经阈值 $\tau$ 过滤后做二分匹配得到匹配的节点对 $\mathcal{M}_N$ 与边对 $\mathcal{M}_E$并取平均得到 $S_N$、$S_E$。拓扑项 $S_T$ 由两张图结构之间的归一化图编辑距离给出最终匹配分数为 $S(S_NS_ES_T)/3$。Stage 1 零匹配。当 $S$ 很小时目标是扩大探索范围。由于目标图可能是若干互不相关子图拼成的例如桌子、椅子、窗户、窗帘其实分成两组同时定位多个弱相关子结构非常困难。作者让大模型把 $\mathcal{G}_g$ 分解为内部高相关的子图分别转成文本当作物体目标调用前沿选择再按前沿分数与到智能体的距离加权挑一个前沿。Stage 2 部分匹配。当 $\sigma_1 \le S \sigma_2$ 且至少存在一对锚点时进入部分匹配阶段。此时目标图没有任何坐标信息作者把中心物体初始化到原点沿边做深度优先遍历并提示大模型推断相对位置把整个目标图投影到鸟瞰图随后用已经精确匹配的锚点对求解尺度、旋转与平移组成的坐标变换矩阵 $\mathbf{P}$把剩余节点映射到场景图坐标系取投影点最小外接圆的圆心作为探索目标。Stage 3 完美匹配。当 $S \sigma_2$ 且中心物体 $o$ 已匹配智能体直接接近该物体。为了对抗感知错误只保留 $o$ 附近一定距离内的子图仿照图卷积用邻接矩阵与关联矩阵聚合邻居信息让大模型结合新观测修正节点与边同时用一个置信度 $C_tN_tM_tS_t-\lambda D_t$ 判断目标是否可信。黑名单机制。图匹配总是返回相似度最大的解因此失败匹配必须被记住。Stage 2 的所有锚点对都没能进入 Stage 3、或 Stage 3 的目标验证失败时相关节点与边被加入黑名单不再参与后续匹配而被修正过的结构连同它的连接会被移出黑名单。消融显示这一步是方法里最不能省的部分。超参数。相似度阈值 $\tau0.9$两个阶段阈值 $\sigma_10.5$、$\sigma_20.9$最大步数 $T$ 在 ON 上取 500、在 IIN 与 TN 上取 1000成功半径 $r$ 在 ON 上取 1.6 米、在 IIN 与 TN 上取 1.0 米。语言模型用 LLaMA-2-7B视觉语言模型用 LLaVA-v1.6-Mistral-7B。图 2UniGoal 框架——三类目标统一为图与在线场景图匹配匹配分数驱动多阶段探索黑名单避免重复探索图 3方法示意——(a) Stage 2 的坐标投影与锚点对对齐(b) Stage 3 的场景图修正实验设计与结果三基准、三类任务、同台比较评测在 Habitat 仿真器中进行。物体目标导航在 MP3D、HM3D 与 RoboTHOR 三套基准上做沿用 SG-Nav 的设定图像目标与文本目标都在 HM3D 上做分别沿用 Mod-IIN 与 InstanceNav 的设定。指标为成功率SR与路径长度加权成功率SPL——前者衡量是否停在目标附近后者额外衡量路径是否接近最优。主表对比了不同设定下的成功率。UniGoal 是其中唯一的零样本 通用组合它既不需要训练也不需要为任务切换流程。方法SR%类型MP3D ONHM3D ONHM3D IINHM3D TNSG-Nav零样本 · 专任务40.254.0——Mod-IIN零样本 · 专任务——56.1—GOAT有监督 · 通用—50.637.417.0PSL有监督 · 通用—42.423.016.5UniGoal零样本 · 通用41.054.560.220.2较最优基线—0.80.54.13.2在 HM3D 的图像目标任务上UniGoal 的成功率 60.2%、SPL 23.7%文本目标 SR 20.2%、SPL 11.4%MP3D 物体目标 SR 41.0%、SPL 16.4%HM3D 物体目标 SR 54.5%RoboTHOR 物体目标 SR 48.0%、SPL 24.2%。相对 GOAT它在三个任务上分别领先 3.9、22.8、3.2 个成功率百分点在 SPL 上分别领先 1.0、7.6、2.6 个百分点。三类目标的样例说明为什么图像与文本目标的增益更大图像目标给出一张目标物体照片文本目标给出一段含关系的描述两者都能构造成多节点多边的图而物体目标只是一个类别词目标图退化成单节点。图 4IIN 图像目标样例之一——参考图中的中心物体为 chair同类样例还包括 sofa 与 bed图 5IIN 图像目标样例之二——中心物体为 sofa智能体需要在场景中找到该实例图 6IIN 图像目标样例之三——中心物体为 bed消融实验在 HM3D 的图像目标任务上做下表每一行都比完整方法差说明每个模块都在工作。消融项HM3D · IINSR%SPL%简化图匹配去掉匹配分数的判定54.920.7移除黑名单机制50.617.3简化多阶段策略去掉 Stage 259.023.2完整 UniGoal60.223.7论文还逐子模块做了消融把 Stage 1 整体换成朴素前沿探索成功率降到 55.1%去掉目标图分解降到 59.2%去掉前沿选择降到 57.4%把坐标投影简化成随机猜点降到 59.1%去掉锚点对对齐降到 58.9%去掉场景图修正降到 59.5%去掉目标验证降到 58.2%。七个子模块没有一个可以被省掉。决策过程的时间线也很有说明性匹配分数随探索逐步上升穿越阈值时发生阶段切换——早期给出的长期目标指向未知区域的前沿中期指向推断出的目标位置后期直接指向候选物体。这条曲线正是引入匹配分数这个中间量的理由否则切换时机只能靠固定规则容易过早或过晚。图 7决策过程——UniGoal 通过图匹配逐步提升分数Switch 标记阶段切换点S-Goal 为各阶段预测的长期目标图 8HM3D 九个场景的导航路径——ON绿、IIN橙、TN蓝三类目标由同一模型完成结果对比总结图 11从基线到 UniGoal——三类任务上的成功率变化与领先幅度Mermaid 对比图关键发现零样本胜有监督通用方法相对 GOAT / PSLUniGoal 在 ON、IIN、TN 上分别领先 $3.9/1.0$、$22.8/7.6$、$3.2/2.6$SR / SPL 百分点而且完全不需要训练。图像目标增益远大于物体目标IIN 上超 Mod-IIN 4.1 个百分点ON 上只超 SG-Nav 0.8 个百分点——原因是物体目标下目标图退化成单节点图分解与锚点对齐都用不上方法只发挥了一部分能力。退化场景仍有增益即使目标图只含单个节点Stage 3 的场景图修正与目标验证仍让 UniGoal 在 MP3D、HM3D、RoboTHOR 上全部超过 SG-Nav说明这两项机制是普适有效的。黑名单是最关键的模块移除后 HM3D 图像目标成功率从 60.2% 掉到 50.6%降幅 9.6 个百分点作者解释为重复匹配会让智能体卡住。去掉任一阶段都会掉点Stage 2 被移除后成功率降到 59.0%−1.2 个百分点说明直接从探索跳进接近会错过最优切换时机。甚至超过部分有监督专用方法MP3D 物体目标 41.0% 高于有监督的 SemEXP36.0%与 ZSON15.3%。局限性感知误差直接进入图匹配节点与边都是文本描述检测或描述出错会直接污染匹配结果Stage 3 的图修正只在目标附近做局部补偿无法挽回全局性错误。阈值依赖人工设定$\tau0.9$、$\sigma_10.5$、$\sigma_20.9$ 由实验选定论文未验证跨场景、跨仿真器的稳健性换环境很可能需要重新调参。计算开销未量化每一步都要调用大模型与 CLIP 编码器论文没有讨论实时性与计算预算这在真实机器人上是绕不开的约束。真机部署只有定性结论论文声称把方法部署到真实机器人平台验证了泛化能力但没有给出量化成功率或对照实验。物体目标用不满全部设计ON 下目标图退化为单节点Stage 1 的子图分解与 Stage 2 的锚点对齐都失效方法在该任务上的优势主要来自 Stage 3。常见问题FAQUniGoal 和 SG-Nav 的核心区别是什么SG-Nav 只把场景表示为图目标仍是一段文本因此只能处理物体类别目标。UniGoal 让目标也成为图并用图匹配分数驱动多阶段探索从而把物体类别、示例图像、文本描述三类任务收进同一个推理框架。论文作者也是同一批人UniGoal 是 SG-Nav 的直接泛化。为什么一个不训练的模型能超过有监督方法因为收益来自结构化的显式推理而不是更大的模型。UniGoal 把探索到什么程度变成可计算的匹配分数 $S(S_NS_ES_T)/3$用图匹配、坐标投影、锚点对齐这些确定性操作承担几何与拓扑推理大模型只负责常识层面的判断。有监督的通用方法依赖大规模 RL 训练容易过拟合到仿真环境因此在跨任务、跨场景时反而吃亏。三类目标是如何统一到同一个框架的关键在于把三者都构造成同一种图物体目标退化为单节点零边图像目标用 Grounded-SAM 分割参考图实例、由视觉语言模型生成空间关系作为边文本目标由大模型抽取物体与关系。表示一致之后相似度计算、二分匹配、图编辑距离、坐标对齐这些操作就可以在三类任务上完全复用。三个探索阶段分别在解决什么问题Stage 1 零匹配阶段要扩大探索范围办法是把目标图分解成内部高相关的子图当成多个物体目标分别做前沿选择Stage 2 部分匹配阶段要推断目标位置用坐标投影把目标图放到鸟瞰图再用锚点对求解坐标变换矩阵Stage 3 完美匹配阶段要确认并接近目标用图卷积式的邻居聚合修正场景图再用累积置信度验证目标是否可信。黑名单机制为什么必不可少图匹配总是输出相似度最大的解一旦某个匹配最终没能找到目标同一组节点和边会在后续步骤被反复选中智能体就会卡在同一处。黑名单把这些失败结构排除在匹配之外被修正过的结构则会移出黑名单。消融显示移除它会让成功率下降 9.6 个百分点。这套方法能直接用到真实机器人上吗论文给出了真机部署的定性验证说明框架具备迁移能力但没有报告量化成功率与对照实验。实际部署还要面对两个未解问题一是每步都要调用大模型与 CLIP 编码器的计算开销二是匹配阈值与阶段阈值需要按环境重新调整。参考链接论文 arXiv 摘要页https://arxiv.org/abs/2503.10630项目主页含代码与可视化https://bagh2178.github.io/UniGoal/SG-Nav本文直接前作NeurIPS 2024https://arxiv.org/abs/2410.08189ESCExploration with Soft Commonsense Constraints for Zero-shot Object NavigationICML 2023https://proceedings.mlr.press/v202/zhou23r.htmlVLFM: Vision-Language Frontier Maps for Zero-Shot Semantic NavigationICRA 2024https://arxiv.org/abs/2312.03275GOAT: GO to Any ThingRSS 2023 通用有监督导航基线https://arxiv.org/abs/2311.06430B 站视频讲解https://www.bilibili.com/video/BV1XvaB6yEGr给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

Linux FIFO有名管道:进程间通信的轻量级基石 2026/10/2 14:27:03

Linux FIFO有名管道:进程间通信的轻量级基石

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
DeepBI对标竞品评分报告实测:从Excel手工对标到AI驱动Listing优化 2026/10/2 14:27:03

DeepBI对标竞品评分报告实测:从Excel手工对标到AI驱动Listing优化

做电商这几年,我电脑里一直有一个名为“竞品拆解”的文件夹,里面躺着十几张Excel表。每张表都是一个类目头部Listing的逐项拆解:标题里埋了哪些关键词、五点描述复述了几个卖点、A页面放了什么结构、评论区高频吐槽点是什么。每周固定抽半天时…

阅读更多 →
RK61机械键盘配置全攻略:蓝牙连接、FN层与改键技巧 2026/10/2 14:27:03

RK61机械键盘配置全攻略:蓝牙连接、FN层与改键技巧

上个月,一个做设计的朋友跑来问我:“刚到的RK61,蓝牙死活连不上,插上Type-C也没反应,是不是翻车了?”我让他拍了一张连接图,一眼就看出问题——他用了一根只能充电不能传数据的数据线。这种情况…

阅读更多 →
图像镜像翻转全指南:从OpenCV到批量处理与API实践 2026/10/2 14:27:03

图像镜像翻转全指南:从OpenCV到批量处理与API实践

这个标题乍看没有技术含量:“驱车疾行溺坠而亡,上下左右镜像”,前半段像灾难现场,后半段又像一句玄学口令。但拆开看,后半句才是值得切入的关键词——上下左右镜像,对应的正是图像处理里最基础的翻转操作&a…

阅读更多 →
Spring Boot 3.x Jakarta迁移:解决index.html 404与getHttpServletMapping异常 2026/10/2 14:26:56

Spring Boot 3.x Jakarta迁移:解决index.html 404与getHttpServletMapping异常

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
SpringBoot3集成SkyWalking:零侵入链路追踪实战指南 2026/10/2 14:26:50

SpringBoot3集成SkyWalking:零侵入链路追踪实战指南

1. 为什么现在必须把 SkyWalking 接进 SpringBoot3?不是“可选”,而是“刚需” 我去年接手一个电商中台项目,上线前压测一切正常,QPS 能稳在 1200。结果正式切流第三天凌晨两点,订单创建接口平均响应时间从 80ms 突然…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉