新闻详情

新闻详情

首页 / 资讯中心 / 详情

GROUNDHOG总体版

发布时间:2026/9/27 6:23:07来源:尧图网络
GROUNDHOG总体版
1. 这篇论文到底想解决什么问题GROUNDHOG 想解决的是让 MLLM 的语言能够精确对应到像素区域以前很多 grounded MLLM比如 Shikra、Kosmos-2主要把语言和bounding box对齐但 box 很粗尤其不适合不规则物体天空、草地这类背景区域物体局部比如“狗的尾巴”多个实例图像中的文字区域。所以 GROUNDHOG 希望做到也就是把语言真正 grounding 到像素级。2. 最核心的思想不是直接生成 mask而是“先分割再选择”这是整篇论文最重要的设计。GROUNDHOG 不采用语言 → 直接生成 mask而是Mask Proposal Language-guided Mask Retrieval首先给图像产生很多候选 mask。然后 MLLM 根据语言判断用户说的这个东西对应哪些候选 mask所以整个 grounding 被拆成先找到可能存在的视觉区域 再判断语言对应哪个区域论文把这两部分称为Localization Recognition这种解耦设计也是 GROUNDHOG 和 LISA 一类方法非常明显的区别。3. 第一步生成尽可能全面的候选 mask既然后面只能从已有 mask 中选择那么前面的 mask proposals 就必须尽量全面。GROUNDHOG 希望候选区域覆盖不同语义粒度完整物体 背景区域 物体部件 文字区域例如dog、grass、dogs tail、sign textproposal 覆盖能力决定后续 grounding 的上限因为如果“狗尾巴”从一开始就没有被切成候选区域那么后面的 MLLM 即使知道用户说的是狗尾巴也没有对应的 mask 可以选择。4. 为什么作者要设计 Mask2Former普通 Mask2Former 主要在 COCO Panoptic 上训练因此对于 COCO 常见类别很好但对于物体部件、视觉文字、开放世界中的其他实体 覆盖能力不足。所以作者构建了Mask2Former。他们整合了 COCO、LVIS、Entity-v2、Pascal、PACO、MHP-v2、TextOCR 等数据并在原本的 200 个 entity queries 基础上增加50个 part queries 50个 text queries专门增强物体部件和文字区域的候选 mask 生成能力。Mask2Former 负责“尽可能把图里的有意义区域都切出来”它还没有负责语言理解。5. 第二步把每个候选 mask 变成 MLLM 能理解的视觉表示现在假设已经得到为方便模型解耦GROUNDHOG 只拿 Mask2Former 产生的binary mask并不直接使用 内部的 feature。而是然后整张图分别经过 CLIP 和 DINOv2得到两套 feature maps。对于某个 mask分别做 mask pooling本质上就是利用 mask只保留这个区域相关的视觉特征再进行聚合。然后分别经过 MLP 映射到 MLLM 的 embedding 空间最后相加最终的就是这个候选区域对应的也就是说一个 mask 对应一个视觉实体 token。6. 这时 MLLM 实际上看到的图像是什么经过上一步之后GROUNDHOG 不再只是把图像理解成一堆普通 patch。而是变成一组视觉实体Image → 一组视觉实体如 第一只狗 第二只狗 草地 某个文字区域这些 Visual Entity Tokens 会进入 MLLM后面语言 grounding 的本质就是当前语言描述到底和哪几个 visual entity tokens 最匹配7. 第三步语言如何变成一个 grounding query假设模型生成I see GRD two dogs /GRD on GRD the beach /GRDGRD和/GRD表示中间这段语言需要和图像区域对应。对于GRD two dogs /GRDMLLM 最后一层分别得到和然后相加得到可以直接把q记成“two dogs” 这个需要被定位的语言短语的表示8. 第四步用 q 去选择前面的候选区域现在已经有两类东西语言q视觉拼接经过 MLP得到一个 score代表这个候选区域Mi 和当前语言 phrase 的匹配度如对于 two dogs可能得到模型就知道对应 two dogs。所以这里 GROUNDHOG 的 grounding本质就是9. 为什么它天然支持多个目标因为 GroundHog 不是只能选一个 mask。对于 two dogs两个 dog mask 都可以获得高分。最后模型把高分 mask 合并所以可以一起组成最终结果。因此它天然支持和甚至本质上都统一成从候选 mask 中选择并组合10.PTRGROUNDHOG 还可以反过来让用户“指区域”GROUNDHOG 不只是也支持例如用户指着某个位置What is thatPTR?这里PTR代表用户提供的 point、box 等空间提示。GROUNDHOG 可以先用 SAM然后同样经过前面的再用这个视觉实体 token 替换PTR。因此 MLLM 就能理解用户现在到底指的是哪一个区域。这使得模型可以进行 Referential Dialogue也就是基于空间指示进行交互。11. M3G2 数据集训练模型把各种任务统一成 grounded dialogue作者构建了它把很多已有 grounding、segmentation、VQA 数据重新整理成统一的视觉对话形式。主要包括四类任务Grounded Image Captioning生成 caption同时把里面的 phrase 和 mask 对应起来。Referring Expression Segmentation给一句语言找到对应 mask。Grounded Visual Question Answering回答问题同时给出支持这个答案的像素区域。Referential Dialogue用户通过 point、box、region 等方式和模型交互。前文和表格描述M3G2 大约2.5M text-image pairs、36 个子任务、来源于 27 个数据集。但结论部分又写成了1.9M training text-image pairs12. 这篇论文真正想证明的不是“某一个分割任务做到最好”作者更强调GROUNDHOG 是一个 generalist grounded MLLM即同一套模型参数可以同时处理、、、而不是一个模型只专门做一个 segmentation benchmark。在这些任务上使用的是同一组模型权重没有针对每个数据集单独 fine-tune。在 RefCOCO、RefCOCO、RefCOCOg、gRefCOCO、PhraseCut、ReasonSeg 等任务上它整体表现也比较强。13. 为什么作者强调“可解释”和“可诊断”这种的解耦还有一个很重要的好处。如果最后 grounding 错了可以检查情况一目标区域根本没有被 proposal model 切出来。那么问题在情况二目标区域其实已经存在但 MLLM 给它的 score 很低。那么问题在如图对应区域其实已经被成功 proposal 出来了但 MLLM 没有正确识别 “KWIK”所以没有把对应 mask 选中。所以相比 LLM hidden state → 直接生成 maskGROUNDHOG 更容易知道错在哪一步14. 实验里还有两个比较重要的结论1、 hallucination在 M3G2 中加入 negative QA问题里问到的目标在图像中不存在正确答案应该否定 数据再加上模型要求语言和视觉区域建立明确对应因此在 POPE 上 object hallucination 明显减少。但不是 pixel grounding 彻底解决了 hallucination更准确的是共同改善了 hallucination。2、消融实验作者发现整体优于单独使用其中一个同时整体效果优于只使用其中一个 boundary token 的 hidden state。15. 论文局限本质上仍然是在“选已有的 mask”它的流程是先 proposal → 再 retrieval因此没有 proposal 出来的区域MLLM 很难凭空生成如用户问red brick spire但 Mask2Former 只 proposal 出整个 tower没有单独 proposal 出 spire那么即使 MLLM 完全理解 “spire”也只能从已有 mask 中选择很难得到精确的尖塔区域。所以它的最大优点和最大局限来自同一个设计把 segmentation 和 language grounding 解耦优点是模块化、可替换、可解释缺点是最终 grounding 的上限受到 mask proposal 的限制如果现在把整篇论文最后压缩成一条完整链路你可以记成图像 → Mask2Former 产生候选 mask → CLIP/DINO 提取每个区域特征 → Visual Entity Tokens然后语言这一边最后q {e1, …,eN} → 给候选区域打分 → 选择并合并 mask所以整篇 GROUNDHOG 最核心的一句话它不是让 MLLM 学会“画 mask”而是让 MLLM 学会“理解并选择已有的像素级视觉实体”。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

Laravel-Lang/lang 仓库贡献指南:环境搭建、测试与本地化翻译工作流 2026/9/27 7:13:30

Laravel-Lang/lang 仓库贡献指南:环境搭建、测试与本地化翻译工作流

后端 【免费下载链接】lang List of 128 languages for Laravel Framework, Laravel Jetstream, Laravel Fortify, Laravel Breeze, Laravel Cashier, Laravel Nova and Laravel UI. 项目地址: https://gitcode.com/gh_mirrors/la/lang 点击查看 免费下载 本篇技术…

阅读更多 →
做网站怎么穿插元素避坑指南:5个方案实测 2026/9/27 7:13:30

做网站怎么穿插元素避坑指南:5个方案实测

做网站怎么穿插元素避坑指南:5个方案实测 很多老板找我们做站,第一句话往往是:“域名买好了,服务器选了个最便宜的,结果网站打开像蜗牛,还老掉线。”这就是典型的 域名服务器搞不懂…

阅读更多 →
黄冈网站推广软件下载速查手册:3步修复被黑挂马漏洞 2026/9/27 7:13:24

黄冈网站推广软件下载速查手册:3步修复被黑挂马漏洞

黄冈网站推广软件下载速查手册:3步修复被黑挂马漏洞 网站突然打不开,或者打开全是乱七八糟的弹窗广告?后台密码改了也没用,页面代码里全是乱码?这就是典型的网站被黑挂马。别慌,这种时候盲目重装系统往往治标不治本,甚至可能丢失关键数据。很多黄冈本…

阅读更多 →
把数据中心搬上天:谷歌“太阳捕手计划“即将发射首颗TPU卫星,太空算力竞赛正式打响 2026/9/27 7:13:24

把数据中心搬上天:谷歌“太阳捕手计划“即将发射首颗TPU卫星,太空算力竞赛正式打响

一台普通冰箱大小的卫星,将在不久后把四颗谷歌自研的TPU芯片送入近地轨道。这不是科幻电影的桥段,而是谷歌刚刚敲定的真实行程——代号"MVP"的原型卫星已确定搭乘SpaceX猎鹰9号火箭的Transporter-18拼车任务,从范登堡太空军基地升空…

阅读更多 →
5个wordpress+的客户避坑指南:域名服务器哪家选好 2026/9/27 7:13:05

5个wordpress+的客户避坑指南:域名服务器哪家选好

5个wordpress+的客户避坑指南:域名服务器哪家选好 找建站公司最怕什么?不是功能少,而是域名和服务器被坑高价。很多wordpress+的客户在询价时,对方报个“高端服务器”一年好几千,结果配置低得离谱,备案还卡在中间。到底域名服务器…

阅读更多 →
AI 做手机壁纸:万能公式 + 25 个模板 2026/9/27 7:12:39

AI 做手机壁纸:万能公式 + 25 个模板

找壁纸翻半天不是带水印就是分辨率低,用 AI 生成又怕出来的图灰扑扑不能看? 这篇文章分两部分:先教你一个壁纸提示词万能公式,学会了自己能组合出几百张;再给你 25 个国内最热门风格的现成模板,二次元、国…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉