新闻详情

新闻详情

首页 / 资讯中心 / 详情

LISA

发布时间:2026/9/25 18:08:55来源:尧图网络
LISA
1. 提出的新任务Reasoning Segmentation和传统 Referring Segmentation 很像但最大的区别在于 query。普通 referring segmentation用户已经明确告诉模型目标“the trash can”Reasoning Segmentation模型需要自己推理“something that the garbage should be put into”garbage should be put into → trash can所以这个任务实际上要求两个能力理解隐式指令 产生像素级 mask2. 为什么普通多模态 LLM 不够像 LLaVA 这样的模型可以image text → text它能回答“The object is an orange.”LLM 本身并不擅长直接输出 segmentation mask 这种 dense prediction。因此论文的问题变成怎么把 LLM 的语义/推理能力接到 segmentation 上3. LISA 最核心的设计SEGtoken作者在 LLM 的词表里加入一个特殊 tokenSEG比如模型接收到What is the food with the most Vitamin C? Please output segmentation mask.LLM 可能生成It isSEG.真正关键的不是SEG本身而是它在 LLM 最后一层对应的 hidden embedding把这个 embedding 取出来再经过一个 MLP这个可以理解成LLM 对“当前到底要分割什么”的内部语义表示。与此同时图像还会经过一个视觉 backbone得到 dense visual features。最后 decoder 同时接收和生成 mask也就是LLM负责 What Vision Backbone负责视觉信息 Decoder负责 Where这就是论文所谓的Embedding-as-Mask。4. 整个网络可以理解成两条支路第一条推理支路负责“用户究竟想分割什么”第二条视觉支路负责“图像中各个位置、边界、局部特征是什么”然后二者汇合所以本质上并不是让 LLM 自己画 mask而是让 LLM 产生一个指导 segmentation 的语义 query5. 为什么不让 LLM 直接输出 mask前面的 VisionLLM 有一种方案坐标序列然后让 LLM 自己生成这样 mask 就被转换成 token 序列了。但问题是polygon 序列可能很长精细边界很难用有限坐标表示LLM 不擅长精确预测大量空间坐标训练代价很高。LISA 的思路更简单LLM 不需要学“怎么画边界”。LLM 只要告诉 segmentation decoder“要找的是哪个目标”让专业的视觉 decoder 负责精细 mask。6. 训练数据怎么构造作者主要用了三类数据。第一类是Semantic Segmentation例如 ADE20K、COCO-Stuff 等。原始数据可能是Image pixel\ label作者改造成Can you segment the table?回答It isSEG.然后用 table 的真实 mask 做监督。第二类是Referring Segmentation例如 refCOCO、refCOCO、refCOCOg。比如原来的描述“the lady with the blue shirt”转换为Can you segment the lady with the blue shirt?第三类是VQA 数据。VQA 数据本身没有 mask但保留下来主要是为了避免模型在训练 segmentation 后丢失原有的对话能力、图像理解能力、文本生成能力论文的 Figure 4 就是在展示这三类数据的统一训练形式。7. Loss 怎么设计模型有两种输出一种是语言输出所以有即普通 autoregressive cross-entropy。另一种是 mask所以有用最后总 loss因此训练时既保证模型还会说话又保证SEGembedding 能真正用于生成 mask。8. 很有意思的一点最开始甚至没有 Reasoning Segmentation 训练数据这是这篇论文比较重要的发现。模型一开始只用SemanticSeg ReferringSeg VQA 这些数据训练。里面其实没有“维生素 C 最高的食物”这种真正的 reasoning segmentation 样本。但模型仍然能够 zero-shot 做 ReasonSeg。作者想说明LLM 预训练阶段已经具备一定 reasoning / world knowledge 而他们真正要学的是怎么把这种能力连接到 pixel mask。后来再加入只有239 条 ReasonSeg 训练数据性能还能明显进一步提升。9. 还构建了 ReasonSeg benchmark因为之前没有专门评估 reasoning segmentation 的 benchmark所以作者构建了ReasonSeg共1218 个 image-instruction-mask 样本。其中train239、val200、test779query 包含 short query 和 long query两者都要求一定的常识或推理。10. 实验结果说明了什么传统模型OVSeg26.1GRES21.3X-DecoderSEEM24.3Grounded-SAM在 ReasonSeg 上表现都比较差。而 LISA-7B 已经能达到36.8换成更强的 LLaVA1.5 48.7再换 13B 并加入 reasoning fine-tuning61.3 提升非常明显尤其是在 long query 上更明显。7B → 13B这说明这个任务的瓶颈很大程度上不是“mask画不准”而是“问题有没有理解对”所以更强的语言理解 / reasoning 模型会直接提高 segmentation 表现。11. 和“两阶段方法”相比为什么更好一个很自然的方法是也就是说LLM 先输出文字答案然后 segmentation 模型根据文字找目标。论文也做了这个 baselineLLaVA1.5 OVSeg但效果明显不如 LISA。作者认为主要有两个原因第一两阶段方法是完全分开的没有 end-to-end optimization。第二中间只通过文本“orange” 来传递信息会丢掉很多 LLM 内部已经形成的信息。LISA 直接用hidden embedding里面可能保留了更丰富的图像、语言和上下文信息。12. 这篇论文最值得记住的是什么我觉得不是某一个网络细节而是这个思路以前 segmentation 研究更多关心怎么把物体边界分得更准而 LISA 开始关心模型到底有没有理解“我要分割什么”它实际上把问题从pixel perception推进到了reasoning → grounding → pixels整篇论文可以压缩成一句话用 MLLM 理解和推理目标用 segmentation model 把目标落到像素上而SEGhidden embedding就是连接这两个世界的接口。它不是单纯设计了一个更好的 segmentation backbone而是在解决“高层语义/推理能力如何 grounding 到 dense prediction”这个问题。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

Coder自托管云开发平台:AI编码代理与GPU资源治理实践 2026/9/25 19:24:38

Coder自托管云开发平台:AI编码代理与GPU资源治理实践

1. 项目概述:这不是另一个“云IDE”,而是一套可完全掌控的开发者操作系统Coder 这个名字听起来像某个编程学习App,但实际它代表的是一类彻底改变开发工作流的基础设施级工具——自托管云开发平台。我第一次接触它是在帮一家做工业软件的客户重…

阅读更多 →
2026 AI Agent元年:小白也能抓住的财富机遇,速收藏! 2026/9/25 19:24:32

2026 AI Agent元年:小白也能抓住的财富机遇,速收藏!

本文介绍了AI Agent的概念及其在2026年的重要性。AI Agent不同于传统的聊天机器人,它能够接受目标并自主完成任务,如处理客服咨询、生成营销文案等。文章指出,由于技术的成熟和成本的降低,AI Agent的应用场景正在爆发,…

阅读更多 →
小白程序员必备:揭秘AI助手“会干活”的秘密,15节点带你掌握大模型核心链路 2026/9/25 19:24:26

小白程序员必备:揭秘AI助手“会干活”的秘密,15节点带你掌握大模型核心链路

本文深入剖析了AI助手从“只会回答问题”到“真正帮你把事情做完”的核心差异,揭示了其背后的完整执行链路——Agent Skills运行流程。文章详细拆解了包含15个节点、5个阶段的流程,涵盖用户意图理解、能力路由、技能准备、执行调用及结果返回等关键环节&…

阅读更多 →
自研CRM系统落地实战:从客户管理到工单流转的完整复盘 2026/9/25 19:24:19

自研CRM系统落地实战:从客户管理到工单流转的完整复盘

前阵子公司做内部流程梳理,数据处理和客户跟进的混乱程度已经到了让人头疼的地步。业务人员在Excel里记客户、在聊天记录里翻报价、在纸质本子上写备注,客户信息散落在十几个地方,谁接手都像在挖坟。我们最后决定不再忍了,用几周时…

阅读更多 →
从临床小白到AI医疗专家:收藏这份转型指南,轻松拿4W+高薪Offer! 2026/9/25 19:24:19

从临床小白到AI医疗专家:收藏这份转型指南,轻松拿4W+高薪Offer!

本文分享一位临床医学专业硕士如何通过转型,成为AI医疗应用人才的故事。核心内容为:医疗行业AI化趋势下,临床经验是核心竞争力;转型需掌握三个核心能力:转化临床经验为AI应用场景、学习AI应用而非算法、转变医生思维为…

阅读更多 →
小程序影院购票系统:高并发选座与微信支付V3实战 2026/9/25 19:24:13

小程序影院购票系统:高并发选座与微信支付V3实战

简介:这是一套面向计算机专业本科生的毕业设计级小程序开发实战项目,聚焦电影院购票全流程数字化管理,覆盖前后端协同开发、多角色权限控制与微信生态集成。资源包含完整可运行源码、MySQL数据库脚本及超万字详细设计文档,技术栈涵…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉