新闻详情

新闻详情

首页 / 资讯中心 / 详情

SAM2

发布时间:2026/9/25 18:32:52来源:尧图网络
SAM2
最重要的不是把 memory bank、object pointer、temporal position encoding 全部一次吃透而是先建立两个核心认知SAM 2 把 SAM 的 promptable segmentation 从 image 扩展到 video以及原来 SAM 学到的 segmentation prior 仍然被保留只是前面多了一层时序条件化1. promptable segmentation 怎么从 image 扩展到 videoSAM 里的任务是也就是在一张图上给 point / box / mask输出这一张图里的目标 mask。SAM 2 把这个任务定义成Promptable Visual Segmentation, PVS。输入变成Video Prompt on any frame输出不再只是单张 mask而是整个视频里的masklet同一个目标在一段视频中跨多个帧的连续 mask 序列也就是目标物体在一系列视频帧上的时空 segmentation。论文明确说prompt 可以放在视频任意帧上模型要预测目标 segment 的 spatio-temporal mask也就是 masklet。最核心的扩展变成2. Prompt 本身其实没有发生根本变化SAM 2 的 prompt encoder 和 SAM 是相同的。它仍然支持 positive / negative pointboxmask。Sparse prompts 仍然是position encoding learned prompt-type embeddingmask 仍然通过 convolution 编码然后加到 frame embedding 上。也就是说从接口上看它真正扩展的是一个 prompt 的影响范围从当前 image 扩展到了整个 temporal sequence。3. SAM 2 的任务层面变化SAM 中一个 point 只需要回答“这一张图中我点的是哪个 region”SAM 2 中一个 point 要回答“我在 frame 1 点的是这个 object那么这个 object 在 frame 2、frame 3……分别在哪里”所以spatial prompting 扩展成了 spatio-temporal prompting更进一步SAM 2 允许在后面的任意 frame 继续加 prompt 修正。如frame 1: click先确定 object。然后 SAM 2 自动传播假设 frame 3 出错了可以frame 3: another click这个修正不是只改 frame 3而是可以继续影响整个 masklet。Figure 2 展示的就是这个过程第一次 prompt 在 frame 1目标传播到后续帧如果中间丢失目标只需在后续帧再加一个 correction click模型就能利用已有上下文恢复目标。这就是 PVS 比传统 image promptable segmentation 多出来的东西。4. 为什么这比“SAM tracker”更自然传统的一个办法是SAM video tracker视频里的目标跟踪器流程可能是问题是这两个模块是分开的。如果 tracker 在 frame 10 跑偏了你通常得再用 SAM 把 frame 10 重新分出来然后 tracker 从 frame 10 重新开始。SAM 2 则是统一模型prompting segmentation temporal propagation 都在同一套表示中完成。论文也专门指出传统 “SAM tracker” 的问题之一是一旦出错很难利用之前的交互上下文进行自然 refinement而 SAM 2 可以直接基于历史 memory 修正。所以可以把任务升级理解成single-frame interactive segmentation → interactive spatio-temporal segmentation5. segmentation prior 是怎么被复用的这个其实和 CONVERSEG 非常相关。segmentation prior可以理解成SAM 已通过大规模segmentation数据学到了非常强的“什么东西构成一个合理mask”的先验。包括object boundarypart / whole structureforeground continuityshapelocal textureregion groupingpoint / box / mask 到 pixel region 的映射关系。SAM 已经很擅长prompt-conditioned spatial segmentationSAM 2保留原来的 prompt-to-mask decoder 范式 给当前帧特征加入 temporal memory context6. SAM 2 的整体结构可以先压缩成这样先别看复杂 memory 细节只看主干是当前 frame 的视觉表示然后 SAM 2 多加一步得到一个memory-conditioned frame embedding最后论文的描述非常清楚SAM 2 spatially behaves similarly to SAM轻量的 promptable mask decoder 接收 frame embedding 和 prompts然后输出当前 frame mask。区别在于这个 frame embedding 不再直接来自 image encoder而是先被 memory 条件化。7. 所以 segmentation prior 到底藏在哪里主要有两处。第一处是SAM-style prompt encoder第二处更重要SAM-style mask decoderSAM 2 论文明确说decoder design largely follows SAM。依然使用two-way transformer 去更新prompt embeddingsframe embeddings。而且 ambiguous prompt 时依旧预测 multiple masks。所以 SAM 2 的 spatial segmentation 核心没有变成一个纯 tracker。它仍然在做只是现在 visual features 已经是temporal-context-aware 的了。8. 可以把它理解成“先加入时间信息再调用 SAM 的分割能力”SAMSAM 2所以Memory Attention 不负责真正生成 mask它主要负责“当前 frame 里面哪些视觉信息与我们之前追踪的那个 object 有关”然后真正的 pixel-level segmentation仍然交给 SAM-like mask decoder。CONVERSEG 也是前面模块负责提供更高级的语义条件后面的 SAM2 decoder 负责把这个条件落到 pixels。9. 这就是所谓 reuse segmentation prior 的核心你可以用一个非常简化的类比。SAM 已经学会“给我一个好的 condition我很会画 mask。”SAM 2 不重新学习“怎么画 mask”。它重点学习的是“视频中当前 frame 的 condition 应该如何结合之前 frame 的信息。”所以Spatial segmentation knowledge 是被继承的新增的是Temporal object correspondence也就是同一个 object 在不同 frame 中如何持续对应10. Image Encoder 也发生了变化但思想没变SAM 用的是 ViT image encoder。SAM 2 换成了也是 MAE-pretrained。Hiera 是 hierarchical image encoder可以提供 multi-scale features。它为每个 frame 先提供unconditioned tokens。“unconditioned”纯当前 frame 的视觉信息还不知道用户要哪个 object之前 object 长什么样object 上一帧在哪里。之后经过 Memory Attention才变成也就是 object-conditioned / memory-conditioned frame feature。11. Memory Attention 暂时只需要理解成“检索之前目标信息”只需要记比如 frame 1 里用户点了 dog那么 memory 里会保存一些与这个 dog 有关的信息。到 frame 2本来只是frame 2 中所有东西的视觉表示。经过 memory attention相当于模型被提醒“我们现在关心的是之前那个 dog。”然后就可以继续分那个 dog。Memory attention 的作用正是让当前 frame feature 去 cross-attend 之前的 frame memory 和 object information。12. 为什么说这就是“reuse segmentation prior”而不是重新做 video segmentation因为 SAM 2 的思路不是全新 video segmentation network而是它隐含一个假设视频 segmentation 的难点不一定是重新学习“什么是 mask”更主要的是如何让已有强 spatial segmentation 能力在时间轴上保持 object identity。换句话说SAM 已经解决了where are the pixels of this object?SAM 2 新增解决which object in the current frame corresponds to the previous target?然后再调用已有 segmentation 能力。13. 为什么 mask decoder 仍然保留 two-way transformer因为即使到了 video当前 frame 里还是要解决的对齐问题。所以 SAM 2 仍然需要同时进行双向交互。只不过现在frame features 已经经过 memory attention。所以可以写成然后14. SAM 2 保留了 SAM 对 ambiguity 的处理SAM中一个 point 可能对应whole object / part / subpart所以输出多个 masks。SAM 2 里还是一样而且 video 中 ambiguity 更复杂因为 ambiguity 可以跨帧持续存在。因此 SAM 2 依旧 predict multiple masks如果用户后面没有额外 prompt 来消除 ambiguity就传播 predicted IoU 最高的那个。15. 但 video 多了一个 SAM 没有的问题目标可能消失SAM 中如果给了 positive point一定存在一个可以分割的东西但视频中 frame 1 有这个 objectframe 10 可能被完全遮挡所以 SAM 2 新增了一个 headobject present? 判断当前 frame 是否存在目标。这个细节其实很能体现不是单纯“多跑几帧”而是任务定义本身发生了变化。16. 现在再看 segmentation prior 的复用会更清楚可以把 SAM 2 拆成两层能力第一层Temporal reasoning / correspondence负责核心模块Memory Attention第二层Spatial segmentation负责核心模块Prompt Encoder Two-Way Mask Decoder这一层大量继承 SAM。所以SAM 2 temporal association SAM-style spatial decoding虽然这是一个简化总结但对你现在理解架构非常有效。17. 这和 CONVERSEG-NET 的关系其实更直接了之前看 CONVERSEG-NET 时重点是因为 SAM2 已经提供了非常强的segmentation prior所以作者直接复用 SAM2 decoder也就是给定一个合适的高层 condition怎么把它稳定地落到 pixel mask。CONVERSEG 不需要重新学习boundarymask topologylocal detailregion coherence。它主要需要解决抽象语言语义 → SAM2 能理解的 conditioning representation然后SAM2 decoder 负责 condition → pixels18. 现在读 SAM 2建议只记住这张图可以先把整篇论文压缩成然后再最后预测结果又会供下一帧使用。最重要的是当前帧不是直接进入 mask decoder 而是先被历史目标信息条件化然后真正的 spatial segmentation 仍然复用 SAM 的 decoder 范式SAM 提供 prompt-to-mask spatial priorSAM 2 在此基础上加入 memory-conditioned visual representationCONVERSEG 再进一步把 VLM semantic representation 接到这个 segmentation interface 上所以三篇工作的关系可以很简洁地理解为SAM: prompt → pixelsSAM 2: prompt memory → pixelsCONVERSEG: VLM semantics → SAM2-style prompt/conditioning → pixels
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

基于昇腾Atlas 300V 24G推理卡的YOLO模型部署与调优实践 2026/9/25 19:09:58

基于昇腾Atlas 300V 24G推理卡的YOLO模型部署与调优实践

前阵子团队准备把一套基于YOLOv5的检测服务从GPU服务器迁移到昇腾Atlas上,群里讨论最多的一句话就是:“atlas 300v 24g是运算加速卡吗?”我当时也愣了一下。后来翻完产品文档、踩了一周坑,才算把这卡的脾气摸清楚。如果你也是第一…

阅读更多 →
AllData数据中台集成DB-GPT:构建自然语言查询与多模态数据交互的智能数据问答系统 2026/9/25 19:09:58

AllData数据中台集成DB-GPT:构建自然语言查询与多模态数据交互的智能数据问答系统

1. 数据中台与AI多模态数据库的融合背景1.1 从“数据孤岛”到“智能资产”的演进逻辑做过数据中台的人都有一个共同的痛:数据接进来了,表建好了,指标跑通了,但业务方还是不会用。他们不想写SQL,不想看BI看板&#xff0…

阅读更多 →
DEAP脑电情绪二分类实战:从EDF加载到XGBoost建模 2026/9/25 19:09:58

DEAP脑电情绪二分类实战:从EDF加载到XGBoost建模

简介:本资源是一套基于DEAP脑电数据集的轻量级脑电情绪二分类实践方案,面向人工智能初学者、生物医学工程入门者及机器学习爱好者,聚焦情绪识别这一典型小样本分类任务。项目完整覆盖信号处理(FFT频域转换)、特征预处理…

阅读更多 →
人AB血清如何从科研走到IND/BLA?CGT原辅料资料包与DMF路径完整解析 2026/9/25 19:09:45

人AB血清如何从科研走到IND/BLA?CGT原辅料资料包与DMF路径完整解析

摘要: CGT项目中的人AB血清选型不仅影响T细胞、NK细胞等细胞扩增,也会直接影响后续IND/BLA阶段的CMC资料准备。如果项目早期只按照细胞生长表现和采购价格选择血清,进入临床开发后才发现材料来源、供体控制、病原体安全、质量文件或DMF支持不…

阅读更多 →
实时Linux为什么要隔离内核?从系统调用到内核抢占,看懂硬实时系统的最后一道实时性边界 2026/9/25 19:09:32

实时Linux为什么要隔离内核?从系统调用到内核抢占,看懂硬实时系统的最后一道实时性边界

前面的文章我们一直在讨论一个核心问题:如何让实时任务不被其他任务干扰?从CPU核心隔离,到IRQ隔离;从内存、Cache、DMA等资源控制,到实时IPC;再到Watchdog和故障隔离,我们实际上已经逐渐建立起了…

阅读更多 →
实时Linux中的Watchdog到底有什么用?从任务超时到系统自恢复,看懂硬实时系统如何处理“失控任务” 2026/9/25 19:09:26

实时Linux中的Watchdog到底有什么用?从任务超时到系统自恢复,看懂硬实时系统如何处理“失控任务”

在工业机器人、智能制造、无人系统、飞控、能源控制等场景中,实时操作系统面对的并不只是一个问题:“任务能不能按时运行?”还有一个更加现实的问题:“如果任务没有按时运行,系统怎么办?”例如,…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉