Deep Learning for Computer Vision——Vision and Language
发布时间:2026/9/30 2:51:16来源:尧图网络
第一篇范式转变——从专用模型到基础模型1.1 传统范式 vs. 基础模型范式传统范式数据域1 - 模型1 - 任务1数据域2 - 模型2 - 任务2。每个任务都需要独立的模型和标注数据。基础模型范式大规模、多样化的数据集 - 基础模型Foundation Model - 微调/零样本/少样本 - 任务1, 任务2, 任务3...基础模型的特征通用、对多种任务鲁棒通常参数量巨大、训练数据海量、采用自监督预训练目标。1.2 基础模型的分类语言ELMo, BERT, GPT, T5。分类本课重点CLIP, CoCa视觉-语言分类基础模型。语言模型 视觉LM VisionLLaVA, Flamingo, GPT, Gemini, Qwen。链式ChainingLM CLIP, 视觉编程Visual Programming。其他Segment Anything分割、Whisper语音、Dalle/Stable Diffusion/Imagen文生图。1.3 回顾自监督学习SimCLR到视觉-语言嵌入SimCLR核心对同一图像做两次数据增强提取特征计算对比损失正样本拉近负样本推远。希望学到的表征能泛化到新实例。终极愿景如果表征空间不仅能嵌入图像还能嵌入句子/短语呢比如“My favorite dog is a golden retriever”和“A cute fluffy cat”应该与对应的图像在同一个嵌入空间中靠近。核心问题如何构建联合的视觉-语言嵌入空间第二篇CLIP——对比语言-图像预训练Contrastive Language-Image Pre-training2.1 数据收集与模型训练第一步收集海量数据4亿图像-文本对。从互联网抓取图像的 alt-text。为了覆盖广泛视觉概念使用50万个查询词每个查询词最多包含2万个图像-文本对。第二步训练模型。放弃预测精确单词图像描述生成改为对比学习。只需要匹配正确的描述与图像而无需一字不差地生成。架构图像编码器ResNet 或 ViT输出图像向量 u。文本编码器Transformer输出文本向量 v。2.2 CLIP的训练目标InfoNCE Loss给定一个批次 N 个图像文本对。计算所有 N×N 个图像-文本对的余弦相似度。目标最大化对角线上的相似度正样本对最小化非对角线上的相似度负样本对。公式双向 InfoNCE Loss% u: 图像特征矩阵 (N x D) % v: 文本特征矩阵 (N x D) % tau: 温度系数 (Temperature) % 计算相似度矩阵 logits (u * v) / tau; % (N x N) % 行方向 Softmax图像-文本 labels 1:N; loss_i2t cross_entropy_loss(logits, labels); % 列方向 Softmax文本-图像 loss_t2i cross_entropy_loss(logits, labels); % 最终损失 loss (loss_i2t loss_t2i) / 2;2.3 零样本推理Zero-shot Prediction——CLIP的魔法传统LLM零样本给定提示I love ___预测cake。或者The movie review I hated the movie is-negative。CLIP的零样本分类没有分类头No Classifier Head步骤1构建分类器把数据集的所有类别名称变成文本描述比如A photo of a [plane],A photo of a [dog]。送入文本编码器得到文本向量相当于分类器的权重。步骤2预测将待测图片送入图像编码器得到图像向量。步骤3匹配计算图像向量与所有类别文本向量的余弦相似度取最高分对应的类别。这类似于1-NN算法文本向量作为训练数据。提示工程Prompt Engineering使用A photo of a [category]而非单独的类别词能提升性能5% on ImageNet因为这更符合训练数据的分布。使用多个提示Prompt Ensemble取平均向量能进一步减少偏差。2.4 CLIP的惊人表现与泛化能力与ResNet101对比在ImageNet上CLIP ViT-L 零样本准确率76.2%与全监督训练的 ResNet101 持平但CLIP完全没有使用人类标注鲁棒性极强在 ObjectNet奇怪视角、ImageNet Rendition渲染图、ImageNet Sketch素描、ImageNet Adversarial对抗样本上ResNet101 性能暴跌如对抗样本跌至 2.7%但 CLIP 依然保持极高的准确率对抗样本 77.1%。线性探测 vs 零样本在大多数数据集上线性探测Linear Probe即用CLIP特征训练一个线性分类器效果最好28.9% on StanfordCars但在一些特殊数据集上零样本表现更好。2.5 为什么CLIP表现这么好无标签为何能打败有标签原因1) “无标签”其实有文本监督其实是一种弱监督2) 预训练规模极大3.07亿参数4亿图像3) 测试集泄露可能性低约2%。规模对比ImageNet ResNet 参数 4450万CLIP 参数 3.07亿。CLIP 训练数据 4亿图片。2.6 CLIP的变体与改进SigLIP使用 Sigmoid 代替 Softmax。优点不需要为了计算损失而将整个批次具体化Materialize极大节省显存。CoCa (Contrastive Captioners)在CLIP基础上增加了一个生成目标Captioning Loss和解码器。结合了对比学习和生成式学习的优点。在ImageNet上达到了最先进的91.0%准确率。2.7 CLIP的局限性缺点1过度依赖批次大小Batch Size。增加批次大小有助于理解细粒度概念Batch 4 animal, Batch 32000 Welsh Corgi但仍存在上限。缺点2组合性差Compositionality。无法区分草地上有一个马克杯和杯子里有一些草。解决方案难负样本微调Hard Negative Fine-Tuning如 ARO 数据集或使用区域级别的描述Region Captions替代全图描述。缺点3单一数据集无法涵盖所有知识。第三篇LLaVA——大型语言与视觉助手3.1 历史背景与动机语言模型LLM在数学、情感分析、符号推理上表现强大。能否构建一个接受图像和文本输入输出文本的模型ViLBERT (2019)早期视觉-语言模型但需要针对每个任务单独微调例如为 RefCOCO 设计 Mask-RCNN 边界框重排序非常任务特定Task-specific。3.2 LLaVA 架构与关键创新核心思想利用LLM的自回归特性将图像特征作为“视觉Token”输入到LLM中。Q: 应该使用CLIP的哪些特征不要使用CLStoken池化token因为它丢失了空间信息。使用倒数第二层的 Patch Token这些Token保留了空间和语言信息非常适合LLM。架构与训练配方初始化使用预训练的语言模型如 LLaMA作为 LLM 解码器预训练的图像编码器如 CLIP。桥接层Linear Layer训练一个全新的线性层将 CLIP 的特征映射到 LLM 的输入空间。联合微调微调 LLM 线性层。仅需约 178,000 个包含输入图像、指令和期望输出的样本就能获得合理的性能。3.3 Flamingo另一种融合方式架构视觉编码器处理图像。Perceiver Resampler将可变数量的图像Token转换为固定数量的Token解决分辨率不一的问题。GATED XATTN-DENSE在LLM中插入交叉注意力层Cross-Attention让文本Token Attend到图像Token。训练数据图文交错的序列数据Interleaved text and visual data使用image和eos标签标记图像出现和文本结束。能力支持上下文学习In-Context Learning。例如给几个“图像-描述”示例模型能自动推理出第三张图的描述甚至能进行简单的数学运算如213,5611, 然后推断3x618。结果在零样本和少样本任务上表现优异。第四篇现代格局、数据质量与全模型2026年展望4.1 开源与闭源的现状API Only闭源GPT-4o, Gemini 1.5 Pro, Claude 3.5 Sonnet。Gemini目前被公认为最强的专有视觉-语言模型。Open Weights开源权重可下载运行Qwen3-VL, LLaVA OneVision, Intern VL2。Qwen3-VL是典型代表。Qwen3-VL 的改进使用 SigLIP-2 视觉编码器而非 CLIP原生图像分辨率Native Resolution使用 2D-RoPE 处理不同尺寸视频帧时间以文本形式0.0 seconds输入。Distilled蒸馏模型从GPT等大模型蒸馏出的开源模型。Fully Open Source完全开源可复现训练Molmo 等。质量 vs 数量LLaMA 3.1V 使用 60亿图像-文本对网络数据偶然性强标注不充分。Molmo仅使用70万高质量、人类标注的图像-文本对PixMo 数据集。PixMo 数据采集人们不喜欢打字但喜欢说话。标注者被要求针对一张图片口述 60-90 秒然后自动将语音转化为文本得到极其详细、密集的描述。4.2 链式模型CuPL (Customized Prompts via Language models)问题模型遇到从未见过的概念如“marimba”, “viaduct”, “papillon”, “lorikeet”怎么办解决方案Chaining让 LLM如 GPT-3生成该词的详细描述。A marimba is a large wooden percussion instrument...将这些描述作为 CLIP 文本编码器的输入生成更丰富的文本嵌入。进行分类。在 ImageNet 及多个数据集上带来了显著的零样本提升。4.3 链式模型VisProg (Visual Programming)核心思想组合式视觉推理无需训练。让 LLM 写 Python 代码来调用各种现成的视觉模型VQA, Seg, Classify, Stable Diffusion 等解决复杂的推理任务。案例1多图VQA输入两张图问“左右两图加起来有6个人和2条船对吗”GPT-3 生成代码Class MyMultiImageVQA(): def ProcessIms(): Ans1 VQA(Image1) Ans2 VQA(Image2) return Ans1 Ans2案例2图像编辑指令“把沙漠换成茂密的绿草。”代码OBJ0 Seg(imageIMAGE) OBJ1 Select(imageIMAGE, objectOBJ0, querydesert) IMAGE0 Replace(imageIMAGE, objectOBJ1, promptlush green grass) RESULT IMAGE0VisProg 内置了图像理解Loc, FaceDet, Seg、图像操作Replace, ColorPop, BgBlur和知识检索List, Eval等模块。4.4 全模型Omni Models与总结全模型始于 2024 年的 GPT-4o。近期 Thinking Machines 和 Gemini 也推出了自己的模型。目标训练一个模型统一处理文本、音频、视频和视觉输入输出。CLIP总结模型参数 4450万ResNet- 3.07亿ViT-L数据量 4亿图像文本对零样本和线性探测表现极佳。Flamingo总结图文交错训练实现上下文学习。CuPL总结使用LLM生成自定义提示。VisProg总结使用LLM生成Python代码组合视觉模型。 复习建议与核心考点CLIP的InfoNCE Loss理解为什么它等同于互信息下界以及双向图像-文本文本-图像损失的计算方式。CLIP的零样本分类机制文本编码器变成分类器权重图像编码器提取特征余弦相似度匹配。LLaVA vs FlamingoLLaVA使用简单线性层桥接Token拼接Flamingo使用Perceiver Resampler和GATED XATTN-DENSE交叉注意力。组合性CompositionalityCLIP在“草地上有杯子” vs “杯子里有草”上的失败以及Hard Negative Fine-Tuning解决方案。数据质量 vs 数据规模Molmo 用 70万 高质量数据挑战 LLaMA 3.1V 的 60亿 网络数据。视觉编程VisProg利用LLM生成代码调用外部工具实现无训练的复杂视觉推理。
网站建设高端定制企业官网