新闻详情

新闻详情

首页 / 资讯中心 / 详情

Deep Learning for Computer Vision——3D Vision

发布时间:2026/9/30 2:50:10来源:尧图网络
Deep Learning for Computer Vision——3D Vision
第一篇3D视觉基础与多视图几何1.1 从2D到3D的回顾2D任务回顾分类CAT无空间范围、语义分割GRASS, CAT等不区分个体、目标检测边界框、实例分割区分不同个体如DOG1, DOG2。视频理解视频是一个 4D 张量T x 3 x H x W或3 x T x H x W。3D视觉的核心任务计算对应关系Correspondences、多视图立体Multi-view Stereo、运动恢复结构Structure from Motion, SfM、3D目标姿态估计、SLAM同步定位与建图、可微图形学、3D传感器。1.2 多视图CNN (Multi-View CNN, MVCNN)核心思想如果只有2D图片如何识别3D物体从多个角度看它流程从物体周围N个不同视角如12个或80个视角获取2D图像。每个图像通过CNN1提取特征。View Pooling视图池化对所有视图的特征进行逐元素最大池化Element-wise Max-Pooling。 为什么要Max-Pooling因为它是一个对称函数具有置换不变性Permutation Invariance。视图输入的顺序不会影响结果。池化后的特征通过CNN2生成最终形状描述符。全连接层 Softmax 输出分类。实验结果MVCNN (12 views) 在分类上达到 89.9%检索 mAP 达到 70.1%远超传统方法如SPH, LFD。第二篇几何预测——深度图与表面法线2.1 深度图Depth Map定义对于每个像素深度图给出相机到场景中该点物体的距离。RGB图像 (3 x H x W) 深度图 (H x W) RGB-D 图像2.5D。可以直接由 Intel RealSense, Microsoft Kinect 等传感器采集。预测任务输入 RGB 图像使用全卷积网络Fully Convolutional Network预测深度图。输出1 x H x W。 核心问题尺度/深度模糊性Scale/Depth Ambiguity由于透视投影一个小且近的物体在图像平面上看起来和一个大且远的物体完全一样。从单张图片中绝对尺度是模糊的。损失函数尺度不变损失Scale Invariant Loss我们不能使用简单的逐像素 L2 损失因为尺度不明。公式展开后等价于。其中​。这迫使预测的深度相对差异与真实值一致忽略绝对尺度。现代模型DepthAnything 系列利用大规模未标注图像和教师模型生成伪标签结合LiDAR、SfM等标注数据进行训练通过语义保持机制实现了极强的泛化深度预测。2.2 表面法线Surface Normals定义对于每个像素表面法线给出一个垂直于该点表面的向量。RGB: 3 x H x W - 法线: 3 x H x W。损失函数Per-Pixel Loss。计算预测向量 x 和真实向量 y 之间的余弦相似度即让预测法线和真实法线方向越接近越好。 课堂幽默医生对病人说“You are normal你法线正常/你是个正常人”双关语。第三篇显式3D表示——体素Voxels3.1 体素表示定义用 V×V×V 的3D网格表示形状类似3D版的掩码Mask1代表有物体0代表空。优点概念简单3D网格。缺点需要极高分辨率来捕捉细节扩展性差内存消耗巨大。3.2 3D 卷积3D Convolution将2D卷积扩展到3D。输入1 x 30 x 30 x 30使用6x6x6的3D卷积核一步步提取特征最后通过全连接层分类如3D ShapeNets。 内存灾难存储一个 1024³ 的体素网格如果每个体素用 float324字节表示需要1024*1024*1024*4 bytes ≈ 4GB仅仅是存一个物体3.3 八叉树Oct-Trees解决方案使用异构分辨率的体素网格。原理在物体表面附近使用高分辨率如 12831283在平坦空旷区域使用低分辨率如 32³。像树枝一样分裂。第四篇显式3D表示——点云Point Cloud4.1 点云基础定义用 3D 空间中的 PP 个点表示形状。优点可以表示精细结构不需要大量点。缺点需要新的网络架构和损失函数没有显式表示表面提取网格需要后处理。4.2 PointNet核心挑战点云是一组无序集合Set改变点的顺序不应改变输出。架构输入P x 3的点云。对每个点独立运行共享权重的 MLP多层感知机。得到P x D的特征。Max-Pooling在 PP 个点上进行最大池化得到全局的D维特征向量。再次利用最大池化实现对称函数保证顺序不变性。全连接层输出类别C。应用3D物体分类飞机杯子、点云语义分割给每个点分类、物体部件分割吉他琴弦、琴身等。4.3 传感器融合DenseFusion思路点云 RGB 图像结合。输入为(x, y, z, r, g, b)。流程RGB 通过 CNN 提取Per-pixel feature逐像素特征。点云通过 PointNet 提取Per-point feature逐点特征。将点投影到图像平面将对应的像素特征拼接到点特征上实现逐点特征融合。用于6D物体姿态估计。4.4 生成点云架构输入2D图像 - CNN 特征。分支1全连接层输出 P1×3全局点坐标。分支22D卷积输出 P2×3 的点密集预测。拼接(P1H′W′P2)×3 的点云。 损失函数Chamfer Distance倒角距离由于点云是无序的L2损失不能直接比较。Chamfer距离衡量两个集合的相似度直观理解对于集合1中的每个点找集合2中离它最近的点计算距离平方反过来再算一遍求和。这个函数是可微的可以反向传播。4.5 现代点云模型Point Transformer 系列将 Transformer自注意力机制应用于点云处理无序点集效果超越了 PointNet。第五篇显式3D表示——网格Mesh5.1 网格基础定义由顶点Vertices和面Faces通常是三角形组成的集合。优点图形学标准表示显式表示3D形状自适应性强平坦区域少用面细节区域多用面可以在顶点上附加数据RGB、纹理坐标、法线。缺点很难用神经网络直接处理拓扑结构不规则连接关系复杂。5.2 Pixel2Mesh任务单张RGB图像 - 三角形网格。核心思想迭代细化Iterative Refinement。从椭球体Ellipsoid Mesh开始。通过图卷积Graph Convolution逐步变形Mesh Deformation。同时从图像中提取特征Perceptual Feature Pooling引导变形。图反池化Graph Unpooling增加顶点数156 - 628 - 2466。损失函数Chamfer Loss比较预测网格的顶点与真实网格的距离。5.3 Mesh R-CNN任务2D图像 - 检测物体边界框、标签、实例分割以及每个物体的3D三角网格。架构Mask R-CNN Mesh Head。 混合3D表示Hybrid RepresentationMesh Deformation 的拓扑结构由初始网格固定限制了复杂形状。Mesh R-CNN 先用体素预测Voxel生成初始网格再进行变形Mesh Deformation。这结合了体素的灵活性和网格的精细度。流程输入图像 - 2D识别Mask R-CNN - 3D体素预测 - 生成初始网格 - 迭代变形 - 输出3D网格。5.4 现代网格生成MeshAnything 系列使用自回归 Transformer直接生成网格类似于语言模型生成文本。输入点云或图像输出网格的顶点和面序列。第六篇隐式3D表示Implicit Functions6.1 隐式函数基础定义学习一个函数判断任意3D点是在形状内部还是外部o:R3→{0,1}。表面Surface3D物体的表面是水平集Level Set {x:o(x)1/2}。代数曲面Algebraic Surfaces球体x²y²z²1环面心形。对于牛Cow这样复杂的形状无法用简单多项式表示。构造实体几何CSG通过布尔运算并集 Union、交集 Intersection、差集 Difference组合隐式几何。6.2 DeepSDF核心学习有符号距离函数Signed Distance Function, SDF。SDF定义对于空间中的点输出它到物体表面的距离。表面外为正表面内为负。网络输入3D坐标 (x,y,z)输出SDF值。优点可以表示任意复杂的拓扑结构分辨率无限连续表示。缺点是提取网格需要 marching cubes 算法。第七篇神经渲染——NeRF与3D高斯泼溅7.1 NeRF (Neural Radiance Fields, 幻灯片68-75)核心思想将场景表示为一个连续的神经辐射场。MLP输入3D位置 (x,y,z) 视角方向 (θ,ϕ)。MLP输出颜色 (r,g,b) 密度 (σ)。渲染Volume Rendering沿着相机射线Ray采样通过体渲染公式积分计算出像素颜色。成果能合成极其逼真的新视角View Synthesis。 现代变体Nerfies动态可变形场景、RawNeRF高动态范围HDR、BlockNeRF旧金山街区大场景。⚠️ 致命缺陷训练极慢V100 GPU 训练单个场景需 1-2 天。推理极慢生成一张 256x256 图像每像素224个采样点需要1460万次 MLP 前向传播7.2 3D Gaussian Splatting (3D GS)核心思想不再使用隐式MLP而是用显式的3D高斯分布3D Gaussians来表示场景。渲染沿着射线将这些高斯分布混合Blend在一起。类似于“泼溅”Splatting。 优缺点对比NeRF拟合慢、渲染慢、隐式建模。3D GS拟合快几分钟、实时渲染Real-time、显式建模。动态3D高斯Dynamic 3D Gaussians通过追踪高斯分布的运动实现动态场景重建和追踪。第八篇现代前沿与高级应用案例8.1 现代SLAM模型VGGT 系列任务从多帧图像中直接预测相机参数Camera Token、深度图Depth maps、点云图。架构使用 DINOv2 特征 全局注意力Global Attention 帧注意力Frame Attention的 Transformer。训练损失匹配损失Matching Loss 点损失Point Loss。8.2 现代3D物体生成TRELLIS 系列输入文本或图像 - 生成3D资产。架构结构化潜在表示学习Structured Latent Representation Learning。使用 DINOv2 提取视觉特征。使用稀疏 VAE 编码器/解码器处理体素。使用Flow Transformer进行结构生成和潜在生成。最终解码为 3DGS、RF 或 Meshes。8.3 现代3D世界生成Marble (World Labs)通过文本或图像直接生成完整的、可交互的 3D 世界场景例如一个带瀑布、木桥和植被的森林场景。 复习要点总结表示方法数据结构优点缺点代表模型深度图2.5D 像素直接获取仅单一视角尺度模糊DepthAnything体素3D 网格概念简单可3D卷积内存爆炸3D ShapeNets点云无序点集精细结构内存友好无表面需特定架构PointNet, Point Transformer网格顶点面图形学标准自适应难以用NN处理Pixel2Mesh, Mesh R-CNN隐式曲面连续函数无限分辨率拓扑灵活渲染需后处理DeepSDFNeRF连续MLP照片级真实极慢NeRF, BlockNeRF3D GS显式高斯实时渲染快显存占用较大3D Gaussian Splatting
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

广域网PPP协议详解:LCP协商、PAP/CHAP认证与PPPoE拨号配置 2026/9/30 3:40:20

广域网PPP协议详解:LCP协商、PAP/CHAP认证与PPPoE拨号配置

简介:这是一份面向网络工程师、运维人员及计算机网络学习者的广域网协议技术资料,聚焦PPP(点对点协议)及其扩展技术,帮助读者系统理解广域网链路层通信的建立、验证与封装机制。内容涵盖PPP协议组件(LCP、N…

阅读更多 →
VIP是什么:UVM验证中的协议预制弹药与工程实践指南 2026/9/30 3:40:19

VIP是什么:UVM验证中的协议预制弹药与工程实践指南

1. 验证IP(VIP)到底是什么?别被缩写唬住,它就是验证工程师的“预制弹药”刚入行那会儿,我盯着UVM代码里那一长串uvm_analysis_port、uvm_tlm_fifo和各种*_sequencer发懵,直到第一次在项目里调用Synopsys的A…

阅读更多 →
电商售后知识增强语言模型实战:DeepSeek API与工具调用编排 2026/9/30 3:40:19

电商售后知识增强语言模型实战:DeepSeek API与工具调用编排

简介:这份PDF文档面向电商售后技术团队、算法工程师与智能客服方向的研究者,系统讲解如何用知识增强语言模型解决复杂客户问题的诊断与方案生成难题。全文共1064页、75个大章节,从电商售后痛点与DeepSeek方案核心价值切入,依次展开…

阅读更多 →
CAD下载安装全指南:官方渠道、运行库补全与高频报错排查 2026/9/30 3:40:19

CAD下载安装全指南:官方渠道、运行库补全与高频报错排查

如果你正在搜“CAD下载安装”,大概率已经被搜索结果里那些“软件园”“一键安装”“关注公众号提取密码”折磨过。我做了十多年CAD相关工作,帮人装过上百次软件,最深的感受是:大多数人不是不会用CAD,而是被安装这一步劝…

阅读更多 →
PPP协议实战:从LCP协商到PPPoE拨号排错全解析 2026/9/30 3:40:19

PPP协议实战:从LCP协商到PPPoE拨号排错全解析

简介:这份PDF面向网络工程师、运维人员及备考网络技术认证的学习者,系统讲解广域网中广泛使用的PPP协议及其扩展技术,帮助读者理解点对点链路的数据封装、认证与接入原理。资源为单个PDF文档,压缩包约341KB,内容以图文…

阅读更多 →
鸿蒙开发:SoundPool快速播放音效破音的排查与优化指南 2026/9/30 3:40:13

鸿蒙开发:SoundPool快速播放音效破音的排查与优化指南

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉