新闻详情

新闻详情

首页 / 资讯中心 / 详情

从一段视频重建三维世界:Every-Embodied LingBot-Map流式三维重建完整教程

发布时间:2026/9/26 3:16:45来源:尧图网络
从一段视频重建三维世界:Every-Embodied LingBot-Map流式三维重建完整教程
从一段视频重建三维世界Every-Embodied LingBot-Map流式三维重建完整教程【免费下载链接】every-embodied仅需Python基础从0构建自己的具身智能机器人从0逐步构建VLA/OpenVLA/SmolVLA/Pi0 深入理解具身智能项目地址: https://gitcode.com/gh_mirrors/ev/every-embodiedEvery-Embodied 是一个只需 Python 基础、从 0 构建具身智能机器人的开源教程项目。本篇教程聚焦其中的LingBot-Map 流式三维重建模块输入一段连续视频它就能边看边估计相机轨迹、逐帧深度和点云地图——不需要深度相机、不需要激光雷达。跟着本文你也能用自己的手机视频快速重建出一个三维世界。为什么值得学视频流式三维重建传统三维重建摄影测量、SfM要先把整个场景拍完再离线等待数小时而机器人真正需要的是边走边建图流式推理视频逐帧输入空间表示持续更新不用等视频拍完再处理️直接产出可用几何相机位姿 深度 点云/体素渲染视频可作为 SLAM、导航、3DGS 的前端输入门槛低一段普通单目视频即可仓库自带官方示例几分钟跑通。小提示LingBot-Map 的输出更接近流式相机位姿 深度 点云/体素渲染并不是一个可直接编辑的 3DGS 场景模型两者的区别后文会讲。下图是官方示例university校园雪景连续行走镜头流式推理逐步生成的点云地图关键帧快速上手3 步跑通官方示例建独立环境建议单独建 mamba/conda 环境安装 PyTorch 2.8.0 CUDA 12.8再pip install -e .并安装渲染依赖完整命令见 03-LingBot-Map视频流式三维重建.md。下载权重把长视频权重lingbot-map-long.pt放到checkpoints/目录长视频、大场景优先用它。跑官方university场景python demo_render/batch_demo.py \ --input_folder example --scenes university \ --image_range 0:240:2 \ --output_folder outputs/official_university_scan \ --model_path checkpoints/lingbot-map-long.pt常用参数速查参数作用首次运行建议--image_range帧采样范围与步长0:240:2约 120 帧--num_scale_frames尺度参考帧数4--video_width / --video_height输出视频分辨率640 / 360--use_sdpa注意力加速开启--save_predictions保存中间预测结果开启120 帧的 smoke test 推理速度约十几 FPS并生成百万级点云/体素速度会随 GPU 与分辨率变化。扫描自己的环境4 条拍摄技巧 拿到自己的视频后重建质量一半取决于怎么拍单场景连续移动剪辑视频会瞬间切换视角模型会把不连续的空间关系硬接在一起产生漂移和破碎点云让相机有视差可以转弯、环绕、轻微俯仰但纯原地旋转或纯远景平移很难恢复稳定尺度减少纯天空占比室外扫描时尽量压低天空占比必要时启用 sky mask先短后长先用 60~120 帧验证管线稳定再逐步加长视频。LingBot-Map 只需要单目 RGB 视频不依赖深度相机的主动测距结构流式三维重建是怎么工作的LingBot-Map 不孤立地处理每一帧而是维护跨帧流式状态把前面看到的内容作为后续帧的上下文可以拆成三层能力层次做什么视觉编码把每一帧图像转成视觉特征时序聚合用流式状态保留历史帧信息避免长视频重复计算几何输出预测相机位姿、深度与世界点再转成点云/体素渲染其中深度是最核心的中间产物——每一帧都会得到一张对应的深度图深度叠加相机位姿后就还原出了三维空间点云渲染 vs 3DGS别搞混这两个概念很多人第一反应是这不就是 3D Gaussian Splatting 吗区别在于LingBot-Map本文流式输出几何估计 点云/体素渲染可接近实时产物是可用于导航和检查的三维结构3DGS需要显式高斯参数优化或训练流程产物是可交互渲染的高质量场景见下图示意所以定位要清晰LingBot-Map 回答的是从机器人视角的视频流中持续恢复三维结构3DGS 回答的是把场景做成一张可编辑的高保真渲染地图两者可以串联使用。Web demo上传视频直接看点云教程仓库内置了一个极简 Web 包装器 tools/lingbot_map_web_demo/三步出结果克隆教程仓库获取 demogit clone https://gitcode.com/gh_mirrors/ev/every-embodied用环境变量指向你的 LingBot-Map 项目、权重和 Python 解释器然后运行python app.py浏览器打开127.0.0.1:7860上传一段连续视频页面即可展示原始视频 / 点云渲染 / 原视频与点云对照三段结果和执行日志。下方动图左为点云渲染、右为原始视频可以直观看到流式重建与拍摄轨迹的对应关系⚠️ 注意该 Web demo 定位为教程展示与 smoke test长视频推理占用显存和磁盘较多不建议直接作为生产服务公开部署。常见问题 FAQQ1输出是实时 3DGS吗不是。它是流式几何估计 点云/体素渲染3DGS 还需要额外的高斯参数优化流程。Q2为什么剪辑视频重建效果差重建依赖相邻帧的几何一致性剪辑会造成空间关系突变点云容易漂移、错位。Q3没有 CUDA 12.8 / 新架构 GPU 怎么办若 CUDA kernel 或 CUDA 扩展编译失败再考虑升级 CUDA Toolkit并保证 PyTorch、驱动与依赖版本一致smoke test 本身通常不受影响。Q4权重和大体积输出文件要提交到仓库吗不建议。原始视频、权重和.npz预测文件放在本地数据目录或对象存储即可。延伸阅读 完整复现教程环境安装、CUDA 注意事项、论文与代码对应关系04-具身场景的计算机视觉、3D重建/03-LingBot-Map视频流式三维重建.md Web demo 入口与部署说明tools/lingbot_map_web_demo/README.md、tools/lingbot_map_web_demo/app.py️ 深度估计与 SAM 分割前置知识04-具身场景的计算机视觉、3D重建/01-sam和深度估计.md 把重建的地图用起来——导航算法入门08-具身导航及VLN/01快速入门导航算法详解及实战/具身导航算法基本介绍.md一段视频、一台带 GPU 的机器就能让机器人看见三维世界——这就是流式三维重建的魅力也是 Every-Embodied 具身智能学习路径中空间理解的关键一环。【免费下载链接】every-embodied仅需Python基础从0构建自己的具身智能机器人从0逐步构建VLA/OpenVLA/SmolVLA/Pi0 深入理解具身智能项目地址: https://gitcode.com/gh_mirrors/ev/every-embodied创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

AI应用开发全栈攻坚地图:中小团队实战指南 2026/9/26 3:52:07

AI应用开发全栈攻坚地图:中小团队实战指南

1. 这不是一张“地图”,而是一份AI应用开发者的生存手记我带过三届AI方向的校企联合实训营,也帮五家中小自研公司做过技术选型和团队搭建。每次聊到“AI应用开发全栈攻坚地图”,总有人掏出手机翻笔记、截图、甚至拍照——不是因为内容多高深&…

阅读更多 →
2026最新权威AI编程软件TOP8:TaoToken统一Key接入全场景效率进化指南 2026/9/26 3:52:07

2026最新权威AI编程软件TOP8:TaoToken统一Key接入全场景效率进化指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
知乎++Markdown渲染性能优化实战:滚动延迟341ms降到27ms,LaTeX公式与延迟布局全解 2026/9/26 3:52:07

知乎++Markdown渲染性能优化实战:滚动延迟341ms降到27ms,LaTeX公式与延迟布局全解

知乎Markdown渲染性能优化实战:滚动延迟341ms降到27ms,LaTeX公式与延迟布局全解 【免费下载链接】zhihu-plus-plus Zhihu | 知乎: Ad-free, low cost, AI powered zhihu android 3rd-party client. 去广告、占用低、AI大模型的新时代知乎安卓端体验 项…

阅读更多 →
PSO-CNN风电功率预测:多输入单输出时序回归调参实战 2026/9/26 3:52:07

PSO-CNN风电功率预测:多输入单输出时序回归调参实战

简介:本资源面向风电功率预测方向的学生与科研人员,提供一套基于粒子群算法优化卷积神经网络的PSO-CNN回归预测方案,用于处理多输入单输出的风电数据建模问题。压缩包共14个文件,约242KB,包含6个m脚本文件、6张png效果…

阅读更多 →
DeepSeek-V4.1 Flash 费用优化实战:从账单翻倍到成本减半 2026/9/26 3:52:00

DeepSeek-V4.1 Flash 费用优化实战:从账单翻倍到成本减半

算一笔账之前,先说结论:DeepSeek-V4.1 Flash 本身是个性价比很高的模型,但"模型便宜"和"账单便宜"是两回事。我见过太多人盯着 API 价格页觉得"每百万 token 才几块钱",结果月底一看账单直接懵了—…

阅读更多 →
Vibe Coding 实战:用 Spec、Skills、Plan 三步给 AI 编程立规矩,TaoToken 统一 Key 接入 2026/9/26 3:52:00

Vibe Coding 实战:用 Spec、Skills、Plan 三步给 AI 编程立规矩,TaoToken 统一 Key 接入

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉