如何用LingBot-Map重建自己的数据集:从图片文件夹到点云全流程
如何用LingBot-Map重建自己的数据集从图片文件夹到点云全流程【免费下载链接】lingbot-mapA feed-forward 3D foundation model for reconstructing scenes from streaming data项目地址: https://gitcode.com/GitHub_Trending/li/lingbot-mapLingBot-Map 是一个前馈式 3D 基础模型专门用于从流式数据图片序列或视频中进行流式 3D 重建它逐帧读取图像直接输出稠密点云和相机位姿无需传统 SLAM 的迭代优化。本文将带你完成LingBot-Map 数据集重建全流程——从一文件夹普通图片到可在浏览器里旋转查看的点云场景再到一键生成点云飞行视频。️ 先认识 LingBot-Map它重建出来的是什么效果官方示例包含 courthouse法院外景、university大学校园、loop回环轨迹三个场景位于example/目录下。跑通后你会看到类似下图的点云重建效果一张约 25000 帧室内长视频重建后的俯视图它的三大核心能力Geometric Context TransformerGCT在单一流式框架内统一坐标定位、稠密几何线索与长程漂移校正高效流式推理带分页 KV Cache 的前馈架构518×378 分辨率下约20 FPS稳定推理可处理10000 帧长序列SOTA 重建质量在 KITTI、Oxford Spires、TUM 等基准上优于现有流式与迭代优化方法下面以 Oxford Spires 为例看它输出的相机轨迹估计蓝色 est与参考轨迹灰色 ref的贴合程度⚙️ 环境准备3 步完成安装需要 NVIDIA GPU CUDA。模型权重lingbot-map.pt可从 HuggingFacerobbyant/lingbot-map或 ModelScopeRobbyant/lingbot-map下载。第 1 步创建环境conda create -n lingbot-map python3.10 -y conda activate lingbot-map第 2 步安装 PyTorch推荐 CUDA 12.8 torch 2.8.0pip install torch2.8.0 torchvision0.23.0 --index-url https://download.pytorch.org/whl/cu128第 3 步安装项目本体git clone https://gitcode.com/GitHub_Trending/li/lingbot-map cd lingbot-map pip install -e .可选增强需求命令FlashInfer 加速推荐长序列性能最佳pip install --index-url https://pypi.org/simple flashinfer-python3D 可视化依赖pip install -e .[vis]离线渲染视频pip install -e .[vis,render] Kaolin ffmpeg 核心流程从图片文件夹到点云demo.py这是新手最常用的入口——一个命令把图片文件夹变成可交互的 3D 场景python demo.py --model_path /path/to/lingbot-map.pt \ --image_folder example/courthouse --mask_sky执行后会自动启动浏览器可视化工具viser打开http://localhost:8080即可拖动、缩放、旋转你的点云。换成你自己的数据集只要把--image_folder指向你的图片目录即可。支持.jpg / .png / .JPG图片按文件名排序脚本内部会自动裁剪为 518 分辨率并预处理逻辑见 load_images。常用参数速查表参数默认值说明--image_folder/--video_path—输入图片文件夹 或 视频文件二选一--fps10视频按目标帧率抽帧--stride1每隔 N 张取一张加速/省显存--first_k全部只处理前 k 张适合快速试跑--mask_sky关天空分割掩码室外场景强烈建议开启--conf_threshold1.5置信度阈值过滤低质量点--downsample_factor10点云显示降采样--camera_num_iterations4相机头迭代次数设为1更快--use_sdpa关未装 FlashInfer 时的注意力回退方案 快速验证建议先加--first_k 50跑前 50 张确认效果后再跑全量。️ 长序列怎么办Windowed 模式 批量渲染当序列超过约 320 帧KV Cache 会超出训练时的 RoPE 范围。两种应对方案方案 A--keyframe_interval3203000 帧每隔 N 帧存一个关键帧进 KV Cache非关键帧仍出预测、只不占缓存。在demo.py中该间隔会自动计算一般无需手动调。方案 B--mode windowed3000 帧长视频python demo.py --model_path /path/to/lingbot-map.pt \ --video_path my_video.mp4 --fps 10 \ --mode windowed --window_size 128 --overlap_keyframes 16 --keyframe_interval 2滑动窗口逐窗推理、相邻窗口共享重叠关键帧保持跨窗口位姿对齐。一键输出点云飞行视频batch_demo.py序列太长浏览器看不动用离线渲染管线demo_render/batch_demo.py一条命令输出 MP4 点云飞行视频python demo_render/batch_demo.py \ --video_path my_video.mp4 \ --output_folder outputs/my_scene/ \ --model_path /path/to/lingbot-map.pt \ --config demo_render/config/indoor.yaml \ --mode windowed --window_size 128 \ --keyframe_interval 10 --overlap_keyframes 8 \ --camera_vis default --keyframes_only_points \ --save_predictions输出文件位于outputs/my_scene/name_pointcloud.mp4—点云飞行视频主角name_pointcloud_rgb.mp4— 原始 RGB 帧视频name_pointcloud_config.yaml— 本次运行完整配置快照batch_results.json— 成功/耗时汇总 虚拟相机路径由 YAML 中的camera.segments描述内置demo_render/config/下三个预设default.yaml通用、indoor.yaml室内短景深紧凑跟随、outdoor_drive.yaml室外深景深车轨跟随。想设计自己的镜头复制预设后编辑camera:段即可——follow跟随机位、birdeye俯瞰揭示、static固定机位三种模式可自由拼接。️ 效果优化天空掩码与显存调优室外场景必开--mask_sky它用 ONNX 天空分割模型把天空点云过滤掉效果立竿见影。首次运行会自动下载skyseg.onnx掩码缓存在image_folder_sky_masks/重跑秒级完成。需要 GPU 加速可pip install onnxruntime-gpu。显存不足时的两个开关demo.py均已默认优化--offload_to_cpu逐帧预测卸载到 CPU默认开启--num_scale_frames 2把双向尺度帧从 8 降到 2显著降低激活峰值追求速度--camera_num_iterations 1可跳过 3 次相机头精修速度提升明显位姿精度损失很小。❓ 新手常见问题FAQQ1重建出来点云很散、位姿漂移优先检查三点① 图片是否按顺序连续拍摄脚本按文件名排序读取② 序列是否超过 3000 帧而未切--mode windowed③ 室外场景是否漏开--mask_sky。若出现位姿坍塌切到 windowed 模式多数情况调--keyframe_interval即可。Q2没有 FlashInfer 能跑吗可以加--use_sdpa回退到 PyTorch 原生注意力即可短序列体验差距不大。Q3视频输入和图片文件夹有区别吗流程一致。视频会自动按--fps抽帧并落盘成 jpg 图片文件夹后续处理完全相同。Q4想复现基准评测项目内置benchmark/评测管线覆盖 Oxford Spires、KITTI、TUM 等 10 个数据集见benchmark/configs/datasets/。Oxford Spires 数据需先用 preprocess/oxford.py 预处理。✅ 小结你的数据集重建路线图安装conda 环境 → PyTorch 2.8.0cu128 →pip install -e .→ 下载lingbot-map.pt试跑demo.py --image_folder 你的图片目录 --first_k 50 --mask_sky浏览器 8080 端口查看点云全量去掉--first_k超过 3000 帧加--mode windowed出片demo_render/batch_demo.py 室内/室外 YAML 预设一键生成点云飞行 MP4核心文件一览入口 demo.py、离线渲染 demo_render/batch_demo.py、相机预设 demo_render/config/、示例场景 example/、模型核心 lingbot_map/models/、论文 lingbot-map_paper.pdf。祝你的第一个点云场景顺利诞生 【免费下载链接】lingbot-mapA feed-forward 3D foundation model for reconstructing scenes from streaming data项目地址: https://gitcode.com/GitHub_Trending/li/lingbot-map创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考