拓冰建站拓冰建站
首页 / 资讯中心 / 正文

流式3D重建入门:LingBot-Map如何颠覆传统SfM与SLAM

流式3D重建入门LingBot-Map如何颠覆传统SfM与SLAM【免费下载链接】lingbot-mapA feed-forward 3D foundation model for reconstructing scenes from streaming data项目地址: https://gitcode.com/GitHub_Trending/li/lingbot-mapLingBot-Map 是一个用于流式3D重建的开源前馈式 3D 基础模型无需离线迭代优化视频帧逐帧输入即可实时输出相机位姿与稠密点云且能在超过 10000 帧的长序列上稳定运行。这篇文章带你从零上手这个 3D 重建基础模型 ️为什么传统 SfM 与 SLAM 不够用了在做 3D 场景重建时新手通常会遇到两类传统方案但都有明显短板方案工作方式主要痛点SfM运动恢复结构离线全局优化需要所有帧参与不能实时、序列一长就慢到无法接受SLAM即时定位建图逐帧迭代优化位姿与地图长序列误差累积漂移、参数难调LingBot-Map 换了一条路前馈推理。模型像一个一次看完的视觉大模型帧进来、结果出去没有束调整、没有闭环优化循环——这正是流式 3D 重建的核心含义。三大核心能力GCT、KV Cache 与长序列支持 LingBot-Map 的核心是一个GCTGeometric Context Transformer几何上下文 Transformer它在单一流式框架中统一了三件事锚点上下文Anchor Context为坐标定位提供稳定参照避免长序列位姿漂移位姿参考窗口Pose-Reference Window稠密几何线索的局部聚合轨迹记忆Trajectory Memory远距离漂移校正走 13 分钟视频也不迷路效率方面项目采用FlashInfer 分页 KV Cache 注意力实现见 lingbot_map/aggregator/stream.py 与 lingbot_map/models/gct_stream.py⚡ 在 518×378 分辨率下稳定跑到约 20 FPS支持10000 帧长序列流式推理。下面这张图就是官方长视频 Demo 的成片约 25000 帧、13 分钟的室内走动视频被流式重建出一张带相机轨迹的完整点云地图一键安装与首次运行5 分钟上手1. 克隆仓库并创建环境git clone https://gitcode.com/GitHub_Trending/li/lingbot-map cd lingbot-map conda create -n lingbot-map python3.10 -y conda activate lingbot-map pip install torch2.8.0 torchvision0.23.0 --index-url https://download.pytorch.org/whl/cu128 pip install -e .2. 安装 FlashInfer推荐流式推理更快pip install flashinfer-python3. 下载模型权重从 HuggingFace 或 ModelScope 的robbyant/lingbot-map仓库下载lingbot-map均衡版论文与基准测试使用推荐新手lingbot-map-long更适合长序列与大场景lingbot-map-stage1可加载进 VGGT 做双向推理的中间检查点4. 跑通第一个场景python demo.py --model_path /path/to/lingbot-map.pt \ --image_folder example/courthouse --mask_sky浏览器打开http://localhost:8080就能看到交互式 3D 点云查看器基于 viser——拖拽旋转、缩放你的第一个流式 3D 重建场景就完成了 ✅三个示例场景打开即用的 Demo 素材项目自带example/目录三个场景可直接运行场景命令要点看点example/courthouse--mask_sky户外建筑天空掩膜过滤天空点example/university--mask_sky大学校园长走廊结构example/loop无额外参数闭环轨迹直观展示漂移校正--mask_sky使用 ONNX 天空分割模型过滤天空点首次使用会自动下载分割模型掩膜结果会缓存二次运行零开销。基准测试结果9 大主流数据集实测 项目在 benchmark/ 下提供了完整的评测流水线prepare → run → evaluate → report覆盖 ETH3D、7-Scenes、TUM RGB-D、KITTI、Oxford Spires、VBR、DROID-W 等 10 个数据集。部分关键指标ATE 为 Sim(3) 对齐后的绝对轨迹误差越低越好数据集场景数ATE ↓RPE-平移 ↓TUM RGB-D90.0450.0137-Scenes180.0790.020Tanks and Temples60.2100.087DROID-W动态场景70.9090.184Oxford Spires105.3740.930KITTI (504×280)1124.0462.861蓝色实线为预测轨迹、灰色虚线为真值轨迹的对比图可看到两条轨迹高度贴合室内 RGB-D 场景同样稳健桌面级小尺度场景中 ATE 仅 0.045长序列与离线渲染从 Demo 到成片 交互式 viewer 有长度限制超过 3000 帧时建议两种玩法窗口化推理Windowed Mode——让 KV Cache 分窗滑动窗口间共享关键帧保持位姿连续python demo.py --model_path /path/to/lingbot-map.pt \ --video_path video.mp4 --fps 10 \ --mode windowed --window_size 128 \ --overlap_keyframes 16 --keyframe_interval 2离线渲染流水线——demo_render/batch_demo.py 一条命令输入视频、输出一段无人指点云飞越 MP4内置follow追拍、birdeye鸟瞰揭示等电影感镜头模式预设见 demo_render/config/。官方 13 分钟室内视频即由该流水线渲染命令与参数解释详见仓库 README 的 Worked Example 部分。实用参数速查表 ⚙️参数默认作用--keyframe_interval自动每 N 帧存一个关键帧显著降低 KV Cache 显存320 帧序列强烈建议开启--mask_sky关户外场景过滤天空点点云更干净--camera_num_iterations4位姿头迭代精修次数设为 1 可提速略损精度--use_sdpa关未装 FlashInfer 时的 PyTorch 原生注意力回退--offload_to_cpu开显存不足时把逐帧预测卸载到 CPU--downsample_factor10点云显示空间下采样倍数写在最后新手从哪开始给刚接触 3D 重建基础模型的开发者一条最短路径按上文5 分钟安装跑通example/courthouse换自己的相机素材图片文件夹或视频替换--image_folder/--video_path长序列加--keyframe_interval超过 3000 帧切--mode windowed想看量化指标用benchmark/的三命令流水线对自己的数据做评测从离线全局优化到一次前馈推理LingBot-Map 展示了流式 3D 重建的新范式更快的推理、更稳的长序列、更少的调参。不妨今天就把它跑起来亲眼看看逐帧生长的 3D 世界 【免费下载链接】lingbot-mapA feed-forward 3D foundation model for reconstructing scenes from streaming data项目地址: https://gitcode.com/GitHub_Trending/li/lingbot-map创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门