盘点 | 香港科技大学沈劭劼团队2026上半年硬核成果

发布时间:2026/7/22 23:09:01
盘点 | 香港科技大学沈劭劼团队2026上半年硬核成果 「从悬挂载荷递送到几何高斯溅射」目录01 悬挂载荷无人机的自适应空中递送02 多鱼眼相机的故障导向鲁棒标定03 无遮挡的空中目标结构扫描重规划04 零样本全向立体匹配与头部对齐法线先验05 视觉几何基础模型辅助的三维语义占据预测06 将高斯基元建立在几何理论之上07 写在最后回顾2026年香港科技大学沈劭劼老师团队在空中机器人与空间机器智能领域持续深耕研究展现出一条清晰的演进脉络。在以往深厚的无人机自主导航与三维重建基础上团队今年的工作着重于提升空中机器人在复杂、动态以及未知环境中的任务执行能力与感知鲁棒性。无论是悬挂载荷的动态递送、多鱼眼相机的鲁棒标定还是结合视觉基础模型的三维语义占据预测团队都在致力于构建感知、决策与控制一体化的全栈技术闭环。基于这一脉络我们精选出团队2026年以来发表的6篇核心工作进行详细解读。01 悬挂载荷无人机的自适应空中递送图1 | AD-Planner系统演示图展示了无人机携带悬挂载荷进行精确投放的过程论文标题AD-Planner: Adaptive In-flight Delivery Using a Quadrotor with a Suspended PayloadT-RO论文介绍四旋翼无人机在物流递送中极具潜力但当其携带悬挂载荷时系统的欠驱动特性和复杂的动力学耦合给精确控制带来了较大挑战。特别是在需要将载荷准确投放至动态或狭小目标区域时传统的轨迹规划方法往往难以兼顾安全性和效率。在这篇被机器人领域顶级期刊 IEEE T-RO 接收的论文中团队提出了 AD-Planner一种针对四旋翼悬挂载荷系统的自适应飞行递送解决方案。该方法引入了误差有界规划技术和紧凑的优化公式实现了在动态目标下的精确、安全且高效的自主递送。研究人员还开发了分层初始化策略提高了计算效率和轨迹求解质量。02 多鱼眼相机的故障导向鲁棒标定图2 | 多鱼眼标定的 Native Recall 热力图展示了在不同配置下 CO-Calib 框架的鲁棒性论文标题Observation Quality Matters: Robust Multi-Fisheye Calibration via Failure-Oriented Analysis论文介绍多鱼眼相机系统在自动驾驶和全向机器人感知中应用广泛但其标定过程常常因优化发散而失败。现有的标定工具往往依赖于理想的初始值一旦初始猜测偏差较大整个标定过程就会崩溃。本研究通过故障导向分析Failure-Oriented Analysis揭示了标定失败的根本原因当观测数据的径向跨度有限时焦距尺度与鱼眼投影形状参数会产生强耦合导致优化更新呈现病态。基于这一分析团队提出了 CO-Calib 框架通过引入观测质量评估和鲁棒的初始化策略显著提高了多鱼眼相机的标定成功率和精度。在合成基准测试上CO-Calib 将整体标定成功率从 68.1% 提升至 99.3%。延展解读港科大沈劭劼团队CO-Calib多鱼眼标定成功率从68.1%拉到99.3%Kalibr终于不崩了03 无遮挡的空中目标结构扫描重规划图3 | FC-Vision 系统在未知环境中进行可见性感知重规划实现无遮挡扫描论文标题FC-Vision: Real-Time Visibility-Aware Replanning for Occlusion-Free Aerial Target Structure Scanning in Unknown EnvironmentsRAL论文介绍利用无人机对未知环境中的复杂结构进行三维扫描是工业巡检的核心需求。然而在未知环境中无人机经常会遇到突发的障碍物遮挡导致扫描数据不完整。传统的重规划方法往往只关注避障而忽略了扫描任务本身的可见性需求。在 FC-Vision 中团队提出了一个实时的可见性感知重规划框架。该框架能够主动且安全地防止目标被遮挡同时保持原始规划的完整目标覆盖率和飞行效率。通过高效的两级分解策略FC-Vision 在保证实时性的前提下强制执行密集的表面可见性约束从而显著提升了未知环境下的扫描质量。延展解读不止避障更无遮挡港科大沈劭劼团队FC-Vision实现未知环境无遮挡实时扫描04 零样本全向立体匹配与头部对齐法线先验图4 | H-OmniStereo 在真实场景中的零样本全向立体匹配效果展示论文标题H-OmniStereo: Zero-Shot Omnidirectional Stereo Matching with Heading-Aligned Normal Priors论文介绍全向立体视觉能够为机器人提供360度的深度感知但全向立体数据集的稀缺以及鱼眼图像严重的球面畸变极大限制了立体匹配算法的泛化能力。现有的单目深度先验在处理这类畸变图像时往往会出现性能退化。为解决这一问题团队提出了 H-OmniStereo 框架。研究人员构建了包含超过280万图像对的大规模合成全向数据集并创新性地引入了头部对齐的单目法线估计器。这种法线先验能够有效克服球面畸变带来的影响使网络能够在零样本的情况下泛化到未见过的真实世界场景实现了更高的匹配精度和鲁棒性。延展解读港科大沈劭劼、谭平团队最新成果开源280万全景数据集实现零样本立体匹配05 视觉几何基础模型辅助的三维语义占据预测图5 | VG3S 框架利用视觉几何基础模型提升高斯泼溅的语义占据预测能力论文标题VG3S: Visual Geometry Grounded Gaussian Splatting for Semantic Occupancy PredictionICRA论文介绍三维语义占据预测是自动驾驶和机器人导航理解复杂场景的关键。近年来3D高斯泼溅技术因其高效的渲染能力备受关注但如何将其准确应用于语义占据预测仍面临几何结构不清晰的挑战。在 ICRA 2026 发表的 VG3S 框架中团队将视觉基础模型提取的几何先验引入到高斯泼溅过程中。通过视觉几何基础的约束VG3S 显著提升了3D高斯表达在语义占据预测上的准确性并在 nuScenes 占据基准测试中取得了显著的性能改进为基于纯视觉的高级场景理解提供了新思路。延展解读港科大沈劭劼团队VG3S不微调、不遗忘即插即用实现高精度3D占用预测06 将高斯基元建立在几何理论之上图6 | Geometry-Grounded Gaussian Splatting 的深度渲染流程(a) 光栅化并按深度排序(b) 标准高斯泼溅产生阶梯状透射率(c) 随机实体模型产生连续透射率曲线(d-f) 通过二分搜索定位中值深度并推导闭式梯度论文标题Geometry-Grounded Gaussian Splatting论文介绍3D 高斯泼溅在新视角合成中已展现出出色的质量与效率但从高斯基元中提取精确几何形状仍是一个开放问题。现有方法依赖启发式规则来估计深度或表面缺乏理论依据导致多视角一致性差且对浮点伪影floaters敏感。本文提出了一套严格的理论推导将高斯基元建立为一类特定的随机实体。基于这一理论框架高斯基元可以被视为显式几何表示从而为几何感知的高斯泼溅提供了原则性基础。在此基础上研究人员设计了一种高效的深度渲染方法利用随机实体的体积特性通过二分搜索定位透射率为0.5的中值深度并推导出对应的闭式梯度表达式实现了端到端的可微优化。实验表明该方法在公开数据集上的形状重建精度超越了所有现有基于高斯泼溅的方法同时保持了高斯泼溅的优化效率。延展解读高斯溅射终于“有几何”了港科大沈劭劼谭平团队NeRF级精度实时渲染训练仅需15分钟07 写在最后纵观沈劭劼团队2026年的最新成果可以看到团队在空中机器人技术上的研究方向正在从能飞、能避障向飞得准、看得懂、能交互延伸。无论是将基础模型引入底层感知如 VG3S还是在极端约束下突破规划极限如 AD-Planner 和 FC-Vision这些工作都在不断拓宽空中机器人的能力边界。如何让机器人在开放世界中拥有更鲁棒的感知与更敏捷的操作依然是核心挑战。沈劭劼团队的这些探索为这一方向提供了有价值的技术参考。参考文献[1] Li H, Xu Y, Feng C, Zhou B, Shen S. AD-Planner: Adaptive In-flight Delivery Using a Quadrotor with a Suspended Payload. IEEE Transactions on Robotics, 2026.[2] Liu P, Tong Z, Feng C, Shen S. Observation Quality Matters: Robust Multi-Fisheye Calibration via Failure-Oriented Analysis. arXiv preprint arXiv:2607.05777, 2026.[3] Feng C, Xu Y, Shen S. FC-Vision: Real-Time Visibility-Aware Replanning for Occlusion-Free Aerial Target Structure Scanning in Unknown Environments. IEEE Robotics and Automation Letters, 2026.[4] Jiang C, Tong Z, Gao P, Liu P, Xu Y, Fang C, Tan P, Shen S. H-OmniStereo: Zero-Shot Omnidirectional Stereo Matching with Heading-Aligned Normal Priors. arXiv preprint arXiv:2605.14963, 2026.[5] Yan X, Pei M, Shen S. VG3S: Visual Geometry Grounded Gaussian Splatting for Semantic Occupancy Prediction. ICRA, 2026.[6] Zhang B, Jiang C, Li H, Shen S, Tan P. Geometry-Grounded Gaussian Splatting. arXiv preprint arXiv:2601.17835, 2026.