拓冰建站拓冰建站
首页 / 资讯中心 / 正文

TMM 2026 | SSMPD:用于多光谱行人检测的半监督学习

文章目录01 论文信息02 论文主要贡献现存问题03 论文创新点04 方法4.1 核心框架4.2 场景多样化数据选择策略4.3 行人外观感知PAA权重4.4 统一模态感知同步UMAS学习4.5 相似度对比SC损失05 实验分析06 结论01 论文信息论文题目SSMPD: Semi-Supervised Learning for MultispectralPedestrian Detection论文作者Seungho Shin Chan LeeGyeong-Moon ParkJung Uk Kim发表期刊TMM 202602 论文主要贡献针对半监督场景下的多光谱行人检测任务提出行人感知权重利用多光谱知识和行人特征来验证伪标签的质量从而确保半监督环境下师生架构的可靠学习。提出统一模态感知同步学习以充分利用单模态和多模态信息实现更丰富的信息获取与更稳定的学习过程。设计了基于相似度的对比损失参考真实标签的知识来提升伪标签的质量。设计了一种聚焦场景多样性的新型数据选择策略以确保师生模型的有效训练。现存问题现有多光谱行人检测方法均建立在全监督的前提下要求所有可见光 - 红外图像都带有完整标注但多光谱数据的完整标注在实际中难度高、成本大且标注数据比例越低检测性能下降越显著。(a) 多光谱数据中存在大量小目标、暗光等难以人工标注的样本(b) 仅使用有标签数据训练标注占比降低时漏检率 MR 显著上升c) 真实场景下数据集分布无标注图像占 90% 以上有标注样本不足 10%由此引出半监督多光谱行人检测的研究必要性。现有半监督目标检测技术仅适配单模态场景无法利用多光谱互补特性没有考虑多光谱数据的特点无法有效利用可见光与红外的互补信息无法适配多光谱行人检测的场景需求。本方法与现有SSOD方法在KAIST数据集上漏检率对比标注1%、5%、10%。本方法借助多光谱知识相比现有方法展现出更优的性能。03 论文创新点1行人外观感知权重PAA利用行人的多光谱特征知识对伪标签质量进行校验对低质量伪标签削弱其对训练的影响对高质量伪标签放大教师向学生的知识传递强度通过这种自适应调节机制有效规避错误标签的干扰让整个半监督学习过程更稳定、更可靠。2统一模态感知同步学习UMAS将无监督损失同时覆盖可见光、红外、融合特征三个模态分支结合 PAA 权重动态平衡各模态的学习强度。该机制让框架能够充分吸纳多维度特征信息进一步对冲伪标签带来的训练波动。3相似度对比损失SC Loss通过让高质量伪标签中的特征与真实标签紧密对齐同时分离低质量伪标签中的特征从而提升伪标签的质量。4基于聚类的场景多样化数据选择策略基于对多光谱模态特征的深度理解对数据集进行聚类划分在不同场景簇内均匀选取标注样本在削减数据冗余的同时最大化标注集的场景多样性。04 方法4.1 核心框架SSMPD整体基于师生迭代训练范式搭建。框架整体结构如图所示a为场景多样化数据选择与教师模型初始化流程b为多模态协同的半监督训练主框架c为相似度对比SC损失核心创新包含行人外观感知PAA权重、统一模态感知同步UMAS学习、相似度对比SC损失三部分。4.2 场景多样化数据选择策略是教师模型初始化阶段的前置步骤特征提取对全部原始图像融合可见光、红外信息提取全局多光谱特征K-Means聚类划分将所有图像特征划分为K KK类场景簇同类簇图像环境高度相似均匀采样每个场景簇内按特征距离均匀抽取样本作为标注集避免集中选取连续冗余帧。4.3 行人外观感知PAA权重将真实标注的行人样本输入多光谱特征编码器提取融合模态的深层特征作为真值基准表征f gt f_{\text{gt}}fgt​对教师模型生成的每个伪标签样本截取对应目标区域的融合模态深层特征作为伪标签待校验表征f i f_ifi​采用均方误差MSE计算两类表征的特征差异得到伪标签的特征差异度分数分数越小代表伪标签与真值特征匹配度越高、质量越好。计算公式为s i 1 C ∑ c 1 C ( f i c − f gt c ) 2 s_i \frac{1}{C} \sum_{c1}^{C} \left( f_i^c - f_{\text{gt}}^c \right)^2si​C1​c1∑C​(fic​−fgtc​)2基于对数映射函数生成自适应PAA权重可随训练过程中特征分布的变化动态调整高质量伪标签获得更高训练权重放大其梯度贡献低质量伪标签获得更低权重抑制其噪声干扰。4.4 统一模态感知同步UMAS学习本文提出统一模态感知同步UMAS学习机制搭建多模态协同双阶段训练框架将监督信号同步作用于三条模态分支结合PAA权重实现各分支自适应学习整体框架如图中(b)所示。多光谱检测主分支损失包含可见光单模态、热红外单模态、多光谱融合三条并行检测支路每条支路均独立输出行人边界框与分类结果对应两类核心损失。1有监督检测损失L s u p \mathcal{L}_{sup}Lsup​仅作用于有标签样本是检测性能的基础监督信号由分类损失与边界框回归损失两部分组成L s u p L c l s λ reg L r e g \mathcal{L}_{sup} \mathcal{L}_{cls} \lambda_{\text{reg}} \mathcal{L}_{reg}Lsup​Lcls​λreg​Lreg​其中L c l s \mathcal{L}_{cls}Lcls​行人分类交叉熵损失约束类别预测的准确性L r e g \mathcal{L}_{reg}Lreg​边界框回归损失通常采用Smooth L1损失约束检测框的定位精度λ reg \lambda_{\text{reg}}λreg​回归损失平衡系数用于调整分类与回归任务的权重占比2无监督伪标签损失L u n s u p \mathcal{L}_{unsup}Lunsup​这是统一模态感知同步UMAS学习的核心载体作用于全部无标签样本同时覆盖三个模态分支结合各分支独立计算的PAA权重动态调整学习强度模态特征质量越高对应分支的损失权重越大。计算公式为L u n s u p w v ⋅ L d e t ( F v , Y ^ ) w t ⋅ L d e t ( F t , Y ^ ) w f ⋅ L d e t ( F f , Y ^ ) \mathcal{L}_{unsup} w_v \cdot \mathcal{L}_{det}(F_v, \hat{Y}) w_t \cdot \mathcal{L}_{det}(F_t, \hat{Y}) w_f \cdot \mathcal{L}_{det}(F_f, \hat{Y})Lunsup​wv​⋅Ldet​(Fv​,Y^)wt​⋅Ldet​(Ft​,Y^)wf​⋅Ldet​(Ff​,Y^)其中F v , F t , F f F_v, F_t, F_fFv​,Ft​,Ff​分别为学生模型可见光单模态、热红外单模态、多光谱融合分支的输出特征Y ^ \hat{Y}Y^教师模型为无标签样本生成的伪标签包含边界框坐标与类别预测L d e t ( ⋅ ) \mathcal{L}_{det}(\cdot)Ldet​(⋅)单分支检测损失函数形式与有监督检测损失完全一致包含分类与回归两项w v , w t , w f w_v, w_t, w_fwv​,wt​,wf​对应三个模态分支的PAA权重由各分支独立计算的特征差异度生成实现模态感知的动态加权4.5 相似度对比SC损失PAA权重属于对伪标签的后置管控仅能被动削弱低质量伪标签的干扰无法从根源提升教师模型的伪标签生成能力。为此本文设计相似度对比SC损失从特征表征层面主动优化教师模型特征判别能力从源头提升伪标签整体质量与PAA权重形成双重保障。首先通过余弦相似度计算伪标签表征与真值基准表征的语义匹配度cos ⁡ ( θ i ) f i ⋅ f gt ∥ f i ∥ ⋅ ∥ f gt ∥ \cos(\theta_i) \frac{f_i \cdot f_{\text{gt}}}{\| f_i \| \cdot \| f_{\text{gt}} \|}cos(θi​)∥fi​∥⋅∥fgt​∥fi​⋅fgt​​其中f i f_ifi​第i ii个伪标签样本的归一化深层特征向量f gt f_{\text{gt}}fgt​真值行人的归一化基准特征向量cos ⁡ ( θ i ) \cos(\theta_i)cos(θi​)特征余弦相似度取值范围为[ − 1 , 1 ] [-1, 1][−1,1]值越高代表语义匹配度越高随后按预设阈值将样本划分为三类正样本cos ⁡ ( θ i ) ≥ τ pos \cos(\theta_i) \ge \tau_{\text{pos}}cos(θi​)≥τpos​标签可靠用于拉近与真值的特征距离负样本cos ⁡ ( θ i ) ≤ τ neg \cos(\theta_i) \le \tau_{\text{neg}}cos(θi​)≤τneg​标签错误度高用于推远与真值的特征距离不确定缓冲样本τ neg cos ⁡ ( θ i ) τ pos \tau_{\text{neg}} \cos(\theta_i) \tau_{\text{pos}}τneg​cos(θi​)τpos​标签模糊不参与对比损失计算避免引入噪声损失的核心作用在特征空间中拉近高质量伪标签与真值的距离、推远低质量伪标签与真值的距离从根源提升教师模型的特征判别能力与伪标签生成质量。05 实验分析主流半监督检测算法在少标注多光谱行人检测任务漏检率对比。数值越小性能越优。在 1%、5%、10% 三种有限标注条件下本文方法在全天、白天、夜间场景均取得最低漏检率验证了 SSMPD 框架在标注稀缺场景下的有效性。与主流半监督检测方法的定量对比结果。在 1%/5%/10% 少标注场景下SSMPD 漏检率最低、检测精度最高。各类标注样本选择方案对比实验。本文提出的数据选取策略优于随机选择与主流主动学习方法同等标注数量下有效降低行人漏检率。模块消融实验结果10% 标注比例。依次叠加各模块漏检率持续下降验证了各个组件的有效性模块之间具备协同增益夜间场景提升效果尤为突出。06 结论本文引入了一种新颖的半监督多光谱行人检测框架来解决标记数据受限时的情况。首先引入了一个物体外观感知权重该权重使用多光谱知识验证伪标签。其次引入了统一的模态感知学习以利用多光谱数据的丰富信息来减轻伪标签的不稳定性。第三引入了基于相似性的对比损失将高质量伪标签的特征向真值特征拉近、分离低质量伪标签的特征从特征层面提升样本区分能力。此外本文使用多样化的数据选择方法在半监督场景中进行更有效的学习。
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门