拓冰建站拓冰建站
首页 / 资讯中心 / 正文

ACLNet: 亲和对比学习, 挖掘动作识别领域的类间深层关联

paper: https://arxiv.org/abs/2601.16694GitHubhttps://github.com/firework8/ACLNet0. 摘要在基于骨架的人类活动理解中现有方法通常采用对比学习范式来构建判别特征空间。然而其中许多方法未能利用结构类间相似性而忽略了异常正样本的影响。在本研究中我们引入了aclnet这是一种亲和对比学习网络它探索了人类活动类之间的复杂聚类关系以提高特征识别能力。具体来说我们提出了一个亲和度量来细化相似性度量从而形成提供更多信息对比信号的活动超类。还引入了一个动态温度调度来自适应地调整各种超类的惩罚强度。此外我们采用基于边缘的对比策略来提高类内硬正负样本的分离。在NTU RGBD 60, NTU RGBD 120, KineticsSkeleton, PKU-MMD, FineGYM, CASIA-B等数据集上的广泛实验证明了我们的方法在基于骨架的动作识别、步态识别和人员再识别方面的优势。1. 引言近年来基于骨架的人类行为理解因其在复杂环境条件下的鲁棒性和较高的计算效率[1]、[2]、[3]而备受关注。尽管取得了这些进展但由于缺乏交互对象例如阅读VS写作直观来看并不知道这个人是在看书还是在写字只知道这两者有类似的骨架图和详细的身体形状例如挥手与OK手势因为通常用的骨架不包含手部细节也就无从得知此人具体的动作了基于骨架的表示在区分视觉上相似的活动时往往存在固有的模糊性。这种限制在生物识别应用中变得特别关键其中微妙的行为线索对于活动表征和身份推断至关重要。因此最近的方法转向判别对比学习技术[4]、[5]、[6]。这些方法要么利用所有骨架序列[4]的全局上下文线索要么解耦空间和时间特征进行对比细化[5]。通过将对比约束集成到框架中增强了骨架表示的可区分性。然而现有的对比学习范式存在两个问题。首先这些方法无法利用活动类之间的潜在结构相似性。直观地说由于骨架序列的共性具有相似运动模式的活动容易出现错误分类例如常见的关键关节或轨迹。然后将这些物理相似性投影到嵌入空间中潜在地形成不同类别之间相似活动的集群。这些簇中反映的关系为嵌入空间中的对比学习提供了丰富的监督信号。然而现有的方法仅依赖于全局正负比较也即非黑即白忽略了结构信息的探索。这导致了低效的优化从而限制了细粒度场景中的判别能力。此外目前的方法忽略了类内异常正样本的固有影响。类内变异性如观测角度和运动幅度的差异不可避免地会引入噪声。这导致一些容易与其他类的样本混淆的难正样本的可能性。这些异常阳性的固有影响加上难负样本引起的干扰可能导致在嵌入空间积累错误最终降低整体性能。这个事实表明困难样本的学习方式应该重新制定但是在当前范式中不支持这一点。为解决上述问题我们引入了ACLNet——一种用于基于骨架的人体活动理解的新型亲和对比学习网络。首先我们提出了一种类间亲和对比方法该方法能够捕捉相关活动之间的语义共性。具体而言我们引入了亲和相似度用于衡量嵌入空间中各类之间的结构关系。相应地那些始终具有相似运动模式的类被归为更高级的超类称为“运动族群”Motion Family。接着我们提出了一种类间亲和对比损失函数以促进对语义相关类的针对性优化。此外还设计了一种动态的族群感知温度调度机制能够根据超类规模自适应地调整惩罚力度从而提升表征质量。其次我们提出了一种类内边缘对比策略以减轻异常正样本的固有影响。该策略旨在增大难正例hard positives与其最近负样本之间的边缘距离约束从而鼓励难正例进行亲和聚合。通过控制最小边缘距离我们设计了一种类内亲和对比损失函数以实现正负样本间更好的分离。图1展示了我们的亲和对比学习框架的概念示意图。我们在六个流行的基准数据集上进行了广泛实验这些数据集包括用于动作识别的NTU RGBD 60、NTU RGBD 120、Kinetics-Skeleton、PKU-MMD和FineGYM以及用于步态识别和行人重识别的CASIA-B。实验结果表明ACLNet在这些基准数据集上始终取得了最先进的性能。我们的贡献总结如下我们引入了ACLNet一种新型的亲和对比学习网络增强了基于骨架的人类活动理解的判别性表示。我们提出了一种类间亲和对比方法该方法采用开发的亲和度量来捕捉相关活动之间的语义关联从而实现对难分类别的全局针对性优化。我们提出了一种类内边缘对比策略以增大难正例与负样本之间的最小边缘距离从而实现对硬样本的更好分离。广泛实验表明ACLNet在当前对比范式的基础上有了显著提升在六个广泛使用的基准数据集上均优于最先进的方法。2. 相关工作A. 基于骨架的动作Action识别早期基于骨架的动作识别方法主要关注循环神经网络RNNs和卷积神经网络CNNs来预测类别标签[1],[7]但它们忽略了关节之间的内在相关性。受骨架数据结构特性的驱动图卷积网络GCNs已成为基于骨架的动作识别的领先解决方案[8],[9],[10],[11]。首个将预定义的空间时间图用于建模骨架数据的显著尝试是ST-GCN[12]。尽管它建立了强大的基线但预定义的图拓扑在建模缺乏直接连接的关节之间的关系时带来了挑战从而限制了表达容量。各种后续研究探索了关节关系的更灵活建模包括自适应图[13],[14],[15],[16]、多尺度图[17],[18]和通道级图[19],[20],[21],[22]。例如2s-AGCN[13]提出了一种自适应图卷积网络该网络以端到端的方式学习拓扑结构。随后InfoGCN[20]利用信息论目标和多模态来更好地表示潜在信息。最近BlockGCN[23]引入了新颖的拓扑编码方案包括静态和动态编码以识别和恢复被忽视的拓扑结构。然而对于相似类别的判别性语义特征的捕捉仍然是现有方法面临的挑战。为解决这一问题我们提出了亲和对比学习网络该网络对难分类别和样本施加了额外的亲和约束使模型能够学习到更具区分度的骨架表示。B. 基于骨架的行为Behavioral识别基于骨架的行为识别已成为生物识别领域的一个关键子领域其重点在于步态识别和行人重识别。与通用动作识别不同此任务需要捕捉独特且一致的个体化运动模式。在步态识别中早期的基于骨架的方法如PoseGait[24]使用3D关键点来实现视角不变性。随后GaitGraph[25]和GaitGraph2[26]采用了多分支图框架来建模身体关系。近期的方法如MSGG[27]、Gait-D[28]和CycleGait[29]利用基于GCN的架构实现了显著的性能提升。同时基于骨架的行人重识别旨在使用骨架表示来匹配和检索个体。早期的工作手动设计基于人体测量和步态属性的骨架描述符[30]。Rao等人[31]利用带有注意力机制的LSTM编码器AGE来学习骨架特征。其扩展SGELA[32]集成了骨架预训练任务和序列间对比学习以增强表示。最近TranSG[2]提出了一种基于Transformer的骨架图对比学习框架以捕捉复杂的骨架关系。与这些方法相比我们引入了亲和对比学习以突出类别之间的细微差异实现有效的生物识别。所提出的亲和建模范式为细粒度活动理解开辟了新的途径具有在各种行为生物识别任务中的潜在应用。C. 对比学习对比学习是一种经典的自监督表示学习方法已证明能够提高各种下游任务的性能和鲁棒性[33],[34],[35],[36]。如MoCo[33]和SimCLR[34]等方法提出了巧妙的范式通过这种对比学习方式来关注语义表示。另一类研究[37],[38]则专注于度量学习不断通过发现硬正例和负样本来提升表示。受这些对比学习范式的启发我们的工作利用了开发的亲和度量和边缘约束以鼓励模型学习判别性信息。在基于骨架的人类活动理解领域对比学习在自监督[39],[40]和无监督[41]设置中有两种研究视角先前的方法利用骨架变换来构建多样的正负样本对旨在在嵌入空间中保持一致性。同时对比学习在完全监督的场景中也展现出了相当大的潜力[4],[5],[42],[43]。关于相似动作的区分当前方法的方法论可以概括为从特定视角寻找动作之间的差异。例如Huang等人[4]明确探索了所有序列中的全局上下文信息而Zhou等人[5]则提出了时空特征细化以改善判别性表示。与之不同我们的目标是告知识别模型哪些动作在语义上是混淆的从而促使模型专注于区分它们并自发地寻找差异。亲和信息包含丰富的监督信号这些信号可以提供显著的消歧线索。因此这使模型能够有效地捕捉活动之间的独特语义。3. 方法在本节中我们首先简要介绍基于骨架的人类活动理解中使用GCN的初步概念。然后我们将详细描述所提出的亲和对比学习框架。所提出的ACLNet的概述如图2所示。A. 初步概念基于骨架的方法的输入是一个跨越T帧的骨架序列其中每个骨架由N个身体关节组成。人体骨架通常表示为一个图G (V, E)其中V {v1, v2, ..., vN}是身体关节的集合E表示这些关节之间的连接。在实践中E通过邻接矩阵A ∈ RN×N实现其中每个元素aij反映了关节vi和vj之间的相关性强度。GCN模型的框架可以看作是一个由L个堆叠的图卷积层组成的骨干网络随后是一个分类头。提取的关节运动语义特征可以表示为X ∈ RC×T×N其中C是运动特征的维度。数学上骨干网络中第l层的转换函数可以表示为其中A ∈ RN×N是表示N个关节之间相关性的邻接矩阵Θ(l) ∈ RC(l−1)×C(l)表示卷积操作的可学习权重σ表示ReLU激活函数。获得最终隐藏表示X(L)后采用分类网络来确定预测标签ˆy ∈ Rc其中c表示总类别数。然后应用交叉熵损失Lce来监督预测类别其中yi是one-hot真实标签。此外还采用了一个投影层将最后一个隐藏表示嵌入到对比特征空间中的向量fc中该向量用于计算所提出的亲和对比学习网络的目标函数。B. 类间亲和对比学习为解决区分易于误分类活动的挑战我们研究了类间复杂关系并引入了“运动族群”的概念。具体而言“运动族群”是通过基于提出的亲和相似度进行聚类而形成的超类该相似度表示具有结构共性的相关活动的集合。在接下来的子章节中我们将详细解释亲和相似度然后介绍类间亲和对比损失。1) 亲和相似度定义运动语义关联的质量至关重要因为它们决定了“运动族群”的聚类。然而计算可靠的语义关联并非易事特别是在训练过程的早期阶段。为解决这一问题我们提出了亲和相似度以估计相关活动之间的高质量语义关联。我们的关键思想是不仅利用两个活动类之间的直接成对关系还利用它们之间的间接语义共性。直观上如果两个活动共享许多相似的类别则它们应被视为具有隐藏共性并因此属于同一超类空间。在训练过程中识别模型可以在活动之间隐式地创建相似性图而我们的方法则在该图上引入亲和约束从而产生自教学的聚类关系。这种隐式的类间亲和关系有助于捕捉类之间的结构共性并为进一步的对比学习提供高效且简洁的监督信号。在实践中我们首先收集误分类样本以构建活动类之间的初始混淆矩阵该矩阵用于发现直接的成 对关联。然后我们通过考虑混淆矩阵中的重叠来捕捉间接的隐藏共性。所提出的亲和相似度定义为直接成对相似度和间接上下文相似度的组合。因此我们将计算分为两个顺序步骤。2) 亲和相似度计算第一步涉及通过识别混淆类来计算类之间的成对关联。初始化一个全局统计矩阵H表示活动之间的成对关系其中Hi,j表示属于类i的样本被误分类为类j的数量。给定所有输入该矩阵有助于建立全局的成对关联。为减少预测随机性的影响我们关注前K个最相似的类这些类具有高度相关性作为成对候选。类i的成对关联集定义为其中H_i,·表示类别i与所有其他类别的统计N_K(i)表示统计Top K(H_i,·)中的K个类别。从统计上看K设置为10。然后我们建立表示类别i和类别j之间成对相似性的二进制矩阵I_NK(i,j)由于在训练的早期阶段网络还不够成熟以掌握类别之间的语义关系因此初步的关联往往受到损害。此外潜在的结构共同性可以提供隐式的监督信息。因此我们提出计算亲和相似性如下所示。第二步旨在探索间接语义关联并捕捉最终的亲和关系。我们通过计算两个类别共有的相邻活动数量来细化上下文信息。如果两个类别共享许多相似的活动它们更有可能具有结构共同性。亲和相似性由成对相似性和上下文相似性组成类别i和类别j之间的亲和相似性可以定义为其中p表示类别i的成对活动索引M(i,j) ∑(p1 to K) I_NK(i,p)I_NK(j,p)表示i和j通过AND操作共有的类别总数。p I_NK(i,p)表示I_NK(i,j)的大小通常为K。在实践中我们将成对相关权重减半然后将其加到重叠值上最终得到亲和相似性。3运动家族细化到目前为止已经有效地探索了类别之间的直接和间接关联。然后我们构建“运动家族”W(i)如下之后我们对“运动家族”中具有共同属性的相关活动进行独特的表示细化。对于这些具有语义一致性的难类别进行有针对性的细化以更好地捕捉“运动家族”中成员类别之间的特征差异。对于每个成员类别我们使用指数移动平均EMA来定义和更新类别表示m_i其中f_ik ∈ ℝ^d表示输入批次中类别i的第k个特征γ是动量项n_k是样本总数。理想情况下类别i的新样本应与m_i收敛并与其他类别的表示不同。^[38]^在此过程中m_i逐渐成为类别i的聚类中心的稳定估计为后续的细化奠定了基础。最后我们提出了类间亲和对比损失以优化类间学习目标。设f_iμ表示属于类别i的样本μ的特征。类间亲和对比损失可以表示为其中a是成员类别索引·符号表示内积操作m_i, m_a表示相应的类别表示。4讨论提出的“运动家族”更像是一个概念框架而不是一个直接将相似类别物理上拉近的机制。在这里亲和关系作为有效的监督信号指导模型识别语义相关的类别并专注于它们的细化。同时为了解决每个类别内部的固有变异性我们采用平均聚合和跨批次动量更新有效地减轻了类内多样性的影响并确保了稳定的更新。C. 家族感知温度调度在对比学习中模型被训练以确保不同类别的嵌入被排斥而相同类别的嵌入被吸引。样本之间的吸引和排斥力量由温度参数控制该参数已被发现对学习表示的质量有至关重要的影响。受此启发我们认为与不同大小的“运动家族”相关的惩罚强度也应该是自适应的。因此我们在训练过程中采用了动态温度τ_w。通过动态调度可以在不增加额外成本的情况下提高表示质量。在实践中我们根据实际超类大小N_w确定的简单间隔增量调度来修改τ_w。超参数K设置为10对应于超类大小的阈值。动态温度τ_w可以表示为具体来说较大的τ_wτ_w1.0可以增加簇之间的边距促进簇间的区分。相反当超类大小变小时可以使用较小的τ_wτ_w0.1来放大难负样本在嵌入空间中的相似性差异有助于超类内的实例特定细化。为了获得更平滑的优化我们添加了τ_w0.5的设置。这种调度导致了对不同超类的“家族感知切换”从而确保模型持续改进成员类别之间的分离。D. 类内亲和对比学习在类间约束的基础上我们进一步改进了类内表示。一般来说丰富的样本多样性不可避免地会引入内在噪声这将导致存在易与其它类别混淆的难正样本。这些难正样本以及来自相似类别的负样本会导致错误的累积并降低整体性能。为此我们提出了一种类内边界学习目标该目标对正样本和最近负样本之间的最小边距进行更精确的控制。如图2所示所提出的边界策略可以被视为对类内所有正样本的亲和聚合从而实现难正样本和负样本之间的更好分离。设x为原始骨架样本的锚点xu为正样本x-v为负样本N_v为负样本数量。这里正负样本分别指属于相同和不同类别的样本。s(f_m, f_n)定义为样本m和n之间的余弦相似性。由于||f_m||_2||f_n||_21L2距离d(f_m, f_n)||f_m-f_n||^2_2较小余弦相似性较大。我们用d(f_x, f_x)表示d用d(f_x, f_x-v)表示d-v相应地用s(f_x, f_x)表示s用s(f_x, f_x-v)表示s-v。首先考虑单个正样本x的情况。对于类内差异需要满足以下条件其中ε0是正负样本之间的边距。该条件可以进一步推导为基于InfoNCE上述约束可以转化为具有最大运算符和平滑近似LogSumExpLSE运算符的优化问题然后我们将上述优化推广到多个正样本以推导出以下约束因此所提出的类内边界对比损失可以表示为其中ε适用于所有类内正样本并且可以实现难正样本和负样本之间的分离。E. 总体目标函数最后用于训练模型的整体损失函数可以表示为其中Lce是用于监督预测类别的交叉熵损失。为了保持平衡λ1和λ2分别是分配给类间相似度对比损失Linter和类内边缘对比损失Lintra的权重。4. 实验5. 总结在本文中我们介绍了ACLNet一种新颖的亲和对比学习网络用于基于骨架的人体行为理解。具体而言我们的方法通过两大贡献解决了现有方法的局限性。首先我们引入了亲和相似度的概念来建模难正例之间的语义关系从而通过类别间亲和度学习实现有针对性的细化。其次我们提出了一种边缘对比策略该策略明确控制难正例和负例之间的分离增强了对于类别内变化的鲁棒性。在六个基准数据集上的广泛实验证明了ACLNet在基于骨架的动作识别、步态识别和行人重识别任务中的有效性。所提出的亲和建模范式为细粒度活动分析和行为生物识别开辟了新途径在安全、医疗保健和人机交互等领域具有潜在应用。
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门