拓冰建站拓冰建站
首页 / 资讯中心 / 正文

Multi-Modal Representation Learning via Semi-Supervised Rate Reductionfor Generalized Category Disc

面向广义类别发现的半监督率缩减多模态表示学习1、摘要GCD旨在同时识别已知类别和未知类别其中仅有部分已知类别样本具有标签因此构成了一个具有挑战性的开放集识别问题。当前MM GCD方法往往更加关注多模态间的对齐而对模态内的对齐关注不足。作者认为以前大家太关注“图文之间对没对齐”却没有充分关注图像空间内部到底有没有形成适合聚类的结构文本空间内部有没有形成适合聚类的结构。因为最终还是要区分类别并不是模态对齐了就行了本文提出一种基于半监督率缩减的方法该方法通过利用模态内对齐学习具有理想潜在结构的跨模态表示。为了增强知识迁移利用VLM的模态间对齐能力对多个候选提示信息进行聚合从而获得更丰富的文本表示。作者在通用和细粒度基准数据集上进行了大量实验结果表明 SSR²-GCD 获得了优于现有方法的性能并验证了模态内对齐在多模态 GCD 中的重要性。写的不太清楚实际上是先给定图像数据再利用VLM相似度检索文本候选再聚合得到文本表示这时候才得到多模态数据。然后再SSR2学习分别塑造两个模态的内部结构——那如果同时考虑模态内和模态间对齐会怎么样论文后面好像做了实验结果反而下降作者认为CLIP 已经提供了一定的跨模态语义对齐在此基础上继续强制 image/text feature 一致可能会牺牲每个模态自身最适合聚类的结构。——如果简单地“两种 loss 相加”不行有没有办法在不破坏模态内部结构的前提下选择性地利用真正有益的跨模态一致性2、引言介绍GCD任务现有方法遵循的是在图像数据上用两阶段框架先微调预训练模型为图像生成表示再在所有无标签数据上学习得到聚类算法。单一模态判别力不足需要迁移到多模态数据中。现有方法通常采用CLIP风格的模态间损失或者GCD风格的模态内损失来进行表示学习但缺乏一种能够恰当利用模态内对齐关系的损失函数所以模态间对齐和模态内对齐到底如何相互作用目前仍然不太明确。——主要是想表达当前GCD模式的模态内对齐关系还不够需要研究两者到底如何作用才能找到适合的改进方法本文将最大编码率缩减原理引入多模态GCD表示学习并提出半监督率缩减GCD方法具体而言引入一个SSR2的损失函数通过增强模态内部的一致性来学习具有理想结构的表示。这样已知类别和未知类别的信息会得到更加均衡的压缩可能因为有无标签会导致两个大类数据的表示会不均衡已知类别的结构紧凑未知类别的会比较松散。此外还提出基于检索的文本聚合策略用于改进文本生成过程生成语义更加丰富的文本表示。提出了一种面向 GCD 的半监督率缩减框架 SSR²-GCD以学习具有理想分布结构的结构化表示。提出了一种有效的基于检索的文本聚合RTA策略通过生成包含更丰富语义信息的文本表示来促进知识迁移。实验验证——我觉得引言里的问题描述完全没讲清楚应该要说当前模态内的损失函数对有无标签数据的压缩程度不一致所以引入半监督率缩减的方法此外模态间和模态内如何相互作用也未知为了更好利用VLM和模态间对齐信息我们引入RTA生成语义更丰富的表示。——此外为什么一定要用视觉来生成文本信息再聚合MM-GCD就是使用的图像-文本成对的数据吗能否在成对数据的基础上做一点表示把RTA的思想引入增强SSR²/TextGCD 研究的是“image-only 数据如何借外部文本”MM-GCD 研究的是“已有真实 image-text pair 如何对齐”。那么中间其实还有一个问题已有真实多模态数据时能否利用 VLM 的外部语义知识进一步增强不完整、噪声或低质量的某一模态并且只选择可靠的增强信息3、相关方法3.1 广义类别发现无标签数据集同时包含已知类别和未知类别的样本要求模型能够同时发现已知类别和未知类别。3.2 多模态广义类别发现常用的是用CLIP处理两种模态的数据一类是成对数据直接用image encoder和text encoder编码另一类是用CLIP对图像生成文本构成多模态信息然而在 GCD 场景下我们只能获得已知类别的类别名称因此对于属于未知类别的图像文本反演网络难以生成高质量的伪文本 token。现有多模态 GCD 已经从“只利用跨模态信息”发展到同时考虑跨模态和模态内信息。然而仍有两个问题没有解决一方面现有模态内对比学习直接继承传统 GCD在半监督条件下会对已知类和未知类产生不均衡压缩另一方面模态间对齐和模态内结构学习是否相互促进仍不明确。—— MM-GCD的数据集本身就是成对的多模态数据样本信息本文是image only所以文本模态不是数据天然提供的而是额外构造出来的。但是用的是CLIP本身并不是生成式模型所以不能直接提供文本描述而是要借助tag和attribute库让CLIP对每一个图像样本去匹配检索相关的tag和attribute再聚合形成更丰富的语义信息。而label是用来做有监督训练的并不是做数据预处理的。——tag 是与图像语义相关的候选概念词不一定等于或接近真实类别标签。attribute是属性特征的描述4、预先知识4.1 问题定义这里不再看了4.2 多模态GCD通用流程文本生成 —— 表示学习 —— 聚类完成类别发现文本生成imagenet的类别名称本身被拿来构建tag词库再用GPT3针对这些tag生成属性描述。这两个结合起来构造一个prompt其实就是候选文本集合P针对某一张图像首先图像编码给所有的候选文本也编码再利用CLIP已有的图文匹配能力计算相似度用CLIP-H/14 冻结不训练做检索得到最相关的c个tag和attribute这些c个内容不直接拼接而是再经过CLIPCLIP-B/16的text encoder编码后的特征信息再加权求和这时候才认为得到了更丰富的语义信息。表示学习给定查询图像及其对应的伪文本后通常还会优化这些表示。TextGCD一般用的是对比学习来约束一个样本的相同模态之间的表示拉近不同样本不同模态的表示推远但是它没有考虑各个模态内部的对齐关系。GET再加入传统GCD的模态内部的对比学习就是用有标签数据进行有监督对比损失簇内压缩簇间推远因此作者认为继承该范式会导致表示不均衡压缩这时候有标签数据会被压得很紧无标签数据压缩相对松散这种不均衡的压缩会妨碍算法识别不同的簇。所以如何让已知和未知类比的样本都形成更加均衡的可区分表示结构是需要解决的问题。cluster现有方法通常用同步用交叉熵损失和自蒸馏损失以及熵正则项对无标签样本进行聚类。此外textGCD还考虑了一个双分支分类器的设定两个分支选取高置信度的样本两个视图在结果层面互相学习和约束。5、本文方法由三个模块组成用于文本生成与聚合的基于检索的文本聚合模块用于表示学习的半监督率缩减模块用于学习伪标签的双分支分类器5.1 基于检索的文本聚合其实沿用了textGCD的设定构造tag和attribute然后检索相似的c个融合形成更丰富的表示。本文没有修改怎么构造tag和attribute这两个部分继承textGCD真正改变的是检索出多个候选之后怎么变成最终的文本表示。textGCD的做法是把所有语义拼接成一个长文本然后送进CLIP生成表示但是CLIP在处理长文本时存在限制超过20个token时性能会下降。所以本文把c个tag和c个attribute分别进行编码再加权求和。ai bi分别是排在第i位置的tag和attributeT是把文本变成tokenF是把token变成embedding。权重设计如图只是对top1赋予最高权重。5.2 用于表示学习的半监督率缩减模块为了从模态的内部关系中学习具有结构的表示并且使类别已知和类别未知的数据表示得到更加均衡的压缩提出了一种SSR2的方法。感觉insight合理解决的方式也还行跟之前看的多视图聚类里一篇cuijinrong写的论文有点类似看能否借鉴。
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门