拓冰建站拓冰建站
首页 / 资讯中心 / 正文

133、视觉语言Grounding在感知中的应用:语言引导的目标定位

133、视觉语言Grounding在感知中的应用:语言引导的目标定位从一次失败的抓取说起去年在实验室调试一台UR5e,任务很简单:让机械臂把“桌子左上角那个红色马克杯”抓起来放进旁边的托盘。视觉管线用的是现成的YOLO+分类器,检测倒是挺稳,但问题出在“左上角”和“红色”这两个词上——YOLO只给了“杯子”的框,颜色和位置关系得靠后处理硬编码。那天下午我改了七版规则,从“x320且y240”到“用聚类找左上簇”,最后发现只要光照一变,或者杯子上有个标签贴纸,规则就崩。后来换成语言引导的Grounding模型,半小时搞定,而且换场景不用改一行规则。今天就把这条路上的坑和心得写下来。语言引导的目标定位到底在解决什么传统目标检测输出的是“类别+框”,但机器人操作里我们需要的往往是“带属性的实例”——“那个带条纹的杯子”“挡在红色方块前面的蓝色积木”“离机械臂最近的那个螺丝刀”。这些描述里既有类别,又有颜色、位置、相对关系、甚至隐含的物理属性。你不可能为每种组合训练一个检测器,更不可能在部署时让用户去选预定义的类别。语言引导的Grounding(也叫Referring Expression Comprehension)要做的,就是给定一张图和一句自然语言描述,输出描述所指目标的边界框。它把“感知”从封闭集合的分类问题,变成了开放集合的语义匹配问题。模型怎么选:从两阶段到端到端如果你只是想在现有检测器上加个语言分支,最朴素的做法是两阶段:先用Region Proposal Network或者现成的
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门