触觉赛道新变化:从传感器到数据模型,进入世界模型仍面临核心难题
触觉赛道有何新变化今年以来触觉赛道有了新变化。从WRC可见一些玩家讲的不再只是传感器硬件能力有多高而是开始摆出自己的数据集、模型甚至评测基准。围绕触觉的竞争正在从从一块传感器扩展到数据采集、模型训练和能力评估的整条链条。触觉竞争背后的悖论是什么这背后有一层容易被忽略的悖论触觉能补上纯视觉模型看得见、摸不透的短板让世界模型对物理世界的“想象”更靠谱但同一次接触换一个传感器、换一只手反馈信号可能完全不同。这既是触觉眼下最大的价值也是它最大的麻烦它让模型更懂物理也更容易被焊死在某一套硬件上。触觉竞争如何从传感器卷到数据和模型如果只看出货触觉还是一门硬件生意但如果看2026年以来的投融资和产品消息它却正在变成一门向着数据与模型靠拢的生意。7月千觉机器人同时发布数采夹爪、千小时视触觉数据集TacVerse 1k和触觉模型X - TouchMind V1。三者对应一条连续的技术链采集设备记录操作中的画面、触觉和动作数据集汇总这些记录模型再从中学习如何完成任务。类似变化也出现在其他公司。戴盟机器人4月发布含触觉的全模态数据集Daimon - Infinity据其公开信息首批1万小时数据已在阿里魔搭社区开源6月又与银河通用发布触觉操作评测基准RobOmni其亿元A轮融资也明确投向物理交互数据和物理世界模型。他山科技在触觉传感器月交付量达数万枚的同时开始建设触觉训练平台并提出研发“触觉原生模型”。企业向数据和模型端延伸的同时研究界也在往同一个方向靠拢。RSS 2026大会的触觉专题研讨会上来自头部企业和学界的研究者们认为过去很多机器人论文习惯把触觉留到“未来工作”部分一笔带过如今它正被重新拉回机器人基础模型的核心设计环节。新加坡国立大学、复旦大学等机构联合提出的OmniVTA以及哈尔滨工业大学团队推出的TouchWorld都不约而同地把触觉纳入“预测接下来会发生什么”的范畴这正是世界模型的核心任务。当然模型侧的公开成果目前仍限于论文预印本、展会Demo和技术验证商业收入与长期生产部署都很有限。但变化已经足够清楚触觉企业不再只争夺机器人身上的硬件位置也开始争夺触觉数据如何采、如何表示、如何进入模型的定义权。在底层标准尚未收敛时企业先同时掌握传感器、标定、数采和模型建立一套能够运行的内部闭环最大程度减少各环节之间的适配成本成了相对常见的工程思路。“缺数据”如何被重新定义当然这本身也并不是新概念。2019年加州大学伯克利分校与脸书AI团队发表的论文《Manipulation by Feel》已经在利用触觉预测模型控制机器人操作。近期变化在于触觉开始进入规模更大、同时处理视觉和动作的世界模型体系。而触觉预测能力恰恰是纯视觉世界模型最容易露怯的地方。华盛顿大学与Meta FAIR团队今年2月发布的论文《Visuo - Tactile World Models》指出纯视觉世界模型在物体被遮挡或接触状态模糊时经常凭空想象出违反物理规律的画面加入触觉后模型在理解物体恒存性上的表现提升33%符合运动规律的比例提升29%在真实机器人上的零样本任务成功率最高提升35%。新智具身与复旦团队7月发布的N₀ - TWAM模型在公开的UniVTAC仿真基准上取得84.5%的平均成功率高于同一实验中表现最好的纯视觉世界动作模型FastWAM的48.0%。消融实验显示去掉对未来触觉的预测或当前触觉输入成功率都会明显下降。这些结果都在说明触觉确实能让世界模型的“想象”更贴近真实物理。但一个更棘手的问题也随之浮出水面。今年6月斯坦福、伯克利与英伟达团队联合发布的T - Rex论文作者包括李飞飞、Jim Fan等人给出了一个直接的反例把触觉信号直接拼接进一个已经训练好的VLA模型后平均成功率由17%降至6%采用独立的高频触觉专家、时序编码和专门训练流程后成功率才提高到65%。作者把触觉与视觉的频率差异、同步方式和表示方法列为重要挑战。RSS 2026研讨会上斯坦福大学教授Mark Cutkosky也佐证了这一点他把触觉信号的时序结构类比为声音而非静态画面认为这个领域至今没有摸索出一套专门处理这种高频、多速率信号的标准流程。这就是触觉进入世界模型后绕不开的核心难题模型学到的究竟是“物体打滑时摩擦力会如何变化”这样可以迁移的规律还是“这套传感器在打滑时电压会怎么跳”这样和具体硬件绑定的规律如果是后者换一个传感器、换一只灵巧手、换一套控制系统模型积累的“手感”可能就要从头学起。模型如何开始算经济账视觉领域早年之所以能形成模型和数据的良性循环很大程度上是因为有摄像头这样相对标准化的硬件底座触觉硬件本身还没有形成通用方案电容、压阻、霍尔磁和视触觉等路线记录的并不是同一种信号同一次抓取有的传感器输出压力数值有的测量不同方向的力有的则记录接触面的形变图像。RSS 2026研讨会上也有类似的讨论专家们直言触觉领域至今缺少一个类似的硬件规范太多种互相竞争的传感器方案并存让整个领域长期处于割裂状态。他山科技把这归纳为触觉数据“跨设备迁移难”新智具身则给它起了个更形象的名字叫触觉的“方言问题”。也有人试图为不同触觉硬件建立一层“翻译器”。清华大学、加州大学伯克利分校与Sharpa等8家机构联合提出的FTP - 1是一套跨传感器训练的触觉基础策略。它没有强行把不同传感器的原始信号直接混在一起而是先用不同的编码器处理图像、阵列和力状态等输入再根据这些信号来源位置是来自指尖、手掌还是手腕将编码结果放入统一的触觉表示空间供同一个触觉专家和动作策略使用。FTP - 1聚合了26个数据源、21种传感器和约3000小时触觉操作数据进行预训练。在两套训练阶段未见过的传感器配置上研究者重新训练相应的传感器编码器并分别使用每项任务50条或100条示范进行微调。最终FTP - 1在三项任务中的平均成功率为46.6%高于同一实验中基线模型的15.0%。但FTP - 1还不是通用触觉的最终答案。接入新传感器时它仍要从头训练相应编码器三项新任务还是分别使用了50条或100条示范数据并非直接迁移实验也只覆盖了两套新配置和三项任务。它证明了一部分触觉经验能够跨硬件迁移却还远未把所有传感器翻译成同一种可以直接互换的“手感”。对世界模型来说这意味着触觉暂时还不是一种可以直接汇入同一训练池的数据。数据规模因此也不能只用小时数衡量如果不同传感器的数据无法共同训练再大的数据集也可能只是在扩大一套软硬件系统的经验而没有同步扩大世界模型对物理规律的理解范围。对触觉企业而言这将决定它们向上延伸后建立的是一套围绕自家产品运行的软硬件体系还是一种能够连接更多传感器、机器人和模型的数据基础设施。前者更有利于特定产品快速落地并形成商业壁垒后者则更符合世界模型跨硬件、跨本体扩展的长期构想。我们可以预想在当前硬件与数据条件下在商业化要求下未来一段时间能够形成自家可用体系的“全栈派”可能更有落地希望毕竟目前客户需要的就是能跑通的方案而不是与研发团队一同探索“通用触觉”的技术愿景。千觉、戴盟等同时做传感器、数据和模型本质就是以系统集成闭环换商业落地速度。而在更久的时间维度上只做全栈的公司恐怕会被锁死在自有硬件的出货量天花板里。真正能跑出大估值的是那个能做出“触觉界ImageNet”或者“触觉界Transformer架构”的玩家。不管它是FTP - 1这样的产学研体系化成果还是某家愿意开放数据接口的公司。触觉要让世界模型经得起真实接触的检验也让世界模型原本看似直接的规模化路径多了一些曲折。触觉真正进入通用世界模型的标志不会停留在模型能够生成一段逼真的触觉信号而是模型不必跟着每一款传感器重新认识一次物理世界。