ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

用生成模型造触觉数据:Tactile Genesis如何给具身机器人装上“手感”

用生成模型造触觉数据:Tactile Genesis如何给具身机器人装上“手感” 这几年“具身机器人”成了行业里反复出现的热词人形机器人、机械臂、灵巧手都在往多模态感知和通用操作上卷。但我发现一个很微妙的现状视觉和语言模型已经卷到满天飞触觉却总像“附赠品”很多团队上了力传感器、触觉传感器却只是把读数当成一个额外输入并没有真正思考“触觉应该给机器人提供什么”。直到我认真读完Tactile Genesis这篇论文才觉得终于有人把“具身机器人需要怎样的触觉”这个问题摆到台面上并且给出了一条可落地的技术路线用生成模型去合成大规模触觉数据再用这些数据训练机器人的操作策略。这篇文章算是我自己精读后的拆解和笔记适合做机器人操作、触觉感知、多模态学习以及想从视觉大模型切入具身方向的朋友参考。1. 先从题目说起具身机器人为什么绕不开触觉1.1 触觉不是“锦上添花”而是物理交互的基本前提很多做视觉的人对触觉的第一反应是视觉已经能提供那么丰富的环境信息为什么还要触觉我拿一个最日常的例子回答你摸黑在包里找钥匙眼睛完全看不见但你通常能在一两秒内摸到钥匙并把它捏起来。这个过程依赖的不是视觉而是指尖对形状、材质、滑动趋势的感知。机器人做物理操作时也一样夹爪接触到物体之后物体是否在滑、接触力是否过大、表面是否刚硬这些信息视觉给不了至少给不了那么直接。Tactile Genesis这篇论文非常明确地把触觉定义为“物理交互的基本前提”而不是“感知的附属品”。它强调具身机器人一旦离开仿真环境进入真实世界就必须面对不确定性物体材质不一样、摆放角度有偏差、表面摩擦力不同。如果没有触觉闭环单靠视觉预测的抓取位姿很容易在实际接触后失败。用一句工程上的话来讲视觉负责“在哪里、是什么”触觉负责“碰上了、有多重、会不会掉”。所以从问题定义开始这篇论文就抓住了要害——具身机器人需要的不是“能测到力的传感器”而是一套能支撑决策和控制的触觉理解能力。这种理解能力既要低层的物理量力、力矩、振动也要高层的语义接触状态、滑动事件、物体属性而后者恰恰是当前机器人系统里最缺失的。1.2 机器人触觉需要感知什么从力觉到事件感知我们在实际项目里规划触觉需求时通常会把它拆成五个维度Tactile Genesis论文里也基本对应了这些维度我直接列一下感知维度物理含义典型任务场景力/力矩接触力大小与方向抓取易碎品、装配对准接触几何接触区域形状、物体表面轮廓手指识别物体形状、抓取姿态调整纹理/材质表面粗糙度、摩擦特性区分布料、纸张、金属表面滑移/振动微振动、剪切力变化防止物体滑落、判断螺丝是否拧紧热/材质属性热导率、温度变化区分木质与金属、人体接触安全我读这篇论文特别有共鸣的一点是它把“事件感知”放到了很高的位置。所谓事件感知就是指触觉数据要能回答“刚刚发生了什么”比如“物体开始滑了”“已经碰到桌面了”“夹爪正在把盖子拧松”。这些不是单个时刻的力数值而是一段时间序列里触觉信号的变化模式。这也解释了为什么Tactile Genesis选择生成时间序列触觉图像而不是只生成单帧静态图。静态触觉图像能告诉机器人“接触面积长什么样”但只有连续的触觉序列才能表达“滑动”“按压”“扭转”这类动态事件。具身机器人真正需要的触觉就是这种能支撑时序决策的触觉而不是一组孤立的读数。2. Tactile Genesis 到底做了什么事核心动机与总体路线2.1 现有触觉数据为什么“又少又贵”如果你自己采过触觉数据一定知道这事有多痛苦。首先是物理成本每一次真实的机器人触觉采集都需要接触物体传感器会磨损物体表面会变化实验要反复执行时间成本比采集图像高一个量级。其次是标注成本图像数据可以外包给标注团队画框、打标签触觉数据却很难标注因为“滑移”“接触状态”这类标签只有放在具体动作上下文里才有意义静态数据很难独立标注。更麻烦的是数据多样性。视觉数据集里可以有成千上万种猫、狗、场景但触觉数据要覆盖不同的物体形状、材质、操作动作组合爆炸。很多团队采了半天数据最后发现只覆盖了某个固定工作台上的固定物体换个杯子就失效了。Tactile Genesis的出发点就是这个痛点我们能不能像生成图像一样用生成模型“无中生有”地把触觉数据扩出来这个思路乍一听很疯狂但如果你了解触觉传感器的工作原理就会发现它并不荒谬。现在主流的触觉传感器比如GelSight、DIGIT本质上都是通过摄像头拍摄凝胶表面变形来得到触觉图像。也就是说触觉信号已经被转换成了图像信号。既然视觉图像可以被生成模型高质量地合成那么触觉图像理论上也可以走同一条路。2.2 用生成模型造触觉数据为什么选了这条路在生成触觉数据之前也不是没有别的方案。最传统的是物理仿真用有限元或者接触动力学模型去模拟触觉。但真实的接触力学非常复杂凝胶形变、摩擦力、滑动接触仿真算得慢精度还不够。还有一种思路是手工构造触觉模板用规则拼出不同材质对应的信号但这样做出来的数据太“假”没法覆盖真实世界的连续变化。Tactile Genesis选择的是生成式路线而且选得很自然用条件扩散模型来合成触觉图像序列。扩散模型的特点是能学习复杂数据分布并且在生成时有很强的可控性。你可以给它一个条件比如“正在按压一个易拉罐”它就能生成一段以这个条件为中心的触觉图像序列。论文里的核心判断是触觉图像虽然和自然图像不同但它同样存在分布规律。接触区域的纹理、受力导致的形变、滑动造成的拖影这些在统计上有迹可循。生成模型只要能学到这些规律就能生成出物理上看起来合理的触觉数据而且成本远低于真实采集。2.3 为什么用视觉和语言作为生成条件这里其实是整篇论文的“题眼”。单纯随机生成触觉数据没有意义机器人必须在特定任务、特定物体、特定动作下使用触觉所以生成必须可控。Tactile Genesis把视觉和语言作为两个互补的条件信号这个选择我越看越觉得巧妙。视觉条件提供了物体的外观和形状信息。触觉和视觉在物理上是强相关的一个圆润的瓶身和一个带纹路的表面它们在视觉上的特征会直接反映到触觉图像里。让模型参考视觉图像去生成触觉相当于把“看”和“摸”对齐起来。语言条件则提供了任务意图和动作语义。同样是一个杯子轻轻握住和用力捏碎触觉信号完全不同。语言条件可以告诉生成模型当前是“抓取”还是“按压”还是“拧转”从而让生成数据贴近实际操作上下文。论文里把语言当作动作层面的控制信号这比单纯用视觉条件要高一个层次因为语言能把“任务”编码进触觉数据。3. 方法拆解从条件输入到触觉图像的生成链路3.1 先把触觉“画”成图像GelSight 传感器带来的灵感Tactile Genesis选择以GelSight这类光学触觉传感器作为生成目标我觉得很大原因是它们天然适合“生成”。GelSight的基本原理是一个弹性凝胶块表面涂有反射涂层物体按压在凝胶上时凝胶表面会发生形变内部相机拍下形变后的反射图案就能得到一张包含接触几何、纹理、力分布信息的触觉图像。这种传感器把物理接触转换成了图像信号好处太多了。一方面图像格式可以利用所有成熟的视觉生成技术另一方面触觉图像本身信息密度很高一块区域的颜色和明暗就对应着接触深度和受力大小。Tactile Genesis里采用的是把连续触觉序列拆成“时间帧”每一帧都是一张RGB或灰度图像再放到扩散模型里生成。我在做复现笔记时特别喜欢论文里的一个提法触觉图像是“物理交互的视觉投影”。换句话说我们生成的虽然是一张图但它本质上是一段物理过程的编码。理解了这一点就知道单纯追求图像好看没有用关键是生成的图像要能忠实还原接触状态比如接触边界、压力分布梯度、变形区域大小。3.2 条件扩散模型触觉序列怎么生成Tactile Genesis的生成主体是一个基于扩散模型的架构。扩散模型的原理可以这样理解训练时我们在真实触觉图像上加噪直到变成纯噪声然后让模型学习去预测每一步噪声从而学会从噪声还原出真实触觉图像。生成时我们从纯噪声出发一步步去掉噪声最终得到一张“看起来像真实触觉”的图像。但随机生成没有意义需要加条件。论文里的做法是把视觉图像和文本描述分别通过编码器提取特征再把特征注入到扩散模型的降噪过程中。具体来说模型在预测每一步噪声时会额外参考这些条件特征这样生成出来的触觉图像就会和视觉内容、文本指令保持语义一致。这里有个工程关键点触觉图像是时序数据不是单张图。论文里用了两种方式处理时间维度一是在扩散模型里加入时间Embedding让模型知道当前生成的是第几帧二是用自回归方式先生成第一帧再以第一帧为条件生成第二帧逐步生成完整序列。我在实际复现时发现第一种方式更适合表达连续变化第二种方式更容易累积误差所以后来我基本都是用“在生成过程中加入时序位置编码”的方案。3.3 视觉-触觉-语言特征怎么对齐如果只是让扩散模型参考视觉和语言条件生成结果可能只是表面相关而不是真正对齐。Tactile Genesis在生成链路之外专门加了一个对齐模块用对比学习把视觉特征、语言特征和触觉特征拉到同一个空间。对比学习的目标很简单同一个物体的视觉特征、语言描述、触觉图像特征要尽量靠近不同物体的特征要尽量远离。这样一来模型在生成触觉时就不是“生硬地照着图像画”而是真正理解“什么样的外观对应什么样的手感”。我在论文里看到的实验细节还挺有意思他们专门构造了“语言-触觉检索”评测给定一句“粗糙的橡胶表面”让模型从一批生成触觉图像里找最匹配的。结果显示经过对齐训练后检索准确率明显高于没有对齐的版本。这说明对齐模块不是锦上添花而是让生成触觉变得有用的关键一环。3.4 生成数据如何反哺机器人策略论文的最后一部分技术链路是把生成的触觉数据用到机器人策略训练里。这里有两种主流用法。第一种是数据增强在真实采集的小规模触觉数据里混入生成数据扩大训练集然后让策略模型学习以触觉图像为输入的动作输出。第二种是预训练先让模型在大规模生成触觉数据上做自监督学习学习通用的触觉表征再用小规模真实数据微调。从实验结果看第二种方式的上限更高。原因也容易理解生成数据虽然不能完全替代真实数据但它的多样性可以帮模型建立更丰富的触觉先验。比如模型见过各种虚拟物体的接触形变再到真实场景中遇到类似物体时触觉表征就不容易慌。这篇论文的一大贡献就是证明生成触觉数据不是“假数据”而是一种可以使用的“预训练语料”。4. 实验验证与使用效果生成触觉真的能落地吗4.1 评测维度图像质量只是起点论文的实验部分做了多层评测不是只看生成图像好不好看。图像层面的评价包括FIDFréchet Inception Distance和触觉图真实性但我觉得真正有参考价值的是后续任务层面的评价。作者设置了两个任务一个是物体识别看模型能不能用生成的触觉图像判断物体的材质和类别另一个是机器人抓取策略看用生成数据训练后抓取成功率是否有提升。这两个任务分别对应“触觉感知能力”和“触觉控制能力”。我特别喜欢这种分层评测思路因为实际落地时触觉既要帮机器人“认东西”也要帮机器人“拿东西”这两个能力必须分开衡量。如果只报告图像指标你根本不知道生成的触觉数据能不能用。从论文报告的对比来看单纯加生成数据抓取成功率已经比只用真实数据要好。如果再加上视觉-触觉对齐预训练效果更明显尤其在未见过的物体上成功率提升幅度很大。这也是我认为这篇论文最扎实的地方它不仅提出了生成方法还证明了生成数据对下游任务的真实价值。4.2 几个有代表性的实验场景论文里做了几个典型操作场景我把它们整理成表格方便对比场景任务难点生成触觉的作用未知物体抓取物体形状、材质未知提供多样化的接触图像提高抓取泛化性轴孔装配需要感知接触状态和力生成不同位姿下的接触序列辅助判断对准状态布料整理布料形变复杂、无固定形状生成各种拉扯状态下的触觉图学会判断褶皱情况我印象最深的是轴孔装配实验。这个任务对触觉要求极高机器人需要靠接触力反馈来不断调整插入方向视觉在深孔场景中很容易被遮挡触觉几乎成了唯一可靠的信息源。论文里用生成触觉数据训练策略后装配成功率有了明显提升特别是在初始对准误差较大的情况下触觉闭环的优势体现得非常突出。还有一个细节值得注意论文在生成数据时专门注入了“干涉程度”条件也就是接触深度和侧向力大小。这让策略可以学会区分“还没接触”“轻微接触”“卡住了”三种状态。这种细粒度的触觉事件感知恰恰是真实数据里很难标注、难以覆盖的但生成模型可以轻松产生。4.3 实验之外的观察复现时需要注意什么我根据论文开源思路复现过一部分这里分享几个实战里的观察。第一触觉图像的归一化很重要。不同传感器的触觉图像范围差异很大直接拿过来训练扩散模型容易训练不稳最好先做分位数归一化或者标准化。第二条件特征里的语言描述不能太复杂短指令效果往往比长描述好因为扩散模型对冗长文本的注意力会分散。第三生成触觉序列时要注意连续性如果逐帧独立生成前后帧跳跃会很大论文里用的时序编码方式明显比独立生成更顺。另外我强烈建议复现时先跑一个小规模验证集比如只生成5个物体的触觉序列拿去做策略训练看看趋势是否正确再放大规模。直接上全量数据调试成本会非常高。这不是论文里写的但绝对是我踩过的坑。5. 精读之后的一些坑和思考5.1 “幻触”问题太像了不等于能用扩散模型在视觉上有“幻觉”问题会生成现实中不存在的细节触觉生成也有类似现象我把它叫作“幻触”。论文里虽然用物理约束和对比学习缓解了这个问题但在一些极端条件下模型仍然会生成物理上不合理的触觉图比如说接触区域的形变方向和视觉示意的受力方向不一致。这种“幻触”比图像幻觉更危险因为视觉幻觉最多是看起来怪触觉幻觉会被机器人当成真实物理反馈直接导致错误决策。我在复现时就遇到过生成的一张触觉图像里接触边缘极其清晰根本不像是凝胶的真实形变结果策略模型看到这种图就误以为接触很硬做出了错误的力控。所以我觉得论文方法在实际使用中还需要加一层“触觉判别器”或者“物理合理性约束”专门过滤掉那些不合理的生成结果。如果你也想用生成触觉数据训练机器人千万别只看生成图像是否清晰一定要检查接触边缘、阴影梯度、力和形变的对应关系是否自然。5.2 传感器差异带来的迁移问题Tactile Genesis这套方法另一个现实约束是传感器域差异。GelSight生成的触觉图像如果直接拿给DIGIT传感器训练的策略用效果会打折扣。原因是不同光学触觉传感器的凝胶形状、相机角度、照明方式都不一样触觉图像的表观差异非常明显。论文实验里也承认生成数据主要针对特定传感器形态。我在实际项目中也验证过换一个传感器后需要用少量真实数据做领域自适应否则策略的触觉感知会完全不匹配。这也说明未来的触觉生成方向需要朝着“传感器无关”的中间表征走而不是只生成像素级别的触觉图像。一个可能的思路是把触觉信息抽象成“接触状态图”比如接触区域mask、压力分布场、滑移方向向量再让下游策略使用这些高层表示。这样生成模型只需要合成物理状态而不用关心具体传感器长什么样。我觉得这是这篇论文之后最值得探索的方向之一。5.3 未来方向触觉基础模型与多模态融合Tactile Genesis让我看到一个更大的趋势触觉领域正在从“收集数据、训练专用模型”走向“预训练基础模型”。如果生成式方法能够稳定提供大规模、多样化的触觉数据那么我们就可以像训练视觉语言模型一样训练一个通用的触觉表征模型。机器人换传感器、换任务时只需要在这个基础模型上做少量微调。这个方向一旦走通具身机器人的触觉能力会迎来一个质变。过去每个团队都在重复采集数据、重复标注低水平重复建设严重有了触觉基础模型之后不同团队可以共享一套预训练表征各自只标注少量任务数据开发效率会大幅提升。当然问题也很多。触觉数据的标准化还远没有视觉那么成熟传感器种类繁杂数据格式五花八门这些都是建立基础模型必须先解决的问题。但至少Tactile Genesis证明了触觉生成这条路是可行的基础模型的原料问题有了新的解法。6. 最后再说几句我的体会这篇论文我前前后后读了三遍每次侧重点都不一样。第一遍关注方法本身第二遍关注实验设计第三遍开始思考它对整个具身机器人技术栈的影响。我个人的体会是触觉生成这件事真正的价值不在于“省了几千个小时的采集时间”而在于它让我们第一次可以用构造性的方式去定义“触觉语义”。过去我们在机器人项目里讨论触觉总是离不开传感器选型、滤波算法、数据采集都是从“信号”层面看问题。Tactile Genesis把它拔高到了“理解”层面触觉不是一串数字而是物理交互的语义描述。只有想清楚了这个层面我们才知道该让机器人感知什么样的接触状态也知道怎么用生成模型去构造这些状态。如果让我给正在做机器人感知的朋友一个建议不要只把这篇论文当成一个生成模型应用案例它可以当作一个引子帮你想清楚自己项目里的触觉到底需要表达什么。先把“需要怎样的触觉”这个问题弄明白再谈传感器和模型你会发现很多技术选型都变得清晰很多。
返回列表