2026/7/26 8:01:20

李飞飞第一篇「触觉」论文:机器人会盲摸麻将了

李飞飞第一篇「触觉」论文:机器人会盲摸麻将了 物理AI最强大脑「会师」SHARPA灵巧手嚯这阵容谁组的局李飞飞ImageNet奠基人美国三院院士Trevor Darrell伯克利BAIR联合创始人他的Caffe深度学习框架曾是计算机视觉领域最广泛使用的平台之一Jitendra MalikR-CNN的核心贡献者之一深刻影响了计算机视觉的发展轨迹同样美国三院院士Pieter Abbeel深度强化学习先驱伯克利机器人学习实验室主任、BAIR实验室联合主任。ACM计算奖得主Ken Goldberg机器人学泰斗30年前就深耕机器人抓取和自动化IEEE会士Jim Fan英伟达GEAR实验室掌舵者具身智能领域最受瞩目的年轻学者之一。……..具身智能学术圈可能是第一次迎来如此全明星阵营。有模型的、算力的、本体的、数据的等等…..在各自细分赛道上如雷贯耳的big name们齐聚具身智能但关注点嘛~一下就让人好奇起来不是当下大热的机器人通用大脑而是——灵巧手。T-Rex从何而起要解决什么问题自动驾驶靠纯视觉是有可能解决问题的但机器人尤其是灵巧手却很难。这是一个直观且浅显的事实手指、手掌进行精密复杂操作时很难只用摄像头记录运动数据。360°无死角的视频数据量有多庞大暂且不说首先机位就没法布置。不同任务类别很难像自动驾驶那样形成标准化数据集——模型泛化性受限。自然而然给模型加入触觉这个数据模态就成了一石三鸟的方法感知精度更高、操作更精准细腻以及可以形成较为标准的数据集。但反常识的事情出现了同样的灵巧手、同样的任务T-Rex团队把触觉力信号直接拼接到一个预训练好的VLA模型里想给它“加点手感”——结果任务成功率从17%掉到了6%。触觉不是想加就能加的论文把原因拆成了三层。第一层数据太贵。现有的大规模机器人数据集主要面向平行夹爪——两根手指一捏一放遥操作门槛低。但灵巧手有22个自由度操作员要戴数据手套每一个手势都要精确映射到机械手上还要保证视觉、触觉、关节状态严格对齐目前灵巧手遥操作成本是平行夹爪的5到10倍。第二层频率对不上。视觉模型处理一帧图像动辄几百毫秒只能跑到5到10Hz。但触觉反应需要毫秒级20Hz以上才能捕捉到“正在滑”和“已经滑了”的临界点。两种信号塞进同一个低频Transformer视觉来不及看触觉来不及反应。第三层表征太浅。很多方法把触觉当成一个静态的数字——“当前压力5牛顿”。但触觉本质是时序信号滑动、插入、按压、搓动每种接触状态都有力随时间变化的独特模式。好问题在这里先看看T-Rex团队解决的怎么样。在12项真实世界的灵巧操作任务上T-Rex平均成功率达到65%比最强纯视觉基线的35%高出了30个百分点。翻书页96%对68%开锁70%对0%——纯视觉方案在这个任务上完全被碾压。消融实验更直接把T-Rex的触觉输入全部拿掉成功率从65%掉到42%降了23个百分点——12项任务里超过三分之一的有效操作纯靠“手感”撑着。数据效率也很惊人仅给10条微调演示时经过中期训练的T-Rex能达到约40%成功率没经过中期训练的模型直接归零。这说明模型不是“背下了”数据而是真正理解了“搓”“捏”“拧”这些动作的通用手感。一句话总结视觉数据对灵巧手来说本质上是不够用的——触觉不是锦上添花而是必选项。谁先解决“触觉怎么加”的架构问题谁就可能在灵巧手这个赛道上卡住位置。怎么做到的T-Rex的核心思路并不复杂——给触觉单独开一条高速通路而不是让它和视觉挤在同一条慢车道上。整体架构叫Mixture-of-Transformer-Experts三个专家分工明确。Latent Expert处理视觉和语言预测未来的视觉表征相当于给模型提供一个“接下来会发生什么”的大局感。Action Expert做低频动作规划参数量1.41B是三个专家里最大的那个跑一次管一个动作块。Tactile Expert做高频触觉精修参数量只有0.62B轻量到可以频繁触发。关键机制是Cascaded Flow Matching扩散去噪通常需要10步才能从一团随机噪声变成一个干净的动作轨迹而T-Rex在第4步处一切两半前6步由Action Expert完成生成一个“大方向对了但缺乏手感细节”的半成品后4步由Tactile Expert接手注入实时触觉数据完成精修。为什么是第4步作者团队通过实验对比发现太早切Action Expert去噪步数太少继承不了大规模人类视频预训练获得的先验知识太晚切动作分布已经定型触觉信号进来也来不及修正了。第4步刚好处在“该有的形状都有了但细节还能改”的黄金位置。这就像写文章主编Action Expert定好大框架后就去忙别的了四个编辑Tactile Expert在不同的节点上轮番检查细节不需要主编每次都回来重看一遍全文。触觉信号怎么编码是另一个关键设计。触觉传感器有零点漂移和高频噪声直接拿原始电压值喂给模型模型很可能把传感器噪声当成接触特征学进去。T-Rex用VQ-VAE把过去16帧约0.5秒的力历史压缩成64个离散码字。不同接触状态——按压、插入、滑动——会被自动聚类到不同的码字上。这样一来传感器漂移被过滤掉了触觉信号还变得可解释——你能看到模型“理解”了什么类型的接触。两个工程细节第一个让码本“活起来”。 VQ-VAE码本理训练时经常出现“码本坍塌”——大部分抽屉空着少数几个塞满各种杂乱状态。T-Rex的做法是定期检查哪些抽屉闲置主动塞点数据进去“激活”它确保所有码字都被利用起来。第二个给“有手感”的时刻更高权重。 避免模型化90%的精力去学好“零接触”这个最容易学的状态而忽略真正有价值的接触瞬间。T-Rex给高力帧更高的学习权重让模型把算力集中在关键接触点上。论文正文不会写、但做灵巧手工程化的人一看就懂。最后是训练策略。T-Rex采用三阶段训练先在大规模人类视频上预训练22,889小时让模型看懂“人是怎么动的”再用100小时遥操作数据做中期训练覆盖207种物体和22种动作基元——目的是把人类视频里的运动知识迁移到机器人本体上而不是死磕某个具体任务。最后用约100条任务演示做后训练快速适配特定需求。其中最核心是中期训练解决了一个根本问题人手抓杯子的方式和机械手抓杯子的方式不一样策略不一样受力反馈也不一样。如果直接拿人类视频训练出来的模型去操控机器人它不知道怎么把“看来的”转化成“做出来的”。中期训练就是用100小时的遥操作数据把这道鸿沟填上。它不是让模型死磕某一个具体任务而是让模型接触207种物体和22种动作基元的组合理解“搓”这个动作在不同物体上应该怎么执行、“捏”这个动作需要多大的力。这就像一个人学完游泳理论后在浅水区把蛙泳、自由泳、仰泳都练了一遍——不追求速度只追求“会用”。有了这个基础最后阶段只用100条任务演示就能快速适配——因为模型已经知道“手感”是什么了只需要知道“用在哪儿”。T-Rex的技术路线清晰指向一个判断——视觉和触觉在灵巧操作中不是主从关系而是并行关系。它用一个异步架构解决了频率不匹配的底层矛盾用一套时序编码把漂移的传感器信号变成了可解释的离散词汇用一组基元组合的覆盖策略替代了特定任务的深度堆叠。这三件事单看都不是“发明新数学”但组合在一起为灵巧手的触觉利用提供了一套可复用的系统方案。灵巧手存在一个“第一性原理”吗灵巧手赛道眼下最热闹的争论集中在两个地方关节运动形式和自由度数量。腱绳还是连杆丝杠还是齿轮11个自由度够用还是得干到27个不同厂商各执一词技术路线远未收敛。这些争论当然都有意义——传动方案决定成本、可靠性和使用寿命自由度决定灵巧程度的上限——但学术前沿的核心关注不在这些问题中的任何一个上面。因为一个更深层的问题很少被讨论有了这些硬件算法能不能用好传统大模型范式几乎以视觉数据为主没有针对触觉模态的有效利用方案。T-Rex论文里那个17%掉到6%的实验恰好说明了这一点——不是触觉没用是现有多模态大模型架构消化不了触觉。T-Rex团队的探索最大价值可能在这里 跳出硬件参数的争论回到一个更根本的问题——灵巧手做精细操作到底需要什么数据关节形式和自由度数量解决的是“能不能动”的问题触觉数据解决的是“能不能感知和反应”的问题由此衍生出需要什么样的触觉数据这个体系化问题并给出了一个能泛化的方案。当然T-Rex这项研究得以完成一个关键前提是Sharpa Wave提供的硬件基础——22个自由度、180Hz高频触觉信号、稳定的传感器输出。灵巧手的硬件天花板顶高了T-Rex才得以在算法层面去够这个上限。反过来T-Rex的算法探索也给硬件提出了新要求手掌区域需要触觉感知不同传感器的数据格式需要统一。T-Rex的软件、SHARPA的硬件探索方向后续可能会给这个细分领域带来更深刻的变化。首先灵巧手可能从具身智能本体中分化出来成为一个独立赛道——占整机成本15%到20%经济上可行技术上门槛也足够高。但如果触觉数据成为核心壁垒灵巧手就不仅仅是执行器而是整个感知-决策-执行链条中数据价值最高的一环。谁掌握触觉数据的采集能力和模型训练能力谁就掌握了议价权。第二个变化更多专用场景的具身应用可能被启发。当前具身智能的主流叙事是“通用”——一个模型解决所有任务。但这个叙事在接触密集型任务上遇到了困难因为通用数据里触觉是缺失的。T-Rex则证明的是另一种可能性在一个足够具体的垂直场景里用专用的数据模态触觉、专用的架构设计异步级联、专用的数据收集策略基元×物体可以取得比“通用”方案好得多的效果。这条路径如果走通会启发更多人去寻找类似的高价值专用场景。T-Rex的贡献不是发明了“新数学”而是把现有工具组合成一套可用的系统方案试图建立具身智能触觉数据统一的采集、训练范式推动灵巧手真正scale up起来。项目地址https://tactile-reactive-dexterous.github.io/作者简介牛丹彤UC Berkeley PhD CandidateNVIDIA Gear Lab实习生导师Trevor Darrell主要从事具身灵巧手大模型的研究曾以第一作者或共同第一作者身份在CVPR, ICML, ICLR等国际顶级会议上发表论文8篇领导或主要贡献T-RexEgoScale等工作目前谷歌学术引用1100。刘卓洋北京大学元培学院本科生导师仉尚航目前在UC Berkeley访问导师Trevor Darrell主要从事具身多模态推理大模型方向的研究曾以第一作者或共同第一作者身份在ICML, ICLR, NeurIPS, ICRA等国际顶级会议上发表论文6篇其他参与论文共计15篇目前谷歌学术引用400余次。曾获2026商汤奖学金全国30人2025北京大学学术新星提名北京大学元培学院年度科研奖励北京大学新生奖学金等。Trevor Darrell教授最广为人知的成果是开发了Caffe深度学习库。这个库在深度学习领域具有重要的地位为众多的研究人员和开发者提供了便捷的工具极大地推动了深度学习技术的发展。Trevor Darrell现在是加州大学伯克利分校Berkeley DeepDrive研究中心的主任。同时担任伯克利EECS系计算机科学分部的教职并受聘于加州大学附属的国际计算机科学研究所ICSI。研究方向涵盖大规模感知学习算法包括物体与行为识别及检测并应用于机器人及移动设备的多模态交互等多种场景。他的研究兴趣包括计算机视觉、机器学习、计算机图形学以及基于感知的人机交互界面。原文链接李飞飞第一篇「触觉」论文机器人会盲摸麻将了-36氪