贾浩楠 发自 凹非寺
量子位 | 公众号 QbitAI
这阵容,到底是哪路神仙搭的台?
看看这几张面孔:李飞飞,ImageNet的奠基人,身兼美国三院院士头衔;Trevor Darrell,伯克利BAIR实验室联合创始人,当年他搞出的Caffe深度学习框架,可是计算机视觉圈子里用得最广的平台之一;Jitendra Malik,R-CNN的核心推手,彻底改变了计算机视觉的发展走向,也是美国三院院士;Pieter Abbeel,深度强化学习领域的老前辈,手握伯克利机器人学习实验室主任和BAIR联合主任两个头衔,还是ACM计算奖得主;Ken Goldberg,机器人学界的泰斗级人物,三十年前就开始死磕机器人抓取和自动化,IEEE会士;Jim Fan,英伟达GEAR实验室的一把手,具身智能领域风头正劲的年轻学者代表。
……
具身智能学术界,恐怕是头一回凑齐了这么个全明星战队。
有搞模型的、玩算力的、做本体的、抓数据的……这些在各自细分赛道里大名鼎鼎的大佬们,全都聚到了具身智能这个大筐里。但有意思的是,他们的关注点让人颇感意外:不是当下最火的机器人通用大脑,而是——灵巧手。
T-Rex这套方案到底是从哪儿冒出来的?它究竟想解决什么痛点?
自动驾驶靠纯视觉,也许能把问题解了,但落到机器人身上,尤其是灵巧手上,这就很难办。
这是个直观得不能再直观的事实:
当手指和手掌进行那些精密又复杂的操作时,单靠摄像头去记录运动数据,根本不够看。
先不说360度无死角拍摄产生的视频数据量有多大,光是机位的布置就是个难题。不同的任务类别,很难像自动驾驶那样建立起标准化的数据集——这直接限制了模型的泛化能力。
所以,给模型塞进“触觉”这个数据模态,就成了一个一石三鸟的好办法:感知精度上去了,操作更细腻精准了,还能形成相对标准的数据集。
但反常识的一幕发生了:
同样的灵巧手、同样的任务,T-Rex团队把触觉力信号直接拼接到一个预训练好的VLA模型里,本想给它“加点手感”——结果任务成功率不升反降,从17%跌到了6%。
看来,触觉不是想加就能加的。论文把原因剖析成了三层。
第一层,数据太贵。
目前主流的大规模机器人数据集,主要面向平行夹爪——两根手指捏合张开,遥操作门槛低。但灵巧手有22个自由度,操作员得戴数据手套,每个手势都要精确映射到机械手上,还要保证视觉、触觉、关节状态严格对齐。现在的灵巧手遥操作成本,是平行夹爪的5到10倍。
第二层,频率对不上。
视觉模型处理一帧图像,动辄几百毫秒,速度只能跑到5到10Hz。但触觉反应需要毫秒级响应,20Hz以上才能捕捉到“正在滑”和“已经滑了”那个临界点。
把两种信号硬塞进同一个低频Transformer里,视觉来不及看,触觉来不及反应。
第三层,表征太浅。
很多方法把触觉当成一个静态的数字——比如“当前压力5牛顿”。但触觉本质上是时序信号:滑动、插入、按压、搓动,每种接触状态都伴随着力随时间变化的独特模式。
既然问题摆在这儿,咱们先看看T-Rex团队交出的答卷怎么样。
在12项真实世界的灵巧操作任务中,T-Rex的平均成功率达到了65%,比最强纯视觉基线的35%高出了30个百分点。
翻书页96%对比68%,开锁70%对比0%——纯视觉方案在这个任务上被打得毫无还手之力。
消融实验的结果更直接:把T-Rex的触觉输入全部拿走,成功率从65%暴跌至42%,降幅达23个百分点——在12项任务里,超过三分之一的有效操作,纯粹是靠“手感”撑起来的。
数据效率也惊人:只给10条微调演示时,经过中期训练的T-Rex能达到约40%的成功率,没经过中期训练的模型则直接归零。
这说明模型并不是在“死记硬背”数据,而是真正理解了“搓”“捏”“拧”这些动作背后的通用手感。
一句话总结:对于灵巧手来说,视觉数据本质上是不够的——触觉不是锦上添花,而是必选项。
谁先搞定“触觉怎么加”的架构难题,谁就能在灵巧手这条赛道上卡住关键位置。
具体是怎么做到的?
T-Rex的核心思路并不复杂——给触觉单独开辟一条高速通道,而不是让它和视觉挤在同一条慢车道上。
整体架构名为Mixture-of-Transformer-Experts,三个专家分工明确。
Latent Expert负责处理视觉和语言,预测未来的视觉表征,相当于给模型提供“接下来会发生什么”的大局观。
Action Expert负责低频动作规划,参数量1.41B,是三个专家里最大的,跑一次管一个动作块。
Tactile Expert负责高频触觉精修,参数量仅0.62B,轻量到可以频繁触发。
关键机制在于Cascaded Flow Matching:
扩散去噪通常需要10步,才能从一团随机噪声变成一个干净的动作轨迹。而T-Rex在第4步处将其一分为二:
前6步由Action Expert完成,生成一个“大方向对了但缺乏手感细节”的半成品;后4步由Tactile Expert接手,注入实时触觉数据完成精修。
为什么选第4步?作者团队通过实验对比发现:切得太早,Action Expert的去噪步数太少,继承不了大规模人类视频预训练获得的先验知识;切得太晚,动作分布已经定型,触觉信号进来也来不及修正了。
第4步正好卡在“该有的形状都有了,但细节还能改”的黄金节点。
这就像写文章:主编(Action Expert)定好大框架后就去忙别的了,四个编辑(Tactile Expert)在不同的节点上轮番检查细节,不需要主编每次都回来重看一遍全文。
触觉信号怎么编码,是另一个关键设计。
触觉传感器存在零点漂移和高频噪声,如果直接把原始电压值喂给模型,模型很可能把传感器噪声当成接触特征给学进去了。
T-Rex利用VQ-VAE,将过去16帧(约0.5秒)的力历史压缩成64个离散码字。不同接触状态——按压、插入、滑动——会被自动聚类到不同的码字上。
这样一来,传感器漂移被过滤掉了,触觉信号也变得可解释——你能看清模型“理解”了什么类型的接触。
还有两个工程细节,第一个:让码本“活起来”。
VQ-VAE码本在训练时经常出现“码本坍塌”——大部分抽屉空着,少数几个塞满各种杂乱状态。T-Rex的做法是定期检查哪些抽屉闲置,主动塞点数据进去“激活”它,确保所有码字都被利用起来。
第二个,给“有手感”的时刻更高权重。
为了避免模型花90%的精力去学好“零接触”这个最容易学的状态,从而忽略真正有价值的接触瞬间,T-Rex给高力帧更高的学习权重,让模型把算力集中在关键接触点上。
论文正文里不会写,但做灵巧手工程化的人一看就懂。
最后是训练策略。
T-Rex采用三阶段训练法:
先在大规模人类视频上预训练(22,889小时),让模型看懂“人是怎么动的”;
再用100小时遥操作数据做中期训练,覆盖207种物体和22种动作基元——目的是把人类视频里的运动知识迁移到机器人本体上,而不是死磕某个具体任务。
最后用约100条任务演示做后训练,快速适配特定需求。
其中最核心的环节是中期训练,它解决了一个根本问题:人手抓杯子的方式和机械手抓杯子的方式不一样,策略不同,受力反馈也不同。如果直接拿人类视频训练出来的模型去操控机器人,它根本不知道如何把“看来的”转化成“做出来的”。
中期训练就是用100小时的遥操作数据,把这道鸿沟填平。它不是让模型死磕某一个具体任务,而是让模型接触207种物体和22种动作基元的组合,理解“搓”这个动作在不同物体上应该怎么执行、“捏”这个动作需要多大的力。
这就像一个人学完游泳理论后,在浅水区把蛙泳、自由泳、仰泳都练了一遍——不追求速度,只追求“会用”。
有了这个基础,最后阶段只用100条任务演示就能快速适配——因为模型已经知道“手感”是什么了,只需要知道“用在哪儿”。
T-Rex的技术路线清晰指向一个判断——视觉和触觉在灵巧操作中不是主从关系,而是并行关系。
它用一个异步架构解决了频率不匹配的底层矛盾,用一套时序编码把漂移的传感器信号变成了可解释的离散词汇,用一组基元组合的覆盖策略替代了特定任务的深度堆叠。
这三件事单看都不是“发明新数学”,但组合在一起,为灵巧手的触觉利用提供了一套可复用的系统方案。
灵巧手,存在一个“第一性原理”吗?
灵巧手赛道眼下最热闹的争论,集中在两个地方:关节运动形式和自由度数量。
腱绳还是连杆?丝杠还是齿轮?11个自由度够用还是得干到27个?不同厂商各执一词,技术路线远未收敛。
这些争论当然都有意义——传动方案决定成本、可靠性和使用寿命,自由度决定灵巧程度的上限——但学术前沿的核心关注,不在这些问题中的任何一个上面。
因为一个更深层的问题很少被讨论:有了这些硬件,算法能不能用好?
传统大模型范式几乎以视觉数据为主,没有针对触觉模态的有效利用方案。T-Rex论文里那个17%掉到6%的实验,恰好说明了这一点——不是触觉没用,是现有多模态大模型架构消化不了触觉。
T-Rex团队的探索最大价值可能就在这里:跳出硬件参数的争论,回到一个更根本的问题——灵巧手做精细操作,到底需要什么数据?
关节形式和自由度数量解决的是“能不能动”的问题,触觉数据解决的是“能不能感知和反应”的问题,由此衍生出需要什么样的触觉数据这个体系化问题,并给出了一个能泛化的方案。
当然,T-Rex这项研究得以完成,一个关键前提是Sharpa Wave提供的硬件基础——22个自由度、180Hz高频触觉信号、稳定的传感器输出。
灵巧手的硬件天花板顶高了,T-Rex才得以在算法层面去够这个上限。
反过来,T-Rex的算法探索也给硬件提出了新要求:手掌区域需要触觉感知,不同传感器的数据格式需要统一。
T-Rex的软件、SHARPA的硬件探索方向,后续可能会给这个细分领域带来更深刻的变化。
首先,灵巧手可能从具身智能本体中分化出来,成为一个独立赛道——占整机成本15%到20%,经济上可行,技术上门槛也足够高。
但如果触觉数据成为核心壁垒,灵巧手就不仅仅是执行器,而是整个感知-决策-执行链条中数据价值最高的一环。谁掌握触觉数据的采集能力和模型训练能力,谁就掌握了议价权。
第二个变化,更多专用场景的具身应用可能被启发。当前具身智能的主流叙事是“通用”——一个模型解决所有任务。
但这个叙事在接触密集型任务上遇到了困难,因为通用数据里触觉是缺失的。T-Rex则证明的是另一种可能性:在一个足够具体的垂直场景里,用专用的数据模态(触觉)、专用的架构设计(异步级联)、专用的数据收集策略(基元×物体),可以取得比“通用”方案好得多的效果。
这条路径如果走通,会启发更多人去寻找类似的高价值专用场景。
T-Rex的贡献不是发明了“新数学”,而是把现有工具组合成一套可用的系统方案,试图建立具身智能触觉数据统一的采集、训练范式,推动灵巧手真正scale up起来。
项目地址:https://tactile-reactive-dexterous.github.io/
作者简介
牛丹彤,UC Berkeley PhD Candidate,NVIDIA Gear Lab实习生,导师Trevor Darrell,主要从事具身灵巧手大模型的研究,曾以第一作者或共同第一作者身份在CVPR, ICML, ICLR等国际顶级会议上发表论文8篇,领导或主要贡献T-Rex,EgoScale等工作,目前谷歌学术引用1100+。
刘卓洋,北京大学元培学院本科生,导师仉尚航,目前在UC Berkeley访问,导师Trevor Darrell,主要从事具身多模态推理大模型方向的研究,曾以第一作者或共同第一作者身份在ICML, ICLR, NeurIPS, ICRA等国际顶级会议上发表论文6篇,其他参与论文共计15篇,目前谷歌学术引用400余次。曾获2026商汤奖学金(全国30人),2025北京大学学术新星提名,北京大学元培学院年度科研奖励,北京大学新生奖学金等。
Trevor Darrell教授,最广为人知的成果是开发了Caffe深度学习库。这个库在深度学习领域具有重要的地位,为众多的研究人员和开发者提供了便捷的工具,极大地推动了深度学习技术的发展。
















