CoRL 2026 | 0条带力数据预训练!上海交大卢策吾、汶川团队让VLA学会力
机器之心Pro
把一本书放到书架,前面的动作并不复杂:找到空位,对准方向,向前推。真正的困难在接触发生时:书撞到旁边了吗?推的方向偏了吗?推到底了吗?在这种时候,视觉几乎没有任何变化,模型只能靠力来推断任务状态。
想学会力,离不开数据。但是力和真实机器人硬件强绑定,带力数据采集成本太高,也很难通过 UMI、ego 等方式规模化。
还有更棘手的问题:引入新模态会改变模型架构,是否需要重新预训练,又会不会让模型遗忘原有知识?
这些一直是纯视觉预训练 VLA 不得不面对的问题。
上海交通大学卢策吾、汶川团队联合穹彻提出 LIFT(Late Reactive Injection of Force for VLA Post-Training),在保留模型预训练知识的情况下,仅通过在线后训练教模型学会感知力,并通过力高频反应式生成动作。
这项工作被 CoRL 2026 高分收录,其核心贡献是走通了预训练学先验知识,后训练靠力学高频反应式操作的训练范式,为 VLA 解决感知模态稀缺的难题提供新的可行解。甚至不只是 VLA,对任何以 MoT 为基础架构的预训练模型,LIFT 所提出的方法在理论上都可以适用。相关代码已经开源。
论文标题:Never Too Late for Force: Accelerating VLA Post-Training with Reactive Force Injection
arxiv链接:https://arxiv.org/abs/2607.14236
项目主页:https://lift-policy.github.io/
代码链接:https://github.com/y-wng/lift
图1 LIFT方法总览。LIFT复用预训练动作专家参数,通过反应式力注入与在线纠正学习接触行为。
先看结果:力显著提升任务表现
团队在叠毛巾、插书和汉诺塔圆环放置三个任务上进行测试,LIFT 相比纯视觉后训练分数提升为:
叠毛巾:73.3 → 84.2;
插书:36.7 → 58.3;
汉诺塔圆环放置:26.7 → 56.7。
只需要 20~30 条带力的在线数据,就可以达到这样的效果。而且不仅是插书、汉诺塔放圆环这样的密集接触任务,像叠毛巾这类接触状态相对简单的任务,力依然可以提升其表现并加速这一过程。
想要用好力,LIFT 提出了必须解决的三个难点。
用好力,需要解决三个难点
及时响应接触:真正的接触过程中,瞬间的偏差,就有可能导致任务彻底失败。想用好力,模型必须一边感知,一边快速调整。
保留原有能力:力的加入,不能让预训练模型本来的空间理解、物体操作和场景泛化等能力崩溃,否则就是本末倒置,1+1反而小于1。
兼容异构数据:带力的数据采集成本高,数量极少。如果后训练不能兼容不带力的数据,就很难保证数据的多样性,最终过拟合。
围绕这三个难点,LIFT 提出了一套完整且系统的解决办法。
反应式注入力,完成控制闭环
图2 LIFT架构图。
LIFT 复制预训练动作专家参数,得到一个能根据力反馈及时调整动作的「反应式动作专家」。它通过因果交叉注意力感知最新一个时间段内的力,并据此高频反应式地调整动作;视觉和语言信息则提前计算并缓存,将控制闭环频率从 1Hz 显著提高到 10Hz。
对齐动作专家输出,保留预训练先验知识
图3 平移因果注意力掩码。
如图 3 所示,LIFT 使用平移因果注意力掩码。P 为视觉语言前缀,a 为基础动作 token,r 为反应式 token。①为 base 动作专家注意力,保持全自注意力。②确保反应式动作专家注意力因果性。③为平移注意力。通过权重复制,训练起始时 a=r。通过平移注意力,r 获得与 a 数值完全相同的上下文 token,进而对齐两个动作专家的输出。通过这种方式,LIFT 在数值层面保持预训练模型先验知识。
视觉数据和带力纠正混合训练
图4 LIFT训练管线。
LIFT 采用二阶段式训练。第一阶段,团队用 RoboPocket 采集不带力的纯视觉数据,让模型先学会目标任务;第二阶段,再把模型部署到机器人上,通过在线人工纠正,学习真实接触下的动作调整。在第二阶段,模型同时利用视觉数据和带力数据,对于不含力的纯视觉数据通过力掩码截断其梯度。
LIFT 的四个关键结论
图5 LIFT主要实验结果。横轴为在线采集到的10fps数据帧数,只使用人类干预部分数据训练和统计。每次在线实验2~3小时,采集20~30条数据。
仅靠后训练也能学会力
整个实验中,LIFT 没有用任何一条带力数据重新预训练。
团队证明了在后训练中注入力依然可以发挥力的优势,这是一条更加实际却足够吸引人的路线。
接触一变,动作要立马跟上
许多机器人策略会一次预测未来一段动作,形成一个动作块。这样的设计有利于动作连贯,却也带来一个问题:如果机器人在一个动作块执行途中时碰到阻碍,只能等到下一个动作块生成时再尝试调整。而在接触过程中,任务的成败往往是由一瞬间的精细调整决定的。
LIFT 反应式地注入力,使得策略可以在动作块内根据实时的力感知做高频调整。图 5 对比了 LIFT 与没有反应式力注入的基线,团队发现反应式地注入力对密集接触任务尤其重要。而在叠毛巾这类没有复杂接触的任务上,反应式地注入力相比于纯视觉策略,依然显著加速了任务表现的提升。
真实失误中才好学会力
力与视觉不同,轻微的位置变化就可能带来力分布的巨大漂移。而一旦力出现在数据分布外,模型可能就傻眼了。LIFT 在线地采集带力数据,让数据分布随着模型更新,极大地缓解了这一问题。图 5 对比了 LIFT 与离线采集带力数据的基线,证明了这一结论。
学会力,也能保留先验知识
图7 桌布、物体和光照改变的条件。
后训练加入力,有没有让模型忘记预训练知识?团队发现经过后训练,模型同时保留了力的知识和泛化能力,在桌布、光照甚至操作物体变化后任务表现并没有出现显著下降。
结语:学会力,为时不晚
LIFT 展示了一条面向现有预训练模型的后训练路径:先利用大规模预训练建立任务先验知识,积累空间理解能力,再用少量真机带力纠正补上接触细节;在模型侧,通过复制动作专家、平移因果注意力和零初始化交叉注意力,让新增模态从原有能力出发;在数据侧,通过在线后训练,让数据覆盖策略自身真正遇到的接触状态。
正如论文标题所说,对力而言一直都不晚。