新浪科技 股票

TANGO:让人形机器人学会用整个身体"读懂"房间

市场资讯 10.01 23:28

(来源:科技行者)

2026年的某一天,一台Unitree G1人形机器人走进了加州大学伯克利分校的一间办公室。它接到的指令很日常:"向前穿过开放的休息区,路过左边的花坛和长椅,右边的沙发和桌子。走到右边的沙发处向右转……最后停在右边的柜子旁边。"

这条指令要走30米,中间要转好几个弯,穿过好几个区域。机器人出发了,一路上没有人遥控,全靠自己"看"和"走"。它侧身挤过一条窄道,蹲下钻过一个悬空的障碍物,抬脚跨过地上的杂物,最终稳稳停在目标位置。

整个过程,这台机器人从没在真实世界里训练过一步。它所有的经验,全部来自电脑里的模拟仿真。

这就是本文要讲的研究:TANGO,一套让人形机器人在杂乱室内环境里,靠自然语言指令自主导航的系统。它的特别之处不在于"能听懂话去走路",这事儿很多机器人都能做,特别之处在于它真正解决了一个长期被忽略的问题:机器人的身体,到底该怎么根据周围环境实时调整姿态。

导航这件事,为什么对人形机器人特别难

先说一个可能颠覆你直觉的事实:市面上大多数所谓"视觉语言导航"系统,其实完全不管机器人的身体长什么样。

它们的工作方式是这样的:摄像头拍下画面,模型分析一下"我该往哪走",然后输出一个二维坐标点,或者"前进""左转"这样的离散指令。这套逻辑对轮式机器人、扫地机器人非常好用,因为轮式底盘的形状是固定的,只要平面上没有障碍物,它就能过去。

但人形机器人不是这样。

人形机器人的身体形态在移动过程中是持续变化的,胳膊会摆动,躯干会前倾后仰,腿部姿态随着步态不断切换。这意味着一条在平面地图上看起来完全畅通的路径,实际执行起来可能因为机器人此刻的手臂位置、身体倾斜角度而撞上什么东西。

这就好比你让一个不了解房间布局的人,只拿着一张地面平面图去搬家具穿过房间。地图上显示地面没有障碍,他大步走过去,结果脑袋撞上了低垂的吊灯,或者肩膀刮到了斜挂的画框。地面干净不代表整个三维空间都干净。如果导航系统只在平面上做规划,完全不考虑身体在三维空间里的占用情况,那么"路径可行"和"机器人能走过去"根本就是两码事,差的就是这个维度的信息。

论文里管这个叫做"具身鸿沟"

具身鸿沟:指的是导航决策层面看起来完全合理的动作,在真实物理身体执行时却可能行不通的差距,因为规划时没有考虑身体的实际几何形状。

这个鸿沟不是理论问题,是实打实会撞车的问题。传统视觉语言导航方法,哪怕训练得再好,只要动作空间还是"往前走一米""左转30度"这种平面指令,就永远填不上这个坑。

在TANGO出现之前,业内其实已经有几条不同的技术路线在尝试解决类似问题,但各自都有明显的短板。一类是人形机器人的"全身控制"基础模型,比如GR00T-N1.6、Ψ0这些系统,它们能做出很复杂的上肢动作,但导航部分往往是"外包"给下层控制器处理的高层指令,模型本身并不直接参与"怎么绕开这个箱子"这种精细决策。另一类是专门研究人形机器人越障的强化学习方法,比如HumanoidPF,它们在特定场景里表现很好,能让机器人成功避开障碍物,但这类方法通常严重依赖训练时见过的场景分布,换个新环境或者要走很长的路,效果就会打折扣。

换句话说,市面上要么有"聪明的大脑"但"身体僵硬",要么有"灵活的身体"但"脑子跟不上语言指令和长距离规划"。TANGO想做的,就是把这两件事拧到一起。

TANGO怎么解决这个问题:直接预测全身动作

TANGO的核心设计思路其实很直白:既然平面动作空间不够用,那就别用平面动作空间了,直接让模型预测机器人全身29个自由度的关节角度。

29自由度:指的是人形机器人身体上可以独立转动或伸缩的关节数量,包括腿部、腰部、手臂、手腕等各个部位加起来一共29处可控关节。数字越大,机器人姿态可调整的精细程度越高。

模型接收到的输入是这样的:一段自然语言指令,加上前方摄像头和下方摄像头拍到的实时画面,以及机器人自身关节的当前状态。输出则是接下来一段时间内、一整串连续动作的关节角度序列,外加机器人躯干的旋转姿态。这个输出不再是"往哪个方向走"的抽象指令,而是"每个关节接下来该摆到什么角度"的具体执行方案。

这里就带出一个问题:训练这样一个模型,需要的数据和训练平面导航模型完全不是一个量级的。平面导航你录一段GPS轨迹就行,全身动作导航你得知道每一帧里手臂在哪、腰弯了多少度、脚踩在哪个位置。这种数据,现实世界里几乎不可能大规模采集,靠人工动作捕捉再重定向到机器人身上,成本高得吓人,而且经常因为人和机器人身体结构不一样出现"翻译失真"。

TANGO团队的解法是完全在仿真里造数据,造出来的这套流程他们叫PET,一个三步走的自动化管线。

Plan-Edit-Track(PET):TANGO团队设计的自动化数据生成管线,分为规划、编辑、跟踪三个阶段,用来批量合成物理上可行、且带有全身避障动作的机器人训练轨迹,全程不需要人工采集真实动作数据。

第一步是规划

给定起点和终点,系统先用经典的A星算法在地图上找一条基础路径,这一步会给靠近障碍物的区域加一个软惩罚,让路径本能地往安全区域偏。碰到窄道的时候,系统会主动把身体朝向旋转90度,让机器人侧身通过,这样能通过的空间比正面走要宽松得多。找到路径之后,交给一个叫SONIC的动作跟踪模型,生成一段自然流畅的人形行走动作。

SONIC:一个在约800小时高质量动作捕捉数据上训练出来的运动跟踪模型,能把一串速度指令转化成自然的人形行走动作,同时能让机器人实时跟踪一段参考动作并保持物理稳定。

第二步是编辑,这是整个流程里最有意思的部分。规划阶段生成的动作虽然走得挺自然,但它其实"不知道"路上有障碍物,是纯粹按地图走的。编辑阶段要把这个"盲走"的动作,改造成真正会躲避障碍的全身动作。

具体做法借鉴了一个叫"人形势场"的思路,给机器人身上的关键部位,比如肩膀、肘部、手腕、躯干,施加一种模拟的排斥力,这个力会根据周围障碍物的距离场自动计算方向和大小,离障碍物越近,推开的力越大。这个力不是生硬地拿来强制改变动作,而是转化成一个柔性的位移目标,交给一个全身逆运动学求解器去权衡,既要满足这个避障要求,又不能破坏原有走路姿势的自然度和稳定性。

针对不同类型的障碍物,系统还做了专门的适配。碰到悬空障碍物需要低头弯腰的场景,系统提前几步就开始探测头顶空间,一旦发现快撞上了,会提前触发弯腰动作,而不是等脑袋快贴到障碍物才反应,这样动作看起来才自然连贯。碰到地面矮障碍需要跨步的场景,系统会重新规划抬脚落地的位置,让脚落在障碍物远端之外,同时调整摆动腿抬起的高度曲线,保证整个脚掌在跨越过程中都能安全越过障碍物顶部。

这个编辑过程让我想到一件生活里很常见的事:你走在自家熟悉的客厅里,闭着眼睛都能走个大概不撞墙,但如果客厅里临时多摆了一张茶几,你不会重新规划整条路线,而是身体会本能地微调,侧身让一让,或者迈大步跨过去,核心的走路节奏和步伐感觉完全不变。TANGO的编辑阶段做的就是这件事:保留原本自然的走路节奏和风格,只在真正遇到障碍的局部区域做精细调整。如果不这样设计,而是让模型每次遇到障碍物都重新规划一整套完全不同的动作,那生成出来的动作会显得生硬割裂,机器人走起来就会像被逐帧拼接出来的傀儡,而不是一个流畅的整体。

第三步是跟踪过滤,这一步的作用像质检员。前面编辑出来的动作是纯粹运动学层面的产物,理论上合理,但不一定符合物理规律,可能存在动作太快、蹲得太猛这种实际执行不了的情况。系统把这些编辑后的动作交给SONIC跟踪器,在仿真物理引擎里真实地跑一遍,如果跟踪失败或者发生了碰撞,这条轨迹就直接被丢弃。

这里有个反直觉的设计选择:过滤通过之后,训练用的监督信号用的不是跟踪器实际执行出来的那份轨迹,而是编辑阶段生成的原始参考动作。

为什么要这样绕一圈?因为跟踪器在执行过程中,为了保持物理稳定,往往会对动作做一些微小的妥协和平滑,这种妥协会让动作看起来稍微没那么"人味儿"。研究团队想要的是既物理可行、又保留人类自然运动质感的监督信号,所以跟踪器在这里只承担"验证是否可行"的角色,真正教给模型的还是那份更干净、更接近人类动作的参考轨迹。

整套PET流程跑下来,团队一共生成了64633条训练轨迹,覆盖了VLNVerse和SAGE-3D两个仿真数据集里挑选出来的578个室内场景。这个规模的数据,如果靠真人动作捕捉去采集,几乎是不可能完成的任务,而在仿真里,整个数据生成加渲染只花了211个GPU小时。

模型架构:三套系统各司其职

数据有了,接下来是模型本身怎么设计。TANGO采用了一种"三层系统"架构,这个思路不是TANGO首创,业内一些前沿工作比如Ψ0已经在用类似的分层设计,但TANGO把它具体落到了人形导航这个场景里。

三层系统架构:把整个决策链条拆分成三个不同响应速度的模块,慢速的负责理解语言和场景做高层判断,中速的负责生成具体动作序列,快速的负责把动作稳定执行到硬件上,三者配合工作而不是一个模型包打天下。

最上层负责视觉语言理解,用的是Qwen2.5VL-7B这个视觉语言大模型底座,并且用InternVLA-N1的权重做了热启动,这样模型一开始就带着一些导航相关的先验知识,不用从零学起。前方摄像头和下方摄像头的画面会被竖直拼接成一张图,再喂给模型。

考虑到长时间导航过程中历史画面会越积越多,直接全塞进去内存和算力都吃不消,团队用了一个叫BATS的采样机制,按照一个随时间递减的概率函数,对历史帧进行不均匀采样,离当前时刻越近的画面保留得越细致,越久远的画面采样得越粗略。这个设计其实很符合人的记忆习惯,你回忆五分钟前发生的事情能记得很清楚,回忆一小时前的事情大概只剩个模糊印象。

中间层是动作专家,用的是一个基于流匹配训练的多模态扩散Transformer,负责根据视觉语言层给出的语义理解,结合机器人当前的关节状态,预测接下来一段时间的全身动作序列。这里有个细节值得说一下,团队没有直接用绝对坐标系下的躯干朝向作为训练目标,而是把它转换成相对于动作序列第一帧的相对量,同时额外加了一组辅助的位移和转向增量信息。这种参数化方式让模型更容易学到稳定的回归目标,不会因为绝对坐标的巨大变化范围而训练困难。

为了让预测出来的动作序列在真实执行时衔接得顺滑,团队还用了一种叫RTC的训练技巧。

实时分块(RTC):训练阶段让模型学会以一部分已经确定要执行的动作作为条件,去补全接下来还没确定的动作,这样模型学到的动作分块之间衔接自然,而不是每次推理都从零开始生成一段独立的动作,导致执行时出现卡顿或跳变。

最底层是执行层,也就是前面提到的SONIC跟踪器,它以200赫兹的频率运行,把动作专家给出的参考动作转化成实时的关节控制指令,并且能够处理跟踪过程中的实际扰动,保证机器人不会因为轻微的姿态偏差而摔倒。

这个三层架构的设计逻辑,其实很像一家餐厅的运作方式。主厨(视觉语言层)根据顾客的点单(语言指令)和厨房现状(视觉观察)决定要做什么菜、大致怎么摆盘,这个决策不需要每秒钟都重新想一遍,可以慢慢琢磨。传菜员(动作专家)拿到主厨的方案后,规划出具体端菜走哪条路、先上哪道菜,这个节奏比主厨稍快一些。而真正端着盘子在拥挤后厨里穿梭、随时躲避同事和障碍物的,是手脚利索的服务员(跟踪执行层),他们的反应速度必须是毫秒级的,不然盘子就摔了。如果让主厨亲自去端盘子穿梭厨房,效率会极其低下,因为深度思考和快速反应本来就是两种完全不同的能力,硬塞进同一套系统里,两头都做不好。

实验结果:数字说话

聊了这么多设计,效果到底怎么样?先看标准的视觉语言导航基准测试VLNVerse。

VLNVerse:一个基于IsaacSim构建的、具有照片级真实感室内场景的视觉语言导航评测基准,用来衡量导航模型在给定语言指令后能否准确抵达目标位置。

| 方法 | 是否有底层控制 | 已见场景成功率 | 已见场景SPL | 未见场景成功率 | 未见场景SPL |

| CMA | 否 | 37.35 | 33.36 | 31.15 | 27.92 |

| RDP | 否 | 47.28 | 41.69 | 48.60 | 42.72 |

| InternVLA-N1 | 否 | 51.56 | 34.37 | 45.56 | 34.98 |

| Uni-NaVid | 否 | 51.88 | 39.72 | 45.00 | 39.42 |

| TANGO | 是 | **54.69** | 40.18 | **52.89** | 40.18 |

这张表里有个特别值得注意的地方:除了TANGO,所有其他方法都是在"传送"设定下评测的,也就是说机器人不需要真的用身体走过去,模型给出个坐标点,系统直接把机器人瞬移过去,完全绕开了真实物理执行这一关。而TANGO是唯一一个真刀真枪跑完整个物理执行流程的方法,却依然拿到了最高的成功率和最低的导航误差。

这说明什么?说明在同样有物理约束、真实走路会撞墙会摔跤的条件下,TANGO的表现比那些"作弊式"跳过物理执行的方法还要好。SPL指标上TANGO没有明显领先,论文里给出的解释是底层跟踪器出于安全考虑,倾向于选择更保守但更安全的路径,牺牲了一部分路径效率去换取更高的成功率,这个权衡在实际部署里其实是合理的,谁也不想要一个走最短路但天天撞墙的机器人。

再看杂乱场景下的越障能力测试,这个测试专门加入了低矮障碍、悬空障碍、窄道这些真实生活中常见但传统导航很难处理的元素。

| 方法 | 导航误差 | 成功率 | SPL | 碰撞率 |

| InternVLA-N1零样本 | 5.34 | 26.67 | 11.92 | 19.03 |

| InternVLA-N1 + HumanoidPF | 4.04 | 41.88 | 29.49 | 15.81 |

| TANGO | **4.01** | **43.75** | **31.83** | **9.90** |

碰撞率这一项特别关键。TANGO把碰撞率压到了9.90%,而表现最接近的对手InternVLA-N1配合HumanoidPF跟踪器,碰撞率是15.81%。差了将近6个百分点,意味着每走100趟路,TANGO能少撞6次左右。更值得说的是,HumanoidPF这套对比方案还额外用了激光雷达做三维几何感知,而TANGO全程只靠两个RGB摄像头,没有深度信息,没有激光点云,纯靠视觉理解就做到了更低的碰撞率。

真实世界的测试同样给出了扎实的数字。团队在三种场景里各测了三个不同地点、每个地点五次试验,一共45次试验对比TANGO和微调后的InternVLA-N1加Unitree官方控制器。

| 场景 | InternVLA-N1成功率 | InternVLA-N1平均碰撞次数 | TANGO成功率 | TANGO平均碰撞次数 |

| 短距离2D环境 | 11/15 | 1.40 | **12/15** | **0.40** |

| 长距离2D环境 | 6/15 | 3.47 | **8/15** | **1.07** |

| 杂乱3D环境 | 6/15 | 1.93 | **10/15** | **0.73** |

杂乱环境这一栏差距最大,成功率从6/15提升到10/15,几乎翻倍,同时平均碰撞次数从接近2次降到不到1次。这个场景恰恰是最考验全身协调能力的,需要机器人根据具体指令做出跨步、侧身、蹲下这类真正意义上的全身动作,而不只是简单地往前走或转弯。

消融实验:拆开来看哪个部件最关键

研究团队还做了一系列拆解实验,看看去掉某个设计之后效果掉多少,这种实验对读者理解"每个设计到底值不值得"特别有帮助。

先看动作空间本身的价值。团队做了一个只预测平面轨迹的简化版模型,叫Ours-2D,用来对比全身动作预测和纯平面预测之间的差距。

| 方法 | 是否底层控制 | 成功率 | SPL |

| InternVLA-N1(有底层控制) | 是 | 42.37 | 22.50 |

| Ours-2D(有底层控制) | 是 | 26.67 | 8.34 |

| TANGO | 是 | **52.89** | **40.18** |

这组数据挺扎心的:Ours-2D在传送设定下表现和InternVLA-N1差不多,甚至略好一点,可一旦换成真实物理执行,成功率直接从45.74暴跌到26.67,SPL更是从35.44跌到8.34,几乎只剩零头。这说明单纯预测平面轨迹的方法,在没有物理约束的理想环境下看起来还不错,一旦真正上机器人跑,就会因为完全没考虑身体几何形状而频繁撞车摔跤。这也从反面印证了TANGO选择全身动作空间这个设计不是画蛇添足,而是解决真实问题的必需品。

再看RTC和运动编辑这两个组件各自的贡献。

| 方法 | 成功率 | SPL | 碰撞率 |

| 去掉RTC | 10.94 | 10.94 | 14.60 |

| 去掉运动编辑 | 36.25 | 30.36 | 20.60 |

| SONIC换成ScaleBFM | 40.94 | 29.65 | **9.10** |

| TANGO完整版 | **43.75** | **31.83** | 9.90 |

去掉RTC之后成功率从43.75暴跌到10.94,跌幅超过32个百分点,这是整个消融实验里降幅最大的一项。这说明动作分块之间的衔接问题如果处理不好,会让整套系统几乎失效,机器人可能在每次动作切换的瞬间出现卡顿或者姿态突变,进而导致跌倒或撞击。

去掉运动编辑,也就是不做障碍感知的姿态调整,成功率降到36.25,碰撞率从9.90升到20.60,翻了一倍还多。这直接证明了PET流程里那个"编辑"阶段不是可有可无的美化步骤,而是真正教会模型躲避障碍的核心环节。

把SONIC换成另一款通用跟踪器ScaleBFM之后,各项指标只是轻微下降,都在3个百分点以内。这说明TANGO这套动作生成框架不是绑死在某一个特定跟踪器上的,具备一定的可迁移性,换个底层执行系统依然能正常工作。

写在后面

读完这篇论文,一个让我反复琢磨的细节是"编辑阶段完成后,训练监督信号不用跟踪器执行出来的轨迹,而用编辑阶段的原始参考动作"这个选择。

这其实揭示了一个很少被讨论的矛盾:物理可行性和动作自然度,很多时候是有轻微冲突的。跟踪器为了保证不摔倒,会在执行时做出一些妥协,这些妥协单独看没问题,累积起来却会让动作显得不够"人"。TANGO团队没有偷懒地直接拿跟踪器输出当训练数据,而是专门设计了一套"验证但不采用"的流程,只用跟踪结果做筛选,真正的监督信号另取一份更干净的版本。这种对训练数据质量的较真程度,某种意义上比模型架构本身更能决定最终效果的上限。

另一个值得琢磨的地方是论文里提到的一个局限:整套系统目前只用RGB摄像头,没有深度信息,也没有激光雷达。作者自己也承认,在光线昏暗或者视觉上比较模糊的场景里,这可能会成为瓶颈。TANGO已经证明了纯视觉方案能做到比带激光雷达的对手更低的碰撞率,这本身已经是个不小的成绩,但如果加上深度感知,效果会提升多少,还是一个悬而未决的问题。

一台完全没在真实世界训练过的机器人,在陌生的办公室里走了30米,中间转弯、侧身、蹲下、跨越,全靠仿真里生成的想象经验。这件事本身,值得多想一会儿。

Q&A

Q1:TANGO是什么?

A:TANGO是加州大学伯克利分校等机构提出的首个全身视觉语言导航框架,能让人形机器人根据自然语言指令,直接预测29自由度的全身关节动作,在杂乱室内环境中自主完成侧身、下蹲、跨越等避障动作。

Q2:TANGO和普通的机器人导航方法有什么区别?

A:普通方法只预测平面上的移动轨迹,不考虑机器人身体的三维形状,容易在真实执行时撞到障碍物。TANGO直接预测全身关节角度,能根据障碍物类型做出跨步、侧身、弯腰等针对性动作,碰撞率明显更低。

Q3:TANGO的训练数据是怎么来的?

A:TANGO团队开发了一套叫PET的自动化仿真数据生成管线,通过路径规划、全身动作编辑、物理跟踪验证三个步骤,在仿真环境里合成了64633条带避障行为的训练轨迹,完全不依赖真人动作捕捉。

加载中...