kdpay钱包(中国)

    TANGO:让人形机器人学会用整个身体"读懂"房间

    2026年的某一天,一台Unitree G1人形机器人走进了加州大学伯克利分校的一间办公室。它接到的指令很日常:"向前穿过开放的休息区,路过左边的花坛和长椅,右边的沙发和桌子。走到右边的沙发处向右转……最后停在右边的柜子旁边。" 这条指令要走30米,中间要转好几个弯,穿过好几个区域。机器人出发了,一路上没有人遥控,全靠自己"看"和"走"。它侧身挤过一条窄道,蹲下钻过一个悬空的障碍物,抬脚跨过地上的杂物,最终稳稳停在目标位置。 这就是本文要讲的研究:TANGO,一套让人形机器人在杂乱室内环境里,靠自然语言指令自主导航的系统。它的特别之处不在于"能听懂话去走路",这事儿很多机器人都能做,特别之处在于它真正解决了一个长期被忽略的问题:机器人的身体,到底该怎么根据周围环境实时调整姿态。 它们的工作方式是这样的:摄像头拍下画面,模型分析一下"我该往哪走",然后输出一个二维坐标点,或者"前进""左转"这样的离散指令。这套逻辑对轮式机器人、扫地机器人非常好用,因为轮式底盘的形状是固定的,只要平面上没有障碍物,它就能过去。 人形机器人的身体形态在移动过程中是持续变化的,胳膊会摆动,躯干会前倾后仰,腿部姿态随着步态不断切换。这意味着一条在平面地图上看起来完全畅通的路径,实际执行起来可能因为机器人此刻的手臂位置、身体倾斜角度而撞上什么东西。 这就好比你让一个不分析房间布局的人,只拿着一张地面平面图去搬家具穿过房间。地图上显示地面没有障碍,他大步走过去,结果脑袋撞上了低垂的吊灯,或者肩膀刮到了斜挂的画框。地面干净不代表整个三维空间都干净。如果导航系统只在平面上做规划,完全不考虑身体在三维空间里的占用情况,那么"路径可行"和"机器人能走过去"根本就是两码事,差的就是这个维度的信息。 具身鸿沟:指的是导航决策层面看起来完全合理的动作,在真实物理身体执行时却可能行不通的差距,因为规划时没有考虑身体的实际几何形状。 这个鸿沟不是理论问题,是实打实会撞车的问题。传统视觉语言导航方法,哪怕训练得再好,只要动作空间还是"往前走一米""左转30度"这种平面指令,就永远填不上这个坑。 在TANGO出现之前,业内其实已经有几条不同的技术路线在尝试解决类似问题,但各自都有明显的短板。一类是人形机器人的"全身控制"基础模型,比如GR00T-N1.6、Ψ0这些系统,它们能做出很复杂的上肢动作,但导航部分往往是"外包"给下层控制器处理的高层指令,模型本身并不直接参与"怎么绕开这个箱子"这种精细决策。另一类是专门研究人形机器人越障的强化学习方法,比如HumanoidPF,它们在特定场景里表现很好,能让机器人成功避开障碍物,但这类方法通常严重依赖训练时见过的场景分布,换个新环境或者要走很长的路,效果就会打折扣。 换句话说,市面上要么有"聪明的大脑"但"身体僵硬",要么有"灵活的身体"但"脑子跟不上语言指令和长距离规划"。TANGO想做的,就是把这两件事拧到一起。 TANGO的核心设计思路其实很直白:既然平面动作空间不够用,那就别用平面动作空间了,直接让模型预测机器人全身29个自由度的关节角度。 29自由度:指的是人形机器人身体上可以独立转动或伸缩的关节数量,包括腿部、腰部、手臂、手腕等各个部位加起来一共29处可控关节。数字越大,机器人姿态可调整的精细程度越高。 模型接收到的输入是这样的:一段自然语言指令,加上前方摄像头和下方摄像头拍到的实时画面,以及机器人自身关节的当前状态。输出则是接下来一段时间内、一整串陆续在动作的关节角度序列,外加机器人躯干的旋转姿态。这个输出不再是"往哪个方向走"的抽象指令,而是"每个关节接下来该摆到什么角度"的具体执行方案。 这里就带出一个问题:训练这样一个模型,需要的数据和训练平面导航模型完全不是一个量级的。平面导航你录一段GPS轨迹就行,全身动作导航你得知道每一帧里手臂在哪、腰弯了多少度、脚踩在哪个位置。这种数据,现实世界里几乎不可能大规模采集,靠人工动作捕捉再重定向到机器人身上,成本高得吓人,而且经常因为人和机器人身体结构不一样出现"翻译失真"。 Plan-Edit-Track(PET):TANGO团队设计的自动化数据生成管线,分为规划、编辑、跟踪三个阶段,用来批量合成物理上可行、且带有全身避障动作的机器人训练轨迹,全程不需要人工采集真实动作数据。 给定起点和终点,系统先用经典的A星算法在地图上找一条基础路径,这一步会给靠近障碍物的区域加一个软惩罚,让路径本能地往安全区域偏。碰到窄道的时候,系统会主动把身体朝向旋转90度,让机器人侧身顺利获得,这样能顺利获得的空间比正面走要宽松得多。找到路径之后,交给一个叫SONIC的动作跟踪模型,生成一段自然流畅的人形行走动作。 SONIC:一个在约800小时高质量动作捕捉数据上训练出来的运动跟踪模型,能把一串速度指令转化成自然的人形行走动作,同时能让机器人实时跟踪一段参考动作并保持物理稳定。 第二步是编辑,这是整个流程里最有意思的部分。规划阶段生成的动作虽然走得挺自然,但它其实"不知道"路上有障碍物,是纯粹按地图走的。编辑阶段要把这个"盲走"的动作,改造成真正会躲避障碍的全身动作。 具体做法借鉴了一个叫"人形势场"的思路,给机器人身上的关键部位,比如肩膀、肘部、手腕、躯干,施加一种模拟的排斥力,这个力会根据周围障碍物的距离场自动计算方向和大小,离障碍物越近,推开的力越大。这个力不是生硬地拿来强制改变动作,而是转化成一个柔性的位移目标,交给一个全身逆运动学求解器去权衡,既要满足这个避障要求,又不能破坏原有走路姿势的自然度和稳定性。 针对不同类型的障碍物,系统还做了专门的适配。碰到悬空障碍物需要低头弯腰的场景,系统提前几步就开始探测头顶空间,一旦发现快撞上了,会提前触发弯腰动作,而不是等脑袋快贴到障碍物才反应,这样动作看起来才自然连贯。碰到地面矮障碍需要跨步的场景,系统会重新规划抬脚落地的位置,让脚落在障碍物远端之外,同时调整摆动腿抬起的高度曲线,保证整个脚掌在跨越过程中都能安全越过障碍物顶部。 这个编辑过程让我想到一件生活里很常见的事:你走在自家熟悉的客厅里,闭着眼睛都能走个大概不撞墙,但如果客厅里临时多摆了一张茶几,你不会重新规划整条路线,而是身体会本能地微调,侧身让一让,或者迈大步跨过去,核心的走路节奏和步伐感觉完全不变。TANGO的编辑阶段做的就是这件事:保留原本自然的走路节奏和风格,只在真正遇到障碍的局部区域做精细调整。如果不这样设计,而是让模型每次遇到障碍物都重新规划一整套完全不同的动作,那生成出来的动作会显得生硬割裂,机器人走起来就会像被逐帧拼接出来的傀儡,而不是一个流畅的整体。 第三步是跟踪过滤,这一步的作用像质检员。前面编辑出来的动作是纯粹运动学层面的产物,理论上合理,但不一定符合物理规律,可能存在动作太快、蹲得太猛这种实际执行不了的情况。系统把这些编辑后的动作交给SONIC跟踪器,在仿真物理引擎里真实地跑一遍,如果跟踪失败或者发生了碰撞,这条轨迹就直接被丢弃。 这里有个反直觉的设计选择:过滤顺利获得之后,训练用的监督信号用的不是跟踪器实际执行出来的那份轨迹,而是编辑阶段生成的原始参考动作。 为什么要这样绕一圈?因为跟踪器在执行过程中,为了保持物理稳定,往往会对动作做一些微小的妥协和平滑,这种妥协会让动作看起来稍微没那么"人味儿"。研究团队想要的是既物理可行、又保留人类自然运动质感的监督信号,所以跟踪器在这里只承担"验证是否可行"的角色,真正教给模型的还是那份更干净、更接近人类动作的参考轨迹。 整套PET流程跑下来,团队一共生成了64633条训练轨迹,覆盖了VLNVerse和SAGE-3D两个仿真数据集里挑选出来的578个室内场景。这个规模的数据,如果靠真人动作捕捉去采集,几乎是不可能完成的任务,而在仿真里,整个数据生成加渲染只花了211个GPU小时。 数据有了,接下来是模型本身怎么设计。TANGO采用了一种"三层系统"架构,这个思路不是TANGO首创,业内一些前沿工作比如Ψ0已经在用类似的分层设计,但TANGO把它具体落到了人形导航这个场景里。 三层系统架构:把整个决策链条拆分成三个不同响应速度的模块,慢速的负责理解语言和场景做高层判断,中速的负责生成具体动作序列,快速的负责把动作稳定执行到硬件上,三者配合工作而不是一个模型包打天下。 最上层负责视觉语言理解,用的是Qwen2.5VL-7B这个视觉语言大模型底座,并且用InternVLA-N1的权重做了热启动,这样模型一开始就带着一些导航相关的先验知识,不用从零学起。前方摄像头和下方摄像头的画面会被竖直拼接成一张图,再喂给模型。 考虑到长时间导航过程中历史画面会越积越多,直接全塞进去内存和算力都吃不消,团队用了一个叫BATS的采样机制,按照一个随时间递减的概率函数,对历史帧进行不均匀采样,离当前时刻越近的画面保留得越细致,越久远的画面采样得越粗略。这个设计其实很符合人的记忆习惯,你回忆五分钟前发生的事情能记得很清楚,回忆一小时前的事情大概只剩个模糊印象。 中间层是动作专家,用的是一个基于流匹配训练的多模态扩散Transformer,负责根据视觉语言层给出的语义理解,结合机器人当前的关节状态,预测接下来一段时间的全身动作序列。这里有个细节值得说一下,团队没有直接用绝对坐标系下的躯干朝向作为训练目标,而是把它转换成相对于动作序列第一帧的相对量,同时额外加了一组辅助的位移和转向增量信息。这种参数化方式让模型更容易学到稳定的回归目标,不会因为绝对坐标的巨大变化范围而训练困难。 实时分块(RTC):训练阶段让模型学会以一部分已经确定要执行的动作作为条件,去补全接下来还没确定的动作,这样模型学到的动作分块之间衔接自然,而不是每次推理都从零开始生成一段独立的动作,导致执行时出现卡顿或跳变。 最底层是执行层,也就是前面提到的SONIC跟踪器,它以200赫兹的频率运行,把动作专家给出的参考动作转化成实时的关节控制指令,并且能够处理跟踪过程中的实际扰动,保证机器人不会因为轻微的姿态偏差而摔倒。 这个三层架构的设计逻辑,其实很像一家餐厅的运作方式。主厨(视觉语言层)根据顾客的点单(语言指令)和厨房现状(视觉观察)决定要做什么菜、大致怎么摆盘,这个决策不需要每秒钟都重新想一遍,可以慢慢琢磨。传菜员(动作专家)拿到主厨的方案后,规划出具体端菜走哪条路、先上哪道菜,这个节奏比主厨稍快一些。而真正端着盘子在拥挤后厨里穿梭、随时躲避同事和障碍物的,是手脚利索的服务员(跟踪执行层),他们的反应速度必须是毫秒级的,不然盘子就摔了。如果让主厨亲自去端盘子穿梭厨房,效率会极其低下,因为深度思考和快速反应本来就是两种完全不同的能力,硬塞进同一套系统里,两头都做不好。 VLNVerse:一个基于IsaacSim构建的、具有照片级真实感室内场景的视觉语言导航评测基准,用来衡量导航模型在给定语言指令后能否准确抵达目标位置。 这张表里有个特别值得注意的地方:除了TANGO,所有其他方法都是在"传送"设定下评测的,也就是说机器人不需要真的用身体走过去,模型给出个坐标点,系统直接把机器人瞬移过去,完全绕开了真实物理执行这一关。而TANGO是唯一一个真刀真枪跑完整个物理执行流程的方法,却依然拿到了最高的成功率和最低的导航误差。 这说明什么?说明在同样有物理约束、真实走路会撞墙会摔跤的条件下,TANGO的表现比那些"作弊式"跳过物理执行的方法还要好。SPL指标上TANGO没有明显领先,论文里给出的解释是底层跟踪器出于安全考虑,倾向于选择更保守但更安全的路径,牺牲了一部分路径效率去换取更高的成功率,这个权衡在实际部署里其实是合理的,谁也不想要一个走最短路但天天撞墙的机器人。 再看杂乱场景下的越障能力测试,这个测试专门加入了低矮障碍、悬空障碍、窄道这些真实生活中常见但传统导航很难处理的元素。 碰撞率这一项特别关键。TANGO把碰撞率压到了9.90%,而表现最接近的对手InternVLA-N1配合HumanoidPF跟踪器,碰撞率是15.81%。差了将近6个百分点,意味着每走100趟路,TANGO能少撞6次左右。更值得说的是,HumanoidPF这套对比方案还额外用了激光雷达做三维几何感知,而TANGO全程只靠两个RGB摄像头,没有深度信息,没有激光点云,纯靠视觉理解就做到了更低的碰撞率。 真实世界的测试同样给出了扎实的数字。团队在三种场景里各测了三个不同地点、每个地点五次试验,一共45次试验对比TANGO和微调后的InternVLA-N1加Unitree官方控制器。 杂乱环境这一栏差距最大,成功率从6/15提升到10/15,几乎翻倍,同时平均碰撞次数从接近2次降到不到1次。这个场景恰恰是最考验全身协调能力的,需要机器人根据具体指令做出跨步、侧身、蹲下这类真正意义上的全身动作,而不只是简单地往前走或转弯。 研究团队还做了一系列拆解实验,看看去掉某个设计之后效果掉多少,这种实验对读者理解"每个设计到底值不值得"特别有帮助。 先看动作空间本身的价值。团队做了一个只预测平面轨迹的简化版模型,叫Ours-2D,用来对比全身动作预测和纯平面预测之间的差距。 这组数据挺扎心的:Ours-2D在传送设定下表现和InternVLA-N1差不多,甚至略好一点,可一旦换成真实物理执行,成功率直接从45.74暴跌到26.67,SPL更是从35.44跌到8.34,几乎只剩零头。这说明单纯预测平面轨迹的方法,在没有物理约束的理想环境下看起来还不错,一旦真正上机器人跑,就会因为完全没考虑身体几何形状而频繁撞车摔跤。这也从反面印证了TANGO选择全身动作空间这个设计不是画蛇添足,而是解决真实问题的必需品。 去掉RTC之后成功率从43.75暴跌到10.94,跌幅超过32个百分点,这是整个消融实验里降幅最大的一项。这说明动作分块之间的衔接问题如果处理不好,会让整套系统几乎失效,机器人可能在每次动作切换的瞬间出现卡顿或者姿态突变,进而导致跌倒或撞击。 去掉运动编辑,也就是不做障碍感知的姿态调整,成功率降到36.25,碰撞率从9.90升到20.60,翻了一倍还多。这直接证明了PET流程里那个"编辑"阶段不是可有可无的美化步骤,而是真正教会模型躲避障碍的核心环节。 把SONIC换成另一款通用跟踪器ScaleBFM之后,各项指标只是轻微下降,都在3个百分点以内。这说明TANGO这套动作生成框架不是绑死在某一个特定跟踪器上的,具备一定的可迁移性,换个底层执行系统依然能正常工作。 读完这篇论文,一个让我反复琢磨的细节是"编辑阶段完成后,训练监督信号不用跟踪器执行出来的轨迹,而用编辑阶段的原始参考动作"这个选择。 这其实揭示了一个很少被讨论的矛盾:物理可行性和动作自然度,很多时候是有轻微冲突的。跟踪器为了保证不摔倒,会在执行时做出一些妥协,这些妥协单独看没问题,累积起来却会让动作显得不够"人"。TANGO团队没有偷懒地直接拿跟踪器输出当训练数据,而是专门设计了一套"验证但不采用"的流程,只用跟踪结果做筛选,真正的监督信号另取一份更干净的版本。这种对训练数据质量的较真程度,某种意义上比模型架构本身更能决定最终效果的上限。 另一个值得琢磨的地方是论文里提到的一个局限:整套系统现在只用RGB摄像头,没有深度信息,也没有激光雷达。作者自己也承认,在光线昏暗或者视觉上比较模糊的场景里,这可能会成为瓶颈。TANGO已经证明了纯视觉方案能做到比带激光雷达的对手更低的碰撞率,这本身已经是个不小的成绩,但如果加上深度感知,效果会提升多少,还是一个悬而未决的问题。 一台完全没在真实世界训练过的机器人,在陌生的办公室里走了30米,中间转弯、侧身、蹲下、跨越,全靠仿真里生成的想象经验。这件事本身,值得多想一会儿。 A:TANGO是加州大学伯克利分校等组织提出的首个全身视觉语言导航框架,能让人形机器人根据自然语言指令,直接预测29自由度的全身关节动作,在杂乱室内环境中自主完成侧身、下蹲、跨越等避障动作。 A:普通方法只预测平面上的移动轨迹,不考虑机器人身体的三维形状,容易在真实执行时撞到障碍物。TANGO直接预测全身关节角度,能根据障碍物类型做出跨步、侧身、弯腰等针对性动作,碰撞率明显更低。 A:TANGO团队开发了一套叫PET的自动化仿真数据生成管线,顺利获得路径规划、全身动作编辑、物理跟踪验证三个步骤,在仿真环境里合成了64633条带避障行为的训练轨迹,完全不依赖真人动作捕捉。

    关键词:TANGO:让人形机器人学会用整个身体"读懂"房间 · 更新于 2026-10-02 23:00:47 · 本页 http://www.phzzp.com/uploads/img1/20180320/5ab0d618c50ab

    BTC 8.7 万逼空终结:需求断档,多头风险积聚

    至于这些从业人员为何能轻易逃过清剿,妙瓦底当地村民称他们目睹了大批外国从业者和高级管理人员被当地武装人员转移。当地人认为当时的联合突袭是特意为迎合当时东盟峰会而采取的行动。

    张亚超20261002 · 6分钟阅读

    墨西哥媒体:“搞笑诺贝尔奖” 带给高等教育的思考

    这种新的消费主体,与过去完全不同。它没有眼睛,不逛商场,也不一定打开淘宝、京东等电商平台。它通过API、结构化数据和智能体协议寻找商品,可能同时比较几千个SKU,不会因为首页漂亮而冲动消费,也很少因为直播间主播喊“最后三单”就改变决定。它看参数、价格、库存、交付时间、退换货条件和用户授权。传统商业长期研究“人怎样消费”,今后还要研究一个新问题:智能体如何消费?

    汪胜春20261002 · 10分钟阅读

    智算中心“满载”与“闲置”并存 新一轮算网建设建立风控闭环

    热苏斯表示:“他们没有理由不支持我……重要的是我们需要做的事情。我知道你为什么问这个问题。有些事情会发生,但不会让球队分裂,也不会让我们分裂。”

    张星杰20261002 · 1分钟阅读

    C罗公开打脸主教练!宣布退出国家队集训,昔日领袖成球队毒瘤

    聊下来,谭主发现,中美之间共同关注的议题其实很多。推动这些议题的,不只是官方对官方,更是官方、半官方、民间多层交织。

    张艳龙20261002 · 7分钟阅读

    壁仞科技下一代芯片即将投入量产,性能或超英伟达H200

    单个超节点机柜投资高昂,美国安森美供电方案约11.5万美元,德国英飞凌方案也超过10万美元,而供电系统失效率要求低至十亿分之一,远超车规级标准。

    王近海20261002 · 7分钟阅读

    霍伊伦不满进球被判成乌龙:我在我母亲坟前发誓,我碰到球了

    利昂内尔,你好,我想问问你对这次重新被召入国家队的这群小将有什么看法?他们可能经历了几期落选,比如很多人看好能打首发的马蒂亚斯-苏莱,是否有谁惊艳到了你?你是否觉得他们带来了新的活力?另外这次换血把像洛塞尔索、德保罗这样的核心主力排除在外了,你如何看待这种轮换呢?

    杨杰龙20261002 · 4分钟阅读

    瑞士足协:撤回今年6月支持因凡蒂诺连任国际足联主席的决定

    桑哈吉曾担任法国队安保负责人超过20年。2004年,他以警察身份加入法国队,后来成为不同一代国脚都十分信任的人物。球员们都叫他“莫莫”。据《队报》报道,国脚们曾支持他继续随队参加2026年世界杯,齐达内之后也曾向法国足协力主让他留在新的教练组中。

    张立伟20261002 · 3分钟阅读

    萨内蒂:我有幸在梅西刚进入国家队时和他一起踢球,很钦佩他

    本赛季阿森纳顾问委员会的首次会议于上月举行,俱乐部高层与球迷代表参加了会议,并分享了相关球场规划。联席主席乔什-克伦克通过线上方式参会,首席传播官理查德-加里克则亲自出席。

    巩颖杰20261002 · 10分钟阅读

    名宿邓恩:曼城的荣誉永远会被打上星号

    我前几天晚上已经回应过这个话题了,这不是关于我的事,不幸的是这是曼城俱乐部本身的问题。我看到他们在一审败诉后准备提出上诉,但是这真的不是与我相关的问题,真的,我前几天在土耳其就已经说过了。

    苏彬20261002 · 6分钟阅读

    米体:多多续约停滞,佛罗伦萨可能人财两空

    曼城已经提出上诉,并继续坚称自己没有违反英超方面的指控。委员会可采取多种处罚措施,包括扣分、禁止引援,甚至将曼城逐出联赛。曼联、阿森纳、托特纳姆热刺和利物浦也在密切关注此案。这几家俱乐部此前保留了在判决对曼城不利时提起诉讼的权利,据称已经开始讨论这一可能性。按计划,上诉程序应在1月底前结束。

    刘东红20261002 · 3分钟阅读

    美股收盘:三大指数集体上涨;半导体、存储板块多数上涨,SK海力士涨超5%,美光科技涨超3%;油价、金银价格齐涨

    比亚迪以超 46 万辆稳居榜首,上汽、奇瑞、吉利紧随其后。零跑同比大增 58.51%,小米澎程首月交付破万。蔚小理格局持续分化,新能源市场竞争白热化。

    窦伟20261002 · 3分钟阅读

    快手直播“AI万象”上线AI互动玩法 直播间曝光与观看效率提升30%

    部分教师的教研成长,更多关注个人能力提升,把教研积累用于个人专业发展和赛事参评,缺少同伴互助与团队共建意识。个人成长速度存在局限,也难以带动区域教研氛围整体提升。

    轷佳兴20261002 · 1分钟阅读