}

编辑|Youli

本届 WRC,人形机器人前所未有地密集。几乎每个主要展台都立着一副挺拔的「人形」—— 跑跳、挥手、抓取,行业似乎已经形成某种默契:通向通用机器人的路,终点是人的形状。



维他动力也在大会上交出了自己的人形答卷:首款人形机器人 Vbot ATOM 首次公开亮相,并同步开启预订。但 ATOM 并非从零起步的新项目,它身后,站着已经量产交付、走进真实用户生活的四足机器人「大头」,以及由此积累的真实数据与迭代闭环。

而这恰好击中了人形热潮下最容易被忽略的一个问题:造出一副人形的身体,正在变得越来越容易;但装进这副身体的智能从哪里来?

如果每换一副身体、每添一个任务,都要重新采数据、重新训练,机器人的能力就永远被困在单机与单场景里。换句话说 —— 如果机器人换了一副「身体」,能否「继承」已经学会的智能?



在发布会上,Vbot 维他动力联创兼技术副总裁秦海龙给出一个生动的场景案例:假设四足机器人、人形机器人同时进入一个会议室,任务是「找到水杯,并把它带回来」。

此时,空间一样、任务一样,截然不同的只有「身体」。那对于这些不同的本体而言,哪些能力可以相互「继承」?又有哪些能力需要基于各自身体,在真实物理世界中持续学习、迭代?

基于这一问题,维他动力提出了「Vbot Embodied Genome|具身基因组」,核心理念是:让智能跨任务继承、跨本体进化。



围绕这一技术体系,维他动力同步公布了三大核心模型:负责多模态流式全双工交互与异步推理的 Vbot-OmniDuplex,负责动作条件未来预测与策略评估的 Vbot-WorldModel,以及共享策略骨干与多本体 Real-Sim-Real 进化的 Vbot-EvoMorph。



三者分别对应机器人智能链条中的三个关键环节:理解人、预测未来、适应不同本体,最终连接成一条完整闭环:前台持续交互、世界持续推理、本体持续进化……

而在「具身基因组」发布的背后,一个更宏大的行业问题浮出水面:当具身智能加速走向物理世界,机器人所谓的「通用」,是否不仅意味着「一个模型覆盖更多任务」,更要追问「一套已经形成的智能系统,能否顺畅进入截然不同的物理身体」?

带着这些思考,发布会后,机器之心与Vbot 维他动力联创兼技术副总裁秦海龙聊了聊,剖析跨本体智能继承的技术机制、真实数据的稀缺本质,以及人形产品化的底层逻辑。



秦海龙拥有哈尔滨工业大学、新加坡国立大学及韩国浦项科技大学机器人学与计算机工程背景,具备十余年产业研发与技术管理经验,曾历任蔚来自动驾驶高级总监、千里智驾首席科学家,主导了多模态基础模型、强化学习及端到端技术在下一代智能驾驶方案中的工程落地。

今年 3 月,秦海龙正式加入维他动力出任研发副总裁,全面负责世界模型、空间智能、Agent OS 及人形机器人研发。其在自动驾驶领域沉淀的大规模量产、工程闭环与物理世界理解能力,正加速注入维他动力多形态具身产品的演进链路中。

机器之心:从四足机器人「大头」到最新的人形机器人 ATOM,不同本体之间能够「继承」的智能有哪些?

秦海龙:智能「继承」不能一概而论,而是分模块的:

第一是交互层,可以做到 100% 完全继承。因为机器人与人的交互理解、成功与失败案例与物理本体形态无关,四足积累的交互数据可直接迁移到人形身上。

第二是策略生成与空间理解层,整体处于高度复用状态。比如,移动导航任务,对空间动静态环境的理解、避障、通行判断等,四足与人形没有太大差异;操作任务上,我们采用无本体(Egocentric / 第一人称视角)基模路线,复用大量公开与合成数据构建基模储备,当前真正的瓶颈主要在真机后训练数据上。

第三是底层运控与强化学习层,表现为「隐空间共通,末端分叉」。就是说,上层的隐空间理解、环境感知和控制逻辑是相通的,下层则由于关节自由度、拓扑结构、运动学不同,最终输出会分叉,需要依靠特定本体的适配层与强化学习(RL)来完成控制。

机器之心:刚刚说到数据的稀缺,其实行业都在谈操作数据稀缺,在你看来,具身智能领域真正稀缺的数据到底是什么?

秦海龙:行业目前很多采集方式依赖遥操,但遥操数据本质上是专家数据,真正稀缺的是真实用户使用过程中产生的问题数据。

专家数据往往只能告诉机器人「在理想状态下应该怎么做」,但机器人进入真实环境后,会遇到大量训练阶段没有覆盖的问题:为什么这个动作失败?为什么环境发生变化?为什么用户需要介入?

这些真实反馈,才是推动机器人持续进化的重要来源。

因此,具身智能不能只停留在实验室或者仿真环境里,而需要进入真实用户场景,通过持续运行形成数据闭环。

机器之心:那未来具身智能未来的终极竞争壁垒,到底是在大参数模型,还是在数据闭环?

秦海龙:模型只是开始,真正重要的是,让模型进入真实环境,并在真实世界中跑通全链路闭环。

机器人不是单纯的软件系统,它需要模型、本体、产品和真实场景共同参与。模型需要通过机器人获得反馈;机器人需要通过数据持续优化;优化后的能力又需要重新回到产品。只有这个循环真正跑起来,机器人智能才能不断积累。

所以最终比拼的是公司整体的软硬件实力,谁能够把技术、本体、产品和商业真正「打穿」。机器人需要进入真实场景,那就意味着终端必须能够量产并进入真实生活 / 消费场景(从 1 台、100 台到 1000+ 台滚动起来),才能沉淀出有价值的真机反馈,所以这是软硬件工程与量产交付的综合能力,不是纯算法技术问题……

机器人越来越「通用」,但换一副身体后很多能力仍要重来?

当前,具身智能行业对「通用」的追逐几乎成为共识:业界试图让单一模型覆盖多样任务,将跨场景的海量数据混合训练,并极力推动不同构型的机器人共享模型权重。

然而,这种照搬纯软件大模型的通用尝试遭遇了严峻瓶颈。核心症结在于,不同于纯数字世界中输入输出高度标准化的 Token,机器人有一副置身于真实物理世界的「身体」:四足、人形与轮足在自由度、关节拓扑、接触力学、惯性与平衡约束上截然不同。

因此,「学会一个任务」和「把能力迁移到另一副身体」,在物理底层是两个维度的问题。

维他动力意识到了这一断层,进一步追问:除了模型权重和训练数据,还有没有更底层的东西可以被抽象出来,跨本体复用?

答案是:理解用户意图、规划高层任务、推演行动后果、评价动作价值,以及从真实失败中持续学习的进化机制……

这正是「具身基因组」的核心逻辑:它不是一组僵化的参数,而是一套跨任务可继承、跨本体可表达,并由真实物理反馈持续改写的同源智能体系。其底层架构被组织为三条深度耦合的闭环:



其核心架构原则在于:共享高层语义与空间理解,分化特定任务表征,独立底层本体控制。

下面,我们来具体看一下。

机器人首先要解决在恰当「时机」理解人

机器人执行任务的逻辑起点是理解人类意图,但在真实的家庭或生活空间中,人机交互绝非传统 ChatBot 那样「一问一答」的规整「轮次制」。

比如,用户可能一边向前走,一边对身旁的机器人发出指令:「跟着我…… 等一下,先别过来」。此时机器人不仅在移动,还要持续观测用户的朝向、前方的动态障碍与空间结构;一句话尚未结束,人类已经中途修正了意图。如果机器人必须等待一整句话录入完毕才开始解析,交互将不可避免地陷入迟滞与动作脱节。

因此,秦海龙告诉机器之心,进入物理世界后,机器人需要理解的不只有「说了什么」,理解「时机」很重要:何时听、何时说、何时进入复杂任务思考。

Vbot-OmniDuplex 专为这种物理世界的连续交互而生。它采用多模态流式全双工架构,将音频、视频、文本和物理传感器事件对齐到 240 毫秒的微轮次中。



其中,Thinker-Talker 架构进一步将前台交互和后台推理解耦:Talker 负责低延迟的即时语音和轻量反馈,确保前台交互自然流畅;Thinker 则在后台持续进行多模态空间感知与长程任务拆解。



当遇到复杂任务时,系统则触发 [THINK] Handoff 机制,将任务交给后台 Agent,推理结果再回流前台,实现「边看、边听、边说、边干」的多任务协同。

理解了人类意图,接下来的核心命题是:机器人该如何安全、精准地行动?

世界模型从「生成未来」走向「用未来做决策」

近几年,世界模型无疑是具身智能领域的一个重要方向,许多技术 Demo 聚焦于展现模型生成的画面是否逼真、镜头移动是否连贯、空间是否稳定;运动是否符合物理规律…… 这些探索固然重要,但对机器人而言存在一个更尖锐的工程问题是:世界模型生成的未来,究竟能否直接指导机器人下一步的物理决策?

Vbot-WorldModel 的定位正是基于动作条件的决策推演引擎,它打破了传统策略「输入观测 — 直接输出动作」的黑盒映射,在决策链路中嵌入了「未来推演」,过程可总结为:生成 — 评估 — 优化:



比如,当机器人来到一个路口,传统策略可能直接根据当前环境选择方向。但加入 WorldModel 后,机器人可以提前推演:向左走会发生什么?向右走会发生什么?继续前进是否更优?之后,选择更合适的行动。

对于机器人而言,世界模型真正重要的价值,不只是生成一个「看起来合理」的未来,而是让未来预测真正参与当前决策。

需要注意的是,秦海龙告诉机器之心,为了训练这套能力,目前 Vbot-WorldModel 使用的数据包括770K + 真实导航片段、3000 + 小时视频、约 5000 公里轨迹,覆盖道路、园区、社区、办公、家庭和公共空间。



从四足到人形,跨本体共享「策略意图」,独立「身体表达」

理解用户、规划并推演完路径,策略终究要落到物理关节上。

回到前面提到的「在会议室找到水杯」任务,同一句「向前靠近水杯」的意图,对于不同构型的机器人而言是完全不同的底层物理控制指令:四足需要解算四肢步态与躯干平衡,人形涉及髋、膝、踝的多自由度协同控制,轮足则需调谐轮组速度与姿态。

如果每研发一种本体就从零构建一套运控算法,研发成本将呈指数级攀升。Vbot-EvoMorph 的破局思路在于:解耦共享策略与本体适配,即,将共享能力和身体差异拆开。



首先,实时多模态感知、本体状态、任务指令和形态信息进入统一的时序编码器,构建出通用的「环境 — 身体联合潜在状态」,并输出共享的动作 Token(Action Tokens),这些 Action Token 表达的是相对高层的抽象策略意图(如靠近目标、减速避障、抬升姿态)。

随后,这些高层 Token 被分发至不同的 Body Adapter(本体适配器):

因此,「跨本体」并不意味着不同形态强行共用一套底层控制参数,而是新本体能够完全继承通用的感知理解、推演模型与任务表征,再通过轻量化的本体适配层,演化出属于自己的身体表达。

这也就解释了为什么维他动力能在那么短的时间内就推出人形机器人 ATOM。据秦海龙透露,今年 3 月加入维他动力后,就开始着手负责 ATOM 的研发,而如今 ATOM 已正式推出,并进入产品化阶段,也就是说不到半年的时间就完成了这一系列工作。

从这个层面来看,ATOM 的推出并非从零平地起高楼,而是同源智能进入一副新人形躯体的高效验证。

真实终端,让这套「基因组」继续进化

当然,即便换了身体后,能够「继承」一部分的智能,但仅有算法分层并不足以完成「跨本体进化」,关键在于底层的运动控制如何在物理世界中收敛。

传统机器人强化学习(RL)多依赖从仿真到真实世界的 Sim—Real 路径,但仿真与现实之间永恒存在的物理鸿沟(Sim-to-Real Gap),常常让实验室里表现优异的算法在真机上一触即溃。

在秦海龙看来,既然 Gap 始终存在,那是不是可以前置,先从真实世界出发,做 Real-Sim?

于是,维他动力提出 Real-Sim-Real 的闭环:







发布中,维他动力展示了将北京办公室及周边日常采集环境重建为数字世界的结果。机器人可以在里面改变视角、起始位置,也可以直接切换本体,让四足、人形等不同机器人进入同一个场景资产进行规模化尝试。

更重要的是,维他动力还拥有纯算法研究机构难以具备的护城河 ——真实规模化量产交付的终端基础。

现场,维他动力正式明确了「一家聚焦生活空间的具身智能终端公司」的定位。而数据显示,截至目前,其四足终端「大头」已累计完成 126 万次大模型交互、23700 公里用户伴随里程与 13.15 万小时陪伴时长,两周用户留存率达 86%。在过去三个月中,产品完成了 4 次 OTA,累计新增 31 项功能、优化 66 项体验,模型能力提升超 30%。



这些数据不仅体现了产品的活跃度,更是「数据飞轮」全速运转的有力证明:真实生活中的用户长尾意图、复杂多变的地面与光照扰动、偶发的机械碰撞,构成了实验室无法凭空构造的珍贵真实世界数据分布。

也就是说,一台交付到用户手中的终端,既是持续提供服务的物理产品,更是捕捉物理世界真实缺陷的动态感知探针。

当产品进入用户以后,一条新的循环开始形成:

用户使用 — 产生真实交互和日志 — 暴露问题 — 开发验证 — 模型和产品迭代 —OTA— 再回到用户……

无疑,这套双闭环飞轮让维他动力的这套「具身基因组」在真实世界中获得了持续进化的「养料」。

到这里,如果我们重新审视 Vbot ATOM 的发布,就会发现,其行业坐标远不止于「维他动力多了一款人形硬件」。

当前,行业正逐步分化为两种组织范式:「具身智能实验室」 与 「具身智能终端公司」。前者主要在受控环境下探索模型能力的上限,回答「技术能不能做到」;而后者则必须直面真实物理世界的不确定性,回答「技术能否规模化量产、进入复杂生活空间并长期稳定服务」。

无疑,维他动力是后者。如果说四足机器人「大头」率先跑通了消费级具身终端从产品定义、供应链工程化、规模交付到真实世界 OTA 的商业与数据小闭环;那么 ATOM 的面世,则宣告维他动力开始将这套历经检验的产品化能力与工程飞轮,全面迁移到自由度更高、动力学更复杂的人形本体和更广阔的生活空间中。

过去几年,大模型的 Scaling Law 往往围绕数据、参数、算力和任务展开,而具身智能正在加入一个新的变量:身体。

当下,在具身智能探索迈向通用的进程中,如果每增加一种机器人本体,数据、模型、场景和学习过程都重新搭建一遍,整个行业便很难形成真正的规模效应。

而维他动力的「具身基因组」技术体系,提供了一种全新范式:让上一副身体在真实物理世界中碰撞出的经验,成为下一副身体演进的起点,或许具身智能才真正有机会形成可以不断累积的长期能力,走向通用。

当然,目前还处于初始阶段,但 ATOM 的出现,至少让这个问题第一次从一张技术架构图走到了一副新的身体上。