8月20日,王兴兴现身2026世界机器人大会主论坛。他身着白衬衫、步履轻盈走上台,发表了主题为《从展品到产品:人形机器人产业的下一个十年》的演讲。
以下为演讲全文:
从展品到产品:人形机器人产业的下一个十年
我们公司成立于2016年8月,到现在刚好差不多十年的时间。公司最早是做四足机器人,最近几年开始做人形机器人。
我们这几年推出了一款非常成功的机器人——东方机器人。这款产品推出后,基本上成为了全球标杆性的产品。目前大家看到的、或者全球广泛在用的绝大部分机器人产品,外观和设计基本上都与它非常相似。
今年年初非常有代表性的《武BOT》节目,融合了中国非常经典的传统功夫文化。我们提前采集了几十个非常经典的中国功夫动作,进行 AI 训练,最终将这些精彩动作展现到了舞台上。这个节目最大的亮点,就是将中国传统功夫文化与当前全世界最顶尖的人形机器人技术结合在了一起。
这件事在海外的传播效果非常好,大概有几百亿次的播放量,深受大家喜爱。我认为这是一个非常好的科技与文化交流的范例。
同样是今年2月份,我们也曾在天坛做过一次简单的演示,当时现场大概有49台人形机器人同时进行表演,场面非常震撼。天坛拥有几百年的历史文化,当机器人出现在现场时,有一种非常强烈的穿越感,将中国几百年的传统文化与当前最新的前沿技术融合在一起。
过去几年,我们公司一直致力于推动机器人真正走进生活、走进工厂干活。比如在2024年,我们就与汽车工厂合作,推进汽车生产线上的落地应用;此外,我们也在自己的工厂部署了机器人,进行一些简单测试和落地应用。目前,我们公司绝大部分 AI 团队都在为此努力,推进机器人真正进入家庭和工厂中使用。
这部分事情我们现在没有大规模推广,最主要的原因是目前的效率和泛用性能力还不够高。简单来说,虽然目前我们的机器人能做一些简单装配,但效率仍比人工更低;另外,每次有新任务时都需要重新调整,效率相对更低。我们希望把技术做得更加泛化、能力更好后再进行大规模推广,这是目前全球大家共同面临的最大问题。
今年4月份,宇树科技刷新了当时人形机器人的最快奔跑纪录,超越了2016年的奔跑速度。做这些展示的是我们的第一代人形机器人,当年这款售价100万元的人形机器人,也是我国的第一款,非常经典,同时也是我们后续研发的基础。
这部分都是由 AI 驱动的。目前来看,基本上是有多少数据、有多少高质量数据,就有多少 AI 能力。我们也在自己采集,或者与第三方公司合作采集数据,既提供给外部使用,也供我们自己使用,数据驱动在其中是非常重要的一环。
目前我个人感觉,真正的 AI 主要以海量的金融数据或互联网数据作为基础必须数据,再加上部分真机采集的数据,这是我认为的两个核心数据来源。从数据量的角度来看,真人数据会更多、更重要;而真人的实际数据也同样关键,因为我们需要将机器人真正与物理世界进行匹配。
今年5月份,我们发布了一款非常经典且有意思的机器人,它的身高大概有3米高,如果从窄处来看,重量大概在500公斤左右。某种意义上,大家可能会好奇这款产品的实际应用场景。
做一个简单的比喻,它其实有点像越野车,并不是设计给家庭或在城市日常使用的。很多情况下,比如去户外徒步,或者在一些非常复杂的环境下进行运输,都可以使用它。
另外比较有趣的一点是,它可以进行变形,变形后稳定性会更好一些。这也是为什么我们要把它拿出来真正作为预售机器人来做,因为在四条腿的模式下,它的稳定性相对更好,运输能力也非常好,简单来说就是一款类似于“越野车”的产品。
大家知道,很多常规的动作演示,都是提前做好训练的。而这部分的动作则是基于实时语音生成的。正因为是基于实时语音生成,所以中间会有一点延迟:每句话说完后,需要先进行语音识别,识别后上传到云端进行AI 动作生成;动作生成后再进行动作验证,验证没有问题后才下发给机器人。因此,这个过程需要几秒钟的延迟。
我们希望未来机器人真正应用落地时,动作都是完全自动生成的,而不是提前进行编程。因为中间存在语音处理的过程,所以会带来延迟。
这种自动生成的方式有一个缺点(或局限):因为它每次都是自动生成的,所以动作会存在一定的差异性。也就是说,即使是同一句话,它今天和明天做出来的动作可能还是会有略微差异。
不过,我们也正在推动机器人真正走进会议室等场景去干活。
我认为这也是一件非常重要的事情。比如我们公司的会议室有时会乱糟糟的,在会议室进行整理,其实也是非常重要的一件事。每个公司都有很多会议室,如果比较杂乱处理起来就会很麻烦。而在这里,任意一个杂乱的会议室,我们都可以让机器人将其恢复到干净整洁的状态。
这个过程完全是端到端实现的,虽然目前它的运动效率相对还有提升空间。它是多任务的,我们在场景中大概布置了7~8 个不同的任务,使用同一个模型让它自动切换,不同任务都能直接执行,特别是还具备抗干扰能力。
正因为是AI 实时生成和实时执行,动作丝滑度可能会稍微差一点,因为它每走一步,动作都需要重新进行推理。另外说明一下,我们这个视频本身是一倍速的原速播放,没有经过任何加精或加速处理。
因为时间关系,这部分就不多放了。大家如果有什么问题,后续可以交流。
我们希望像会议室整理这种场景,相对来说具备比较高的实用价值,且难度不是特别大。
另外,刚才演示的自动生成动作只是单纯的动作展示,不带交互或实际干活的能力;而现在展示的,则是搭载了多模态大模型后,在动作驱动的同时具备了实际干活的能力。
它们表现得非常自然,比如基本上可以完成装水等操作。它也比较轻量化,在日常生活中使用会非常方便。非常希望将整个技术落地应用到实际场景中,比如融入家庭生活或进行跨场景的传承。
2025 年,我本人、我们公司的产品以及我们公司,都登上了《时代》周刊的榜单。
另外,回顾一下最近几年整个具身智能AI 模型的发展,最主要的流派目前是VLA(视觉-语言-动作)模型和世界模型。当然,今年大家听到最多的可能是世界模型这个方向。
我们公司在AI 模型上的投入一直非常大,这也是我们目前资金和人力投入最大的方向。早在2024 年初,我们就开始研发基于视频生成的世界模型方向,但当时在2024 年底做出来的效果不够理想,中间稍微搁置了一段时间;直到去年,我们又开始大力发展基于视频生成的世界模型方向。
破解具身智能“ChatGPT时刻”:如何跨越物理世界的最后1毫米?
大家可能很多人都会问到:真正的通用机器人,无论是人形还是半人形,到底什么时候能真正走进生活、走进家庭?
目前全世界面临的最大问题和最大瓶颈,就是泛化能力还不够。简单来说,目前的很多AI 模型在固定场景和特定任务下,成功率基本上可以做到接近100%;但如果操作的物品或所处的环境稍微发生变化,它的成功率就会发生非常严重的下降。
我希望未来快的话可能两到三年,或者三到五年,如果哪一天大家看到把一台机器人带到任意的陌生工作环境中,它基本上可以自主完成80% 左右的任务,我认为那就差不多到了具身智能的“ChatGPT 时刻”,而这也就是未来整个产业真正的爆发点。
评价指标其实也没有那么简单。正如刚才提到的,当一台机器人在一个全新的陌生场景中,仅通过语音或语言指令就能完成80% 左右的任务时,我认为这就是一个非常重要的临界点。
为什么要达到这个临界点?要实现这一点,目前最大的瓶颈在于:现在的AI 模型思路与输出跟机器人的物理控制对齐程度还不够。
以目前的机器人模型为例,如果你吩咐它去将某些东西归类分拣在一起,它理解的整体趋势是没有问题的,当场也能够拆解并执行任务。但问题在于,到了最后几厘米甚至最后几毫米的微操阶段,它的偏差会变大,导致最终的成功率下降。
它没办法很好地跟真实世界匹配。当机器人去拿这个东西时,看起来已经快要拿住了,但由于最后一点点触觉反馈或误差没办法很好地修正,最终误差不断累积,导致它的成功率暴跌,东西就掉了下来。
这是目前全世界具身智能面临的最大问题——AI 模型的输入和输出与真实物理世界存在偏差。为什么机器人上会有这个问题,而一般的语言模型却没有?因为语言模型的输入输出完全是数字编码的,无论是输入还是输出一个文字,都严格限制在固定的向量空间里,基本上不会有大的偏差。简单来说,它是没有损耗的,数据输入输出再倒回去没有任何损失。
但对于机器人来说,它的每一次输入和输出都存在偏差和损耗,这就是导致目前机器人泛化能力和成功率相对偏差的核心原因。不过我认为,在未来几年内这必然是一个可以解决的问题,只是需要一些时间。
另外,我在这里介绍一下我们昨天刚刚提到的,在过去几年里,大家已经在使用AI 进行许多编程和软件开发工作,但对于AI 在硬件和机械开发上的真正应用,则是我们公司最近一段时间一直在推动的事情——即直接让AI 大模型来驱动物理世界的机器人计算与进化。
简单来说,就是使用目前最前沿、顶尖的AI 大模型,由我们来设定一些规则、经验约束以及工具接口。随后,让AI 自己去网上搜索最新的学术论文、最优质的研究成果以及各种开源方案,自主编写并生成机器人的控制代码。
控制代码生成后,它可以先在仿真环境中运行调试,也可以调用大模型状态,直接去操控一台实体的物理机器人。
生成控制代码后,我们会在实物机器人上进行部署测试,并对此进行评价和打分。其中,一部分评价打分由机器的AI模型自主完成;另一部分则可以由人工参与评价打分,因为人类的经验非常重要,能够非常直观且容易地判断出结果的好坏。
这套逻辑体系一旦成功运行起来,整个机器人的开发效率就会大幅提升,迭代速度也会非常快。流程一旦稳定运行一段时间,就能真正实现机器人自我进化能力的提升。
这里有一个简单的示例展示其运作方式:左下角就是代码编写界面,它能够自主生成机器人的控制代码(包含许多复杂的代码),感兴趣的朋友可以尝试一下。
目前的许多简单强化学习算法以及自动编程项目,其实在代码生成方面表现得已经相当不错。
我们把生成的编程效果放到仿真环境中进行验证与训练;训练完成后,再部署到实物机器人上进行测试;测试后由AI模型以及人工进行效果评估与检查,最后将结果反馈给编程智能体,从而形成正向闭环。
这里展示的是一个最基础的简单示例,实际应用时会比这复杂得多。我认为这是当下及未来几年全球最值得探索和投入的方向之一,感兴趣的朋友可以关注一下。
为什么要这么做?主要有几个简单的原因:
第一点,随着基础模型的能力在每月、每年持续提升,这种自我进化的闭环能力也会随之进一步增强。因此它是一个非常良性的循环,某种意义上能够直接跟随全球AI 技术的进步而共同进化。
另外,这种方式可以更高效地利用多元数据。大家都知道,人工处理数据的效率非常低;而采用自循环体系,我们可以把训练数据、真实世界数据以及人类数据等各种数据充分利用起来,从而提升整体的使用效率,并支持更大量的真机部署。
随着真机部署数量越来越多,我们将积累更多的测试数据以及更丰富的评价指标。这样一来,整个数据的利用率和增长速度就能得到保障,从而实现数据的规模化。同时,我们也可以按天或按月不断累积和沉淀技能,而不是今天开发完一个技能、明天就把这个技能浪费掉,我认为这是非常关键的一点。
真正利用AI 来大幅提升机器人的开发效率与进化速度,是未来非常值得探索的方向。这也将开启物理世界AI 对话的新时代,相信未来会有越来越多的人共同推动这个方向的发展。
Physical AI开启人机共生的下一个黄金十年
回顾过去这近十年的时间,我们公司最早在2017、2018 年就一直在参加世界机器人大会,一路走来感受非常深刻。
我认为未来十年将是一个全新的起点和开始。尤其是在当下AI 大爆发、全球关注度极高的时间节点上,整个机器人的进化速度已经大幅提升,未来的发展速度甚至会比预估的还要更快。



