DoNews8月20日消息,2026世界机器人大会论坛于8月19日-22日在北京举办,京东集团技术委员会主席、京东云总裁曹鹏分享数据为基,构建具身智能超级供应链。
曹鹏演讲全文如下:
各位亲爱的嘉宾,各位朋友,大家好!
今天非常高兴能够来到WRC的会场,跟大家共同探讨一下具身智能产业未来发展的方向和趋势。
过去几年人工智能的领域在数字世界里取得了非常大的进展,方方面面都带来各个行业的革命,现在它从数字世界慢慢进入了物理的世界,能够去理解环境,理解操作物体,能够完成任务。下一步人工智能发展中制约它继续发展或者说最重要的生产要素是什么?我们认为就是数据。谁获得高质量真实场景规模化的数据,谁就能在下一步机器人具身发展过程中建立长期的竞争优势来。
因为我们可以看到过去一年可以说是人工智能发展规模化落地的元年,一方面看到很多人形机器人正在从实验室、原型机转向量产的交付。另一方面,在工业、物流、服务业方方面面场景里,大家都在开始尝试用机器人去承建一些具体的任务。
为什么这些机器人还没有爆发,我们现在可以说是爆发的前夜,为什么没有爆发起来?因为机器人、具身、模型对任务理解、泛化性相关能力有一些不足。在我们的实验场景里,在京东的物流里面,其实在某些特定的标准任务里,机器人已经可以做到跟人持平,不管是从效率上面还是在成本上面都已经非常接近于人工,但没有办法去规模化向更多、更复杂的场景里去复制,因为模型泛化性不好。模型泛化性不好因为没有足够的数据去做模型的训练,机器人还是在具体场景里做没有办法规模化的去复制。
行业里面对于能够做到规模化复制很好泛化性的机器人大脑,大家公认如果要训出这样的模型,所需要的数据量是千万小时级别的,但现在行业里真正能够给这些模型训练所提供的数据,其实只有十万小时这个量级,这里面有一个巨大的数据量的开放,更别说这中间会有因为本体采集的数据,对于跨本体泛化性和适应性的问题。未来如果机器人发展,制约它的是大脑泛化性是不是好,但制约大脑是不是能够足够聪明,其实是说我们有没有足够的数据能够喂给它,这是今天非常核心的观点。
机器人的数据也分各种层级的,越上面它的精度越好、效果越好、对于本体的适应性越好,可能泛化性会更差、采集成本更高;越到下面,它的规模会更大,节约成本更低,我们在全链条上面都会去做全方位的采集和支持。
为什么我们要来干这件事?因为京东有一个特别的优势,就是京东的超级供应链,京东是一个非常复合的集团,里面包括零售、健康、物流、家政、工业这样的场景,这些场景里面会有特别多真实物理世界相关的操作数据,这不是一个实验室或者数采工厂模拟数据,而是真实商业化系统里长期运行的、持续演化的,我们这些场景都是真实的任务链路、真实的人机和事务的关系。
比如像京东mall、七鲜、养车这些门店,全国4000多个仓库网络对零售的药房、家政,这些里都决定一方面可以做数据规模化的采集,能够在真实业务场景里去做持续的数据生产。第二是数据泛化性能够更好,能够覆盖不同区域、人群、物体和人物。第三多种模态都可以做,不仅包括视频、音频、人的操作轨迹、姿态、动作信息这些东西都能够采集。我们一定要为具身发展作出一份自己的贡献,下一阶段我们要做全球最大的数据采集的任务,我们的目标是在两年以内要采集超过1000万小时人类真实场景的数据,同时采集超过100万小时机器人本体的数据。这项行动计划包括了京东内部各类的员工、外部行业的从业人员、城市中的市民方方面面的人员,我们会发动超过10万人参与这项计划。
所有数据采集一定是基于合法合规,能够保证数据安全可靠的模式下去进行的,我们希望通过这项计划给具身智能行业提供可持续的数据基础设施。
接下来可以看一下视频,直观感受一下我们在宿迁做真实场景里的数据采集。
刚才视频演示了现场采集的场景,采集所需要的设备也在不断的开发和升级,除了头戴式第一视角的设备,还包括戴压力传感的手套,包括手环等等,我们下一步的计划是把整个数据采集从视觉进一步走向全身全模态,覆盖视觉、手部姿态、力触觉和身体关键点等多维信息,能够完整记录人在真实世界里的操作过程。
数据采集是第一步,真正难的是把数据采集变成对模型有用高质量的数据资产。我们覆盖采集、存储、标注训练、评测、仿真等方方面面全方位的数据体系,这套体系能够让数据从原始视频变成可以推动具身进一步发展的数据资产和燃料。
这段视频是我们如何把原始采集视频数据变成被模型所使用的资产。大家可以看到,数据从最开始的一段视频经过任务描述、手物识别、手部动作分析、深度建模重建方方面面的工作,出来以后数据不再是单纯的视频,变成能够被模型训练所直接使用高质量的数据资产。这些数据经过一系列数据生产流水线后就能够被具身模型公司所使用。
有了这些数据以后还有一个非常的关键技术是仿真,仿真技术可以帮助我们一方面去进一步放大数据的体量,另一方面能够帮助我们高效的做效果的评估和评测。我们自己的仿真评测体系跟真实环境中评测一致性可以做到90%以上,评测效率能够比真机评测高3—4倍,这样可以让模型使用过程中部署成本和模型训练成本都可以极大降低。
整个生态自己做还是远远不够的,我们有自己能够覆盖全行业具身数据交易平台,能够推动行业里的具身数据、模型公司都能在上面去交易它的数据,这里面会集成十万项子任务颗粒,能够满足不同行业、不同企业模型在上面做它的数据交易,满足他们训练的要求。
有了这个数据以后,我们就要帮助行业、帮助客户把这些数据变成有价值的模型,JoyBuilder面向数据加工、标注、质量控制等环节提供体系化能力。可以支持数十万条数据导入,自动标注准确率能到达95%,整体处理成本能降低60%,它让客户能够不必从零开始建立全套从采集、标注、数据处理的团队,可以一站式的拿到好的服务。像客户、具身公司介入整个体系里,研发团队配置,研发周期不变情况下对事务成功率有非常明显的提升,数据训练和成本有非常大幅度的下降。
数据有效性最后要通过结果来验证,我们自己也会做很多功能性的验证。比如JoyAI—RA具身模型,测试结果来看,所有第一人称视觉数据,这些东西对模型有效性提升是非常大的,从1000小时到5000小时到10000小时,每提升一档它在任务和未知任务泛化场景取得的成绩都是非常明显的提升,而且已经超过了开源里像π0.5行业标志性的模型,整个模型的数据对于模型有效性的质量得到了验证,下一步我们会投入更大的数据量进去,看看它后续的效果。
当然了,只有人类的数据、只有模型还不够,模型怎么样最后跟本体去适配,能够跟本体操作去对齐,这里还有非常大的门槛。我们自研了一套人机对齐的算法,能够提供预训练、后训练到微调阶段进行模型服务。可以把人类采集人类手部的动作跟各种不同的灵巧手、夹爪和机器人本体数据对齐,可以让人类数据被机器人学习和使用。
未来人工智能的操作不是单纯手部的操作,会覆盖全身,我们也在大力采集覆盖全身的动作轨迹数据、力反馈的数据,能够采集全身的动作特征,推动人的动作向不同的具身本体做精准的迁移,从手部到上面到全身,我们都在持续的推进和演进。
总体来讲,我们面向行业会提供一整套从数据、采集、标注、训练到模型、算力一体化全栈性的服务,能够帮助行业、合作伙伴、客户快速提升模型的能力,进而推动具身行业的发展。
最后,我想用一句话总结一下今天的分享,我们相信具身行业一定将重构这个物理世界,而京东的供应链将是重构过程中的第一站和最后一站,未来我们的机器人一定会进入到家庭、仓库、门店、工厂、医院方方面面的城市服务当中,当AI真正理解物理世界、进入物理世界,并且在物理世界中能够持续学习和进化的时候,一个全新智能化的时代必将到来。谢谢大家!



