对话赵捷:未来5年AI数据需求将爆发式增长,缺的是“好数据”
(来源:观察者网)
数据越来越多,为什么AI仍然缺“好数据”?从智能驾驶识别雨天水花,到机器人学会铲猫砂,看似简单的任务背后,是复杂的数据采集、标注与校验。在特定训练任务中,采集工作进行8小时,可能只能产出1小时有效数据;一次失败后人工介入纠正所产生的数据,甚至可能比100次成功更有价值。
本期《思路打开》对话博登智能创始人兼CEO赵捷,深度探讨高质量数据如何生产、为何值得买单,以及中国企业在数据服务领域的竞争力等问题。在赵捷看来,未来5年,AI数据需求将爆发式增长,高质量数据集将成为竞争关键。
【对话/赵捷&王慧】
以下为对话实录:
王慧:赵总您好,欢迎您做客《思路打开》节目。
赵捷:你好,大家好,我是博登智能的赵捷。
王慧:今天想围绕您所从事的数据服务行业,跟您聊一聊这个行业在具身智能、人工智能发展过程中扮演的角色是什么。
对于“数据标注”这个词,可能很多人还不是特别熟悉。能否举个例子,比如说,一段视频从原始素材到客户可以用于训练的数据,这中间经过了怎样的处理?增加了哪些信息呢?
赵捷:以水瓶识别为例,我们首先会采集大量包含水瓶的实景照片,再根据算法训练的具体需求,通过拉框、勾勒边缘等标注方式,将其转化为机器能够识别、读懂的语言,用于模型训练。当模型通过成千上万个经过标注的水瓶样本进行学习后,就具备了识别水瓶的能力。
这是最基础的标注案例,在自动驾驶、人形机器人等复杂场景中,数据标注的需求会更复杂,但万变不离其宗,我们会对原始视频、数据进行拉框等形式的标注,转化为机器人和AI可识别的语言,这就是数据标注的本质。
王慧:像水瓶这类人一眼就能认出来的东西,为什么要专门标出来,给AI学习?
赵捷:人类的识别能力也是后天学习得来的。比如说,孩子在成长过程中,家长会教他怎么区分碗筷、怎么使用餐具等等。
对于机器中的模型来说,也是一样的,需要我们以“教学”的方式,把人类所掌握的知识告诉它,只不过当下模型的范式还是基于数据驱动的。
王慧:现在很多模型已经能看图、理解视频,在这种情况下,数据标注的作用发生了什么变化?
赵捷:人类的视觉、嗅觉、触觉等对应着不同的感官模态,而数据本身也是多模态的。目前大语言模型的训练数据,主要来源于互联网上已经存在的文字、图片和视频等语料。像GPT-6、Kimi k3等一系列模型都是这样训出来的。
但这些数据还远远不够,我们现在非常缺乏物理世界中的交互数据,因为想要训练一个泛化能力很强的物理AI基础模型,需要视觉、触觉等多模态数据。
王慧:所以我们需要不断地给这些数据做标注。您在德国学习、工作近20年,做过智能驾驶算法,也研究过双足人形机器人。2019年回国创业时,为什么选择从数据处理切入?有没有一段具体的研发经历,让您看到了这个机会?
赵捷:早些年我们做双足机器人研发时,受到过各种硬件和软件的限制。比如说,当时训练模型是没有GPU的,我们的算法都是写在CPU上面。我训练一次算法需要两天左右,一般来说都是周五下班前把算法写好,周一上班的时候去“收果实”,看一下训练效果。
后来我在工作中接触到智能驾驶,以及智能驾驶中的数据标注。当时国内以百度为首的一些专门研发智能驾驶的公司也在兴起,我认为这是个非常好的机会,大有可为,所以毅然选择回国创业。
王慧:提到数据标注,有些人可能会觉得这是传统的劳动密集型产业。您曾经有没有收到过类似的质疑,比如说“这不就是找人画框、贴标签”吗?
赵捷:我们行业中有一句话,“人工智能,有多少智能,背后就有多少人工”。这是一个客观事实,你要训练一个模型,就必须要做数据标注,要做数据标注,就需要海量的人工。标注人员受情绪、状态等因素影响,工作质量存在波动,而算法更加稳定,标注精度不会有太大变化。
所以,博登智能希望用AI算法的方式做数据标注这件事,在降低人工参与的同时,尽量提升人工的工作效率和准确度。我们始终践行“AI for AI”的企业理念,这也是我们跟传统的数据标注公司最大的区别。
王慧:有没有哪个项目让您感觉,数据标注这件事其实并没有大家想象的那么简单,它还是很有难度的?
赵捷:我们早期做自动驾驶数据标注时遇到过这样的情况:雨天行车时,前车车轮溅起的水花,会对激光雷达的目标检测造成干扰。为解决这个问题,我们投入了很多人力,标注了海量的场景数据,最终让算法识别出这是水花,而不是前车车身。
类似的案例还有很多。看似简单的标注工作,落地到真实工程场景中,其实会遇到大量实际的问题。
王慧:所以你们是从自动驾驶的数据标注开始的,后面慢慢地延伸到了哪些领域呢?
赵捷:2022年12月ChatGPT问世,2023年开始大语言模型爆发,2024年下半年开始,具身智能赛道迎来爆发,我们的业务随着行业的爆发也在慢慢地做一些迁移和拓展。
王慧:所以,目前博登智能的主要业务是在自动驾驶、大语言模型、具身智能三部分,这几块儿业务的占比情况是怎样的?
赵捷:2025年之前,智能驾驶业务占比最高,后来大语言模型业务占比得到一些提升,截至今年,具身智能业务占比已接近50%,是最高的,明年占比可能还会进一步提升。
近两年具身智能快速发展,我们各种各样的客户对于具身智能数据的需求量呈爆发式增长。
王慧:从您创业到现在,博登的客户结构、客户购买的服务,有没有发生什么变化?
赵捷:还是有一些变化的。我们最初是做自动驾驶数据标注,服务的主要是汽车主机厂,还有一些一级供应商,后来我们的客户拓展至行业第一、第二梯队的大模型企业。现在,我们服务比较多的是具身智能相关的机器人本体厂和专门做大脑模型的公司。
服务内容也发生了一些变化,以前定制化的需求比较多,现在在具身智能方面,我们自己做的成品数据集比较多。我们会大量调研市场主流需求,提前批量采集、处理各类场景数据,放到成品数据集集市上,供客户直接选用,目前标准化成品数据集的市场销量非常可观。
王慧:现在增长最快的部分是具身智能业务。增长更多是来自老客户复购,还是新客户、新业务?
赵捷:都有。一方面,老客户的模型迭代会持续产生新的数据需求,比如互联网大厂研发VLA模型,第一代模型和第二代模型所需的场景数据不同,它们的复购率就会比较高;另一方面,一些做世界模型的公司,它们的数据需求会有一些新变化。我们会根据我们自己采购的机器人本体,根据我们已有的场景,提前布局。
王慧:现在客户最愿意为什么样的数据付费?
赵捷:高质量数据集。我们以机器人本体数据采集为例,一个人一天工作8小时,最终能产出我们认为达到高质量要求的数据,只有3小时左右。
什么是高质量数据?举个例子,让机器人去拿一个水瓶,它可以正着拿、反着拿、竖着拿,可以通过不同方式把这个瓶子拿起来,这里面的主要区别是动作轨迹。通过不同的动作轨迹可以完成同一件事情,但是最节能、最高效的肯定只有一条轨迹。
在这种情况下,我们会通过自动化质检脚本,对不同数据进行质检,筛选出轨迹最优、完成度最高、流畅度最好的数据。
王慧:为什么今天的数据已经这么多,高质量数据仍然稀缺?假设两批数据时长相同,什么会让其中一批更有价值?
赵捷:举个简单例子,如果我们的客户是一家做基础模型的公司,那它肯定希望它的基模的能力和泛化能力是很强的。因此,他们采购一批数据,一定希望能够尽可能多地覆盖不同的场景,比如包括家居、商超、工业、教育、康养、医疗等等。同样10万小时的数据,如果一批覆盖了1000个场景,另一批只有100个场景,那它们训练出来的模型能力是不可同日而语的。
在这些场景下,还要有长短程任务的结合,像让机器人拿个水杯就是短程任务,如果我告诉机器人,到我卧室的床头柜里拿个东西递给我,就是个长程任务。
因此,在做数据分布的时候,一定要考虑到不同的场景,任务流的设置,长短程的结合,以及任务的完成度、丝滑度等等。
王慧:客户拿到数据、完成训练后,怎样确认机器人到了新的场景里仍然能把任务做好?
赵捷:我们在搭建数据采集场景、规划数据内容前,会和客户深度沟通,锁定客户所需的场景类型、数据时长、核心任务、交互物件,细化到每一条任务的分配,匹配不同机型的数据需求。我们会把需求细化到颗粒度很细的任务流上去。只有做到这样,你的数据才能真正符合客户的需求,才是真正有市场化需求的。
王慧:即便前期进行深度沟通,场景规划足够精细,目前机器人普遍存在泛化能力弱的问题,它在A场景学会的,到B场景就不会了,这个问题怎么解决?
赵捷:这并非单纯的数据问题,核心是算法范式的局限性。当前所有AI算法均基于数据驱动,在算法范式实现革命性突破之前,只能依赖数据提升模型的泛化能力。虽然现在也出现了一些涌现能力,但仅局限于部分细分场景或细分行业。
如果想让机器人在不同场景下干更多的活儿,可以参考智能电动车的方案,比如说,车上的摄像头是固定的,算力也是固定的,但是算法能力可以通过OTA的方式不断升级。
这也是将来机器人发展的一个方向。虽然机器人有一定的模型能力、泛化能力存在边界,但到了一个新场景之后,它可以不停地采集新数据,通过新采集的数据迭代其模型能力。
人们对机器人的期望值是非常高的,这是好事,但技术的进步需要时间稳步推进。
王慧:有没有通过数据调整,显著提升模型能力的例子?
赵捷:当然。我们正在做基于不同真机的强化学习的训练集,还是以拿水瓶为例,机器人完成100次拿水瓶任务,可能会因光照等原因出现1次失败。这时候我们会人工介入,告诉它刚刚的轨迹有偏离,并让它回到正确的轨迹下拿瓶子。
这样的数据会非常有价值。一条机器人工作中失败的场景数据,可能比100条成功数据更有效。但这一定是建立在你有很强的模型能力的情况下,才能去做这件事情。
王慧:现在你们自建训练场地、部署机器人,自己生产数据?
赵捷:对,我们是真机加上无本体的设备,同时在做数据生产。
我们在马鞍山投产近300台机器人本体,覆盖十几种不同的品牌,每天的产能接近2000小时。同时,我们还有无本体数据采集,现在有近1000台采集设备,下个月会新增1000台,总量接近2000台,包括头环、肌电手环、力触觉手套等。
博登智能马鞍山具身机器人创新中心
王慧:相比于处理客户提供的素材,自主规模化采集数据需要解决哪些新问题?
赵捷:其实挺多的。首先在技术上,像无本体的数据采集,尤其是头环这一块,它对于精度要求非常高,我们不仅要做手部重建,甚至要做全身重建,这就对我们在硬件设计上有新的要求。
传统双目、四目摄像头可能已经无法满足需求,需要在头部布置六目、八目摄像头,进行数据采集。同时,手部重建还跟力有关联,需要依托有力反馈的传感器或手套等硬件接收反馈。总之,只有通过设置更多的传感器,才能获取更精准的信号。
在场景方面,我们希望尽可能丰富采集场景,因此会把真机放到不同的商超、酒店等地方做采集。一个场景采集100至1000小时基本上就足够了,所以我们会不停寻找新的场景。
王慧:您刚刚提到了手部重建,我看到博登智能自研的手部重建算法ChronoHand登顶ARCTIC榜单。一家主要面向机器人提供真实世界数据的公司,为什么还要投入资源研发手部重建算法?
赵捷:手部重建是无本体采集之后数据标注中的一环,尤其是手部21个关键点的打标以及它在3D重建后空间中的位姿。你可以通过人工去做这个事,但是效率会非常低。我们希望尽可能自动化,所以我们自研手部重建算法,当然我们肯定不是从0到1,而是站在巨人的肩膀上做这件事。
目前我们的手部重建算法,9项关键指标中有7项位列全球第一,同时我们也开源了我们的源代码,欢迎学界、业界的朋友基于我们的技术与数据,开展更深层次的研究。
王慧:现在你们的场地和设备支持怎样的交付?
赵捷:我们现在有3万平方米的专业采集场地,基本覆盖了市面常见的所有场景。
王慧:你们部署了不同型号的机器人,本体有多少种类型呢?
赵捷:接近20种。
王慧:为什么需要这么多不同类型的机器人?
赵捷:原因有两点:第一,我们相对来说是一个比较公正的第三方;第二,模型的跨本体能力是衡量泛化能力的一项比较重要的指标,因此我们希望模型能在不同本体上验证其能力。
王慧:面对不同场景,不同型号的机器人,哪一类客户需求最难按要求完成?
赵捷:最难的是必须要深入真实的场景持续获取相关数据,比如生产制造环节。这可能涉及客户生产线中一些非常隐私的能力和Know-how。
王慧:能不能选一个有代表性的任务算一笔账:交付一小时最终验收通过的训练数据,需要投入多少设备、人工和采集时间?
赵捷:我们以一个价值比较高的数据举例,现在有个场景是机器人铲猫砂。它铲猫砂时会有失败的时候,这时候就要人工介入,告诉它这不是猫砂,那才是猫砂,铲完之后应该放到哪个地方。
我们测试过,一台真机,从打通基于这台真机的强化学习工具链开始,就要投入不少人力。之后,在采集过程中,我们的研发人员和采集人员要一起告诉它,哪些是真机可以完成的,哪些是真机目前完成不了的,人工何时必须要介入。
我们测下来,工作8个小时,只有一个小时左右有效数据,非常难采集。
王慧:原始数据是8小时,但交付的数据可能就1小时。中间差的那些,为什么不能用呢?
赵捷:因为它会成功。成功的数据我们现在不需要了,就需要失败的数据。失败之后还要介入,介入的时间点也非常重要,晚了不行,早了也不行,所以这里面有很多工程化细节。
王慧:生产数据这项工作,还是一个比较重投入、重资产的一项工作了。
赵捷:但是回报也非常高,这就是我们讲的,具身智能数据金字塔中最顶端、最高价值的数据。
王慧:随着仿真、合成数据和世界模型的发展,未来机器人是否会越来越少地依赖真实采集?
赵捷:仿真、合成数据是非常重要的,因为我们在真实场景中有些难以采集到的数据,比如我要在上海延安高架上采集到下雪这个场景,但上海的一年能下几次雪呢?这时候可能就需要仿真、合成数据。再比如说,我现在需要采集车祸场景,但日常生活中我们很少会碰到车祸,这时候就需要仿真、合成数据。
但是,模型从0到1,大部分能力一定要基于真实场景数据,这是行业共识。按照马斯克的“第一性原理”:我也问问大家,您开的车是在真实场景下开的,还是在元宇宙当中开的?您家的机器人,比如扫地机器人,是在真实场景下,还是在仿真场景下的?
目前在数据金字塔中,真机数据占比大概是15%-20%,第一人称视角的真人数据在50%左右,剩下的是仿真、合成数据。
王慧:在什么场景会用到什么数据?这些不同类型的数据适合机器人去学习什么?
赵捷:它不是按场景来分的,是按照我们模型的训练阶段来分的。模型训练分为三个阶段:预训练、中间训练、后训练。海量的仿真、合成和第一人称视角数据会用于预训练阶段。
王慧:它们之间有哪些不可替代的地方?比如说什么东西你必须要用到真实的数据?有哪些可以在这种虚拟场景中完成?
赵捷:这是不同的算法路线的路径,并不是说一定需要它,或者一定不需要它。
目前行业存在两大技术路线,一类是像美国“Physical Intelligence”和一些国内公司那样的“真机派”,他们只用真机数据进行训练;另一类是“仿真数据派”,他们的预训练主要以仿真数据为主。
王慧:博登现在强调“Physical AI数据基础设施”这个定位。什么叫Physical AI?能不能结合你们和客户的合作,讲讲这个定位会带来哪些不同?
赵捷:Physical AI,顾名思义就是物理人工智能。它和大语言模型最大的不同是,大语言模型不需要跟真实世界做交互。而具身智能、智能驾驶的终端设备,会与物理世界进行交互,这就是物理AI的一个基础定义。
基础设施是比较宽泛的一个概念,我们主要专注在数据层面,比如说,我们能打通所有本体的数据采集,有非常强的数据管线能力。我们依托自研BRIC数据采集平台、BASE数据标注平台及Blink数据基础设施平台,将采集到的本体数据上云后,进行自动化的清洗、标注。形成成品数据集后,我们建成了自己的数据集市,客户可以根据场景、时长、机器人本体型号、不同种类的传感器等,挑选他们想要的数据集。
这一系列的平台和软件构成了数据基础设施。
王慧:你们提出过一个理念,您刚刚也提到过,是“AI for AI”,用AI做预标注,再由人校验。在实际项目里,哪些工作已经可以稳定地交给算法,哪些仍然需要人的判断?
赵捷:目前所有流程里能够接入AI的,我们都已经接入了,包括目标检测、手部重建、原子动作的时间戳对齐等。但仍需要机器人数据专家进行最终的校验和质检,保证高质量数据交付。
王慧:如果模型持续犯同一类错误,人怎样发现?是凭经验吗?
赵捷:需要经验,也需要对机器人本体的了解。如果它一直犯错,我们就会将人工调整过的数据作为新的训练语料,再喂给模型,经过一定时间的迭代后,问题会慢慢被解决掉。
博登智能马鞍山具身机器人创新中心
王慧:如果竞争对手也买机器人、建训练场、招募采集和标注团队,客户为什么还会继续选择博登?能否讲一项后来者最难在短期内复制的能力?
赵捷:首先,我们在行业中已经形成了我们自己的品牌效应,其次,我们持续不断地迭代我们自己的AI能力。数据采集只是起点,是整个数据管线中的一环,高质量数据集的生产才是真正的竞争重点。
我们构建的是三层能力生态体系:第一层是真实世界场景网络,也就是刚才说的三大训练基地和不同场景的布局;第二层是全自动化数据引擎,依托BRIC、BASE、Blink三大自研平台,实现采集、清洗、标注、交付的全流程自动化;第三层是现实世界验证体系,模型训练完成后需要在真实环境中部署测试,验证它到底能不能干活、干得稳不稳。这三层是环环相扣的,不是短时间内可以轻易复制出来的。
同时,我们也在持续投入自研算法、发表行业论文、申请技术专利,不断打磨数据生产管线,提高高质量数据集的产出能力。
王慧:现在不少大厂和机器人企业都在建设自己的数据团队。它们通常把哪些工作留在内部,哪些会交给博登?
赵捷:一般来说,企业如果有算法团队,肯定会为算法团队配置数据团队,这个数据团队主要是为算法团队从0到1的研发需求做准备。
一旦到量产级别,需要海量数据去训练最终需要的模型时,一般企业都会依赖第三方。两者的服务阶段不一样,一个是偏预研发,一个偏研发落地。
王慧:当你们同时服务存在竞争关系的客户时,哪些经验可以沉淀为通用能力,哪些数据和成果必须严格隔离?
赵捷:首先,具身智能领域中的算法,是没有秘密的。一旦一个新的算法出来之后,短则一个月,慢则一个季度,你的同行都会进行这方面的研发。
其次,针对我们的客户,博登既有定制化采集服务,也有成品数据集服务。定制化采集我们会跟客户签保密协议,有保密期限,而成品数据集是公开的,有需要可以直接联系我们采购。
王慧:我们注意到,2025年,Meta投入约143亿美元,获得Scale AI约49%的股权,Scale的创始人也加入Meta。您如何看这笔交易?它反映了AI产业在争夺怎样的能力?
赵捷:在美国,尤其是硅谷,大家的产业链分工是比较明晰的,大厂主要做模型,数据类公司主要做好数据服务,行业对数据服务的价值认可度极高。其实不只是Scale AI,像Surge AI、Mercor,他们的估值都超过200亿美元。
对于整个行业来说,这肯定是个好事。首先,大公司、大厂认可数据服务商的能力;其次,数据服务商也通过和大厂的紧密合作,提升自己在数据侧的能力。
中国也逐渐意识到,具身智能领域的服务形式跟以前有所变化,大家对具身智能数据的认可度也在提升。
王慧:中国数据服务企业的核心竞争力是什么?海外客户选择博登的原因通常是什么?
赵捷:首先,我认为,当前中美人工智能竞争,中国最有优势的就是数据,因为我们场景多、人口基数大、经济活动丰富,工业体系很完善,产生了海量数据;另外,中国的数据服务商都非常专业,能在中国to B生态下脱颖而出的供应商能力都很强,因为竞争很激烈。
对于海外客户来说,中国有海量的机器人本体和场景,在做好数据安全和合规隐私保护的情况下,实现数据合规出境,这是他们非常看重的。
王慧:博登智能成为临港首家完成具身智能数据集出境备案的企业。对一家正在服务海外客户的中国公司来说,这项备案的实际意义是什么?
赵捷:这对我们推动海外业务来说,是一个实质性的利好。我们长期借助数据律师的专业支持,与临港相关方面开展数据合规出境的协调工作,成为临港首个具身数据集出境备案企业。我们可以通过临港专线,直接把我们备案过的数据合规地卖给客户,不管是做定制化服务还是售卖我们的成品数据集,都是个很好的通道。
在数据安全越来越受重视的背景下,这个能力本身就是竞争壁垒。
王慧:博登为什么选择在这个阶段不断拓展海外市场?不同市场之间,你们怎样确定优先级?
赵捷:作为一家中国公司,我们还是优先国内。国内机器人公司、大脑模型公司数量庞大,潜在客户非常多,有待于进一步开拓。同时,我们也注意到,北美对高质量数据的需求很高,所以我们准备增加在海外的投入。
王慧:哪些市场已经有实际客户或本地团队,哪些仍在开拓?
赵捷:目前我们已在美国搭建本地团队、有相应的客户,另外在瑞士、德国等欧洲国家也有,但美国的体量和集中度会更好一些。
王慧:如果将来AI只需要现在十分之一的数据,就能学会同样的任务,博登的收入来源和核心价值会发生什么变化?
赵捷:具身智能的规模化落地可能还需5-10年时间,在这个过程中,如果想迭代模型能力或者在某个垂直场景下实现产业落地,仍然需要持续、海量、多元的数据支撑。
我认为,至少在5年内,我们不需要过度考虑这个问题,至于5年后,我们将不断完善我们自己的工具链、测评系统,走到行业前列。
王慧:您认为未来5年,对于数据的需求还是爆发式增长的一个过程。
赵捷:一定是。
王慧:最后想要回到开头那个“机器人拿起瓶子”的例子,您最希望博登帮助机器人跨过哪一道门槛,让它真正进入普通人的工作和生活?
赵捷:我们希望帮助机器人在商超、酒店等大行业中率先落地。接下来,持续不断地帮助本体公司、模型公司,迭代他们的模型能力。
马鞍山创新中心就是我们这个愿景的第一个落地样板。我们在那里搭建了完整的“训练—验证—回流—再训练”闭环,机器人在真实场景中测试发现的问题,数据会回流到训练体系里,形成持续迭代。三期规划会把这个模式扩展成一个集数据供给、模型训练、成果转化、企业孵化于一体的综合性平台。我们希望能把这个样板复制到全国,让更多地方的机器人产业能用上高质量的数据基础设施。
王慧:谢谢赵总,相信今天通过跟您的对话,我们的观众会对数据服务这个行业有更充分、更深入的理解,再次感谢您做客我们的节目,谢谢!
赵捷:谢谢!