新浪财经 股票

上百座机器人训练场背后,具身智能开始重新算账

市场资讯 10.09 19:44

(来源:澎湃新闻)

一年前,具身智能行业最流行的问题之一还是:机器人的数据从哪里来?到了今天,问题已经悄悄变成了:花这么多钱采来的数据,到底有没有用?

最近发生在北京首钢园的一幕颇有象征意味。据媒体报道,2025年3月,北京首家人形机器人数据训练中心在这里揭牌。规划中的3000平方米场地要放进108台机器人,建设家庭康养、新零售、汽车装配等十大场景。当时,这类训练中心被视为具身智能时代的新型基础设施,石景山区甚至提出,项目未来年数据产出量有望超过100万条。运行不到18个月,变化来了,原运营方已经撤走了自有设备和机器人。项目方解释,原来的遥操路线与新的发展方向存在偏差,采集数据的质量和精度也没有达到预期。

据中国信通院等机构近期发布的《具身智能训练场研究报告(2026年)》(以下简称《报告》)的不完全统计,截至2026年6月底,我国已投入运营的具身智能训练场超过70个,另有46个处于规划或建设阶段。

与此同时,围绕数采中心的争论开始升温。一些行业人士质疑,部分数采项目依赖政府支持、本体采购和数据回购形成内部循环。数采中心没有消失,但它已经进入重新算账的阶段。

数据荒催生了一门重资产生意

数采中心快速出现,有一个真实的技术背景:机器人缺少高质量的物理世界数据。

大语言模型可以从互联网获得海量文字和图像用于学习。而机器人学习叠衣服、装配零件或者打开抽屉时,需要知道的更多:手腕转过什么角度,夹爪用了多大的力,物体发生滑动后如何纠正,失败以后怎样重新完成任务。因此,过去两年最直接的办法就是建立训练场,由人遥控机器人反复操作,将轨迹变成训练数据。

可这种模式从一开始就很昂贵。上述《报告》估算,一座数千平方米的训练场通常需要投入数千万元至上亿元。部署100台人形机器人,仅本体采购就可能达到数千万元,后面还有场景建设、数据采集设备、算力、网络和存储,以及人力、维护和场租费用。

更麻烦的是,操作8小时不代表得到8小时有效数据。机器人会失败,设备会出错,场景需要复位,数据还要经过清洗和质检。行业人士估计,专业遥操员一天工作8小时,最终真正可用的数据可能只有两三个小时。

过去人们习惯用“10万小时”、“50万小时”、“百万小时”描述数采中心的规模。现在看来,这些数字最多只能说明生产能力。真正决定商业价值的,是其中多少数据能够进入模型、多少能够卖出去,以及模型吃完这些数据以后究竟变聪明了多少。

数采中心靠什么回本?

数采中心首先想到的当然是卖数据。然而,一个数采中心的商业模型取决于至少三个变量:效率、销售率和复购率。10万小时产能中有多少能通过验收,是第一道门槛;通过验收的数据能卖掉多少,是第二道门槛;客户第二年还会不会继续购买,是第三道门槛。

这里有一个具身智能特有的困难。不同机器人的自由度、夹爪、传感器和控制系统并不一样,一台机器人采集的数据能在多大程度上迁移给另一台机器人,目前仍在探索。因此最自然的客户就是生产这台机器人的企业。

由此产生了第二种模式:数据回购。例如,软通动力向深交所提交的文件显示,其子公司软通天擎向智元创新采购机器人,用于建设无锡的具身机器人数采场;项目落地以后,智元创新将按照约定进行数据回购,形成“项目获取—落地—数据回流”的合作闭环。

问题随之向前推进了一步:如果数采中心最重要的数据客户长期就是机器人供应商自己,这个市场能够扩张到多大?一家机器人公司将本体卖给训练场,训练场再生产数据,由这家公司购买,由此产生的两笔交易很难理解为两个彼此独立的市场需求。这也是今天“数采中心内循环”争议真正值得关注的地方。

目前,一些地方的数采中心同时承担招商、产业培育和基础设施建设功能。据报道,在已经投入使用的64个数采中心中,至少有13个部署了100台以上机器人;不少项目采用政企共建模式。有行业人士称,一些项目存在地方平台采购机器人、机器人厂商再回购数据的安排,一些地方政府对这类项目的投入产出已经开始变得谨慎。

真正的风险,可能还不止回不了本

经济账之外,数采中心还遇到了一个更棘手的技术问题:数据规模与数据价值并不天然成正比。这也是北京首钢园项目调整值得关注的原因。

训练场为了提高效率,往往把厨房、货架、流水线甚至病房复刻到一个固定空间里。这里光照稳定、地面平整、物品摆放相对规范,机器人可以一天重复数百次同一个动作。真正的工厂却不会如此配合。

零件可能反光,地面可能有油污,物体摆放每天存在偏差,生产线还有自己的节拍。机器人进入现场以后,真正决定它能不能长期工作的,往往是训练场里很少出现的异常情况:抓取失败、突然遮挡、零件滑落、设备故障,以及失败后如何恢复。于是出现了一个看似反常的结果:一个数采中心完全可能生产了海量数据,模型能力的提升却很有限。

近期产业实践已经开始发生变化。集中式“样板间”之外,无本体数据采集、第一视角视频、仿真合成以及分布式真实场景采集都在快速发展。一些企业把采集设备直接放进家庭、办公室、零售和生产环境,让数据在真实活动中自然产生。还有平台选择1∶1复刻具体工位,机器人完成中试后再进入生产线,一旦现场出现问题,就将失败案例带回来重新训练。

数据行业因此开始出现一个重要的计价变化。过去卖的是“一小时数据”;未来客户更关心的可能是,数据让机器人的任务成功率提高了多少、人工介入减少多少、部署时间缩短多少。数据规模仍然重要,但能力增量取决于数据质量、任务覆盖、难例比例、与目标本体的匹配程度以及模型的评测结果。

这会让很多依靠“产能”讲故事的数采中心变得尴尬。一个年产100万小时数据的中心,如果数据高度重复、跨本体迁移困难,对模型提升有限,规模本身不会自动转化成竞争优势。相反,一个只生产几万小时数据的平台,如果掌握大量真实生产中的失败案例、长尾情况和高质量力反馈,它的数据反而可能更加值钱。

数采行业过去最容易测量的是“生产了多少”,下一阶段需要回答的是“机器人到底学会了多少”。

数采中心不会消失,“数据工厂”可能会

这一轮质疑并不意味着具身智能不需要数据,高质量物理交互数据依然稀缺。问题在于,第一代数采中心把数据采集理解得过于接近传统制造业:建一座厂,摆几百台机器,雇一批操作员,再用“小时数”衡量产量。

这套模式正在被现实修正。未来真正有生命力的数采中心,很可能同时承担数据采集、模型训练、测试验证、中试和现场问题回流。它的核心资产也会发生变化:机器人的数量和场地面积会逐渐退到次要位置,真实产业场景、模型能力和持续获得高价值数据的渠道会越来越重要。

这或许也是数采中心这一轮“退烧”真正留下的启示。一个新产业刚刚出现时,数量最容易制造繁荣:多少家中心、多少台机器人、多少平方米场地、多少万小时数据,都清晰、直观,也适合被写进产业规划和项目报告。

可当行业开始进入真正的商业化阶段,评价体系必须改变。以后再看一家数采中心,值得追问的至少有三个数字:有多少收入来自与本体供应商无关的第三方客户,客户有没有持续复购,采集的数据究竟给模型带来了多大的能力提升。

前两个数字检验市场是否真正存在,最后一个数字决定这些数据究竟值不值钱。

过去一年,具身智能行业忙着给机器人建“学校”。现在第一批学生已经走到校门口。接下来衡量这些学校价值的标准,会越来越简单:机器人离开训练场以后,究竟能不能真正把活儿干好。

(作者王翔为复旦大学数字与移动治理实验室研究员)

来源:王翔

加载中...