至简动力:聚焦具身智能落地难题,20分钟内实现100%成功率丨AI时刻
君联资本
3月16日,君联投资企业至简动力CEO贾鹏受邀出席英伟达GTC 2026大会并发表主题演讲,向全球开发者系统性展示至简动力近期在具身智能领域的技术突破。在本次演讲中,贾鹏对具身智能迈入真正生产力的核心方法论进行了深度拆解,首次全面披露了至简动力的技术体系与实战成果,为具身智能规模化落地提供了全新思路。
· 破题:打通“通用性”与“成功率”的根本矛盾
贾鹏指出,当前具身智能行业面临一个现实鸿沟:具身智能通用能力的不足与用户高要求之间存在巨大差距。
“真实世界的复杂程度远远超出想象,”他表示,“目前模型泛化能力较差,在大多数场景均难以落地,尤其在灵巧操作任务上几乎无泛化能力,是行业普遍存在的问题。而在工厂等应用场景中,只有达到100%的成功率才能形成真正的生产力,产生用户价值。”
针对这一瓶颈,至简动力经过大量研究与实践,形成了一套核心方法论:构建高上限的大一统基座模型、打造高效的规模化数据采集方式、实现单一任务的快速适配、完成端侧的实时推理与训练。
· 打造大一统的具身基座模型,兼备通用性与高上限
至简动力的核心技术突破在于,打造了融合了世界模型与VLA能力的大一统自研具身基座模型。该模型基于MoT(Mixture of Transformer)架构,实现了四个“一体化”:多模态理解一体化(原生多模态)、多模态生成一体化(理解生成合一)、快慢思考一体化(自适应选择深度思考或快速响应)、Policy与Critic一体化(既能执行动作又能自我评估)。
“我们追求用单一的Transformer实现原生多模态的理解和生成,”贾鹏介绍,这个模型创新性地引入了隐空间时空思维链(Latent Spatio-Temporal Chain-of-Thought)技术,在紧凑的隐空间中对物理世界进行建模和预测,同时自回归地预测二维图像、三维点云和本体感知状态,实现多模态CoT推理。
实验结果显示,该模型在仿真和真实场景中均实现SOTA,大幅超越了之前的基座模型,比显式CoT方法加速约14倍。同时,这个大一统的基座模型具备优秀的长程任务容错能力、跨任务泛化能力——从桌面操作到移动操作,再到灵巧手复杂关节操作,均能稳定迁移,成功处理。(目前该模型已经成为北美顶尖实验室对比的baseline model,相关论文将在今年4月陆续发布)
· 便携式手套采集:破解数据难题,实现预训练数据与SFT数据双保障
高上限的基座模型离不开海量泛化的预训练数据和高质量的垂域SFT数据。当前行业主流的合成数据、真机采集数据、半真机采集数据、人类第一视角数据等均各有痛点。
至简动力创新研发并采用了便携式手套众包采集的方案。该方案既能保证数据采集的效率,同时也能保证数据质量,还可方便地扩展到更多模态,比如触觉、力觉等。在工厂等实际场景中,手套采集的人手数据不仅质量完全满足SFT要求,能大幅提升模型在下游场景的泛化性和任务成功率。同时,这种数据采集方式不仅不会给工人的正常工作带来影响,还能给他们带来额外收入,工人的配合度极高。
· 双强化学习框架:TwinRL+DoubleRL,20分钟实现100%成功率
与其他AI应用不同的是,达到100%的成功率是形成具身智能真正生产力的硬性前提。行业也已经逐渐形成共识,强化学习是实现通用模型在单一任务100%成功率的唯一解法。就目前强化学习普遍存在的效率低下与过拟合问题,至简动力进一步发布了TwinRL虚实结合强化学习框架与DoubleRL双重强化学习机制。
TwinRL通过3DGS技术将真实场景重建为虚拟的数字孪生,在虚拟环境中放大探索空间、提升探索效率的同时,精准定位易错区域,提升未来人工接管时human in the loop的效率。DoubleRL则依托于至简动力的LaST₀基座模型所具备的稠密的时空latent feature,在latent feature生成与action生成两个层面进行双重强化学习。
“经过这样的强化学习方法之后,在大多数下游任务中,我们能在20分钟内实现100%的成功率,而且这个成功率是具备泛化性的成功率,在任意位置都能达到100%。”贾鹏在演讲中详细展示了实测数据。
· 端侧部署,实时推理与训练:适配场景需求,让机器人真正走进工厂
针对工厂对机器人生产节拍、快速学习能力以及数据保密等需求,至简动力在英伟达的技术支持下,对模型进行了大量端侧优化,成为行业内首个实现端侧实时推理与训练的企业。
基于NVIDIA Thor平台,采用FP16/FP8混合精度训练,不仅实现高帧率、低延迟的实时推理,更让普通工人无需编程,仅通过简单示教即可在端侧快速教会机器人新任务。
贾鹏表示,当前具身智能行业正处于从Demo走向真实生产力的关键阶段,至简动力将在实际落地过程中持续打磨这套方法论,通过数据的飞轮效应不断提升基座模型的通用能力,实现全场景的高泛化性,最终迈向通用具身智能。
来源:至简动力