一、案例背景
2026年8月,世界机器人大会在北京举行。会上,德国慕尼黑工业大学教授Gordon Cheng分享了一组对比鲜明的数据:20多年前,他的团队制造一台人形机器人耗时五年;而在大会展馆所在的街道上,一家工厂仅需15分钟即可整装下线一台人形机器人。与此同时,他的团队从慕尼黑运来一台全新机器人,仅用12小时便让其学会了跑步。
这种“中国速度”与“技术突破”的对比,折射出全球机器人产业正处于一个关键转折期。据国际机器人联合会(IFR)数据,2025年全球机器人市场规模已突破500亿美元,其中人形机器人成为增长最快的细分领域。中国作为全球最大的机器人消费市场,2025年工业机器人装机量占全球比重超过52%,人形机器人相关企业数量已超过300家。
然而,速度的提升并未解决智能的根本问题。Gordon Cheng指出,目前绝大多数人形机器人企业采用“模仿学习”范式——让机器人通过观察和模仿人类行为来学习任务。这一范式推动了行业快速迭代,却存在一个结构性缺陷:“很难在数量级上去扩展。”换言之,机器人学会了“怎么做”,却未必理解“为什么这么做”。
本届大会上,从GPU厂商、机器人本体企业到科研机构和行业组织,多位业内人士不约而同地指向具身智能发展的核心瓶颈:高质量物理世界数据不足、模型参数规模偏小、算力需求持续攀升,以及不同本体、软硬件架构、接口和数据体系尚未统一。与此同时,机器人进入工厂和家庭之后,还面临可靠性、成本控制、安全性和伦理规范等现实挑战。
摩尔线程董事长兼CEO张建中在大会上给出了一个量化判断:如果将当前具身智能与大语言模型的发展轨迹并列比较,两者之间存在数量级差距。目前绝大多数VLA(视觉-语言-动作)模型的参数规模约为70亿,而早期大语言模型已达到千亿级参数;训练VLA模型,许多团队仅需几十张甚至几张GPU即可完成。“它肯定离GPT时刻还有一定的差距。”
数据匮乏是更为根本的制约。语言模型可以充分利用人类数千年积累的文本知识和互联网海量数据,而具身智能训练所需的物理世界交互数据则极为稀缺——机械臂如何完成精细操作?机器人如何适应不同光线、天气和环境干扰?如何处理柔性物体?这些数据无法像互联网知识那样直接获取,必须通过真实世界的传感器采集或昂贵的仿真环境生成。
……