自变量科技:用”更简单的手”反超Figure AI——具身智能的”DeepSeek时刻”

企业 自变量科技(X-Variable)
行业 信息传输、软件和信息技术服务业
年份 2026
难度 中级
适用课程 数字经济与平台经济
核心概念 技术范式变革,成本创新,商业模式创新,产业生态位
来源 改编

案例摘要

一、案例背景 行业格局:具身智能的”军备竞赛” 2026年,全球具身智能(Embodied AI)行业正处于一个关键的分水岭。所谓具身智能,是指将人工智能算法与物理实体(机器人)相结合,使机器能够感知、理解并与物理世界进行交互的系统。与传统的工业机器人不同,具身智能强调”大脑”(AI模型)与”身体”(硬件本体)的协同进化。 在这一赛道中,以美国Figure AI为代表的人形机器人企业长期占…

案例正文

一、案例背景

行业格局:具身智能的”军备竞赛”

2026年,全球具身智能(Embodied AI)行业正处于一个关键的分水岭。所谓具身智能,是指将人工智能算法与物理实体(机器人)相结合,使机器能够感知、理解并与物理世界进行交互的系统。与传统的工业机器人不同,具身智能强调”大脑”(AI模型)与”身体”(硬件本体)的协同进化。

在这一赛道中,以美国Figure AI为代表的人形机器人企业长期占据舆论与资本的焦点。Figure AI的旗舰产品Figure 03拥有完整的人形身体——两条腿、两只手臂、十根手指,其单台硬件成本据估算超过100万元人民币。2026年6月,Figure 03在连续200小时的物流分拣直播中创下每小时1248件的分拣纪录,被视为人形机器人产业化的里程碑。

与此同时,中国具身智能企业选择了另一条技术路线。成立于2023年的自变量科技(以下简称”自变量”),总部位于深圳,最初以家庭服务机器人切入市场,2026年4月发布全球首个采用”世界统一模型”(World Unified Model, WUM)架构的具身智能大模型WALL-B。与主流的VLA(Vision-Language-Action)模型不同,WALL-B将视觉、语言、动作及物理变化预测整合在同一个神经网络中联合训练,使机器人不仅能够”看见”和”行动”,还能”预判”动作的物理后果。

事件始末:一场打破纪录的直播

2026年8月,自变量进行了一场连续一小时的物流分拣直播。与Figure 03的”全副武装”不同,自变量仅为其双臂机器人配备了工业中最常见的标准两指夹爪。面对大小、重量、材质和朝向完全随机的真实物流包裹——包括纸箱、软袋、圆柱体快件和泡沫封装生鲜件——这台机器人完成了1816件有效分拣,短时吞吐量达到每小时1816件,较Figure 03的1248件/小时标杆高出45%,分拣准确率超过98%。

更值得关注的是成本数据。据公开信息,自变量所用方案的硬件成本较Figure 03方案下降了约70%。这意味着,在同等预算下,企业可以部署三倍以上的自变量机器人,或将以更低的单点投入实现规模化落地。

……

发表讨论

您的邮箱地址不会被公开。