一、案例背景
1.1 从语言模型到机器人:数据范式的迁移与困境
大模型时代的核心逻辑——数据规模决定能力上限——已在自然语言处理领域得到充分验证。GPT系列模型的成功,本质上依赖于互联网上近乎无穷的文本数据。然而,当这一范式迁移至机器人领域时,研究者们遭遇了根本性的瓶颈:机器人需要的不仅是大量数据,而且是能够转化为动作能力的数据。
与传统互联网数据不同,机器人训练数据的获取极为昂贵且低效。每一条训练数据都需要真实机器人执行一次完整动作,再记录执行轨迹。这种数据采集方式不仅成本高昂,还强耦合于特定硬件平台——换一款机器人型号,数据往往需要重新收集。尽管Open X-Embodiment、DROID等大规模开源数据集已经出现,但从机器学习的规模标准来看,这些数据仍然属于“小数据”范畴。
这一困境构成了具身智能(Embodied AI)产业发展的核心瓶颈:数据稀缺性直接制约了机器人在真实世界中的泛化能力,进而影响了整个行业从实验室走向商业化落地的进程。
1.2 人类视频:被忽视的数据富矿
在此背景下,研究者们将目光投向了一个规模巨大且几乎免费的替代来源——人类视频。人类每天都在进行拿取、放置、开关、操作工具等各类动作,这些行为被摄像头大量记录。HowTo100M数据集收录了超过1.36亿个教学视频片段,Ego4D积累了超过3600小时的第一视角视频,YouTube等平台上的人类操作视频更是数以亿计。
正如论文一作、清华大学博士生冯志远所言:“戴一个智能眼镜,出门随便走走,所有人都能够成为数据来源,并且成本非常低。”人类视频理论上可以从一万小时的量级扩展到百万、千万小时。
然而,人类视频不能直接“喂给”机器人。论文指出了三重不兼容性:其一,视频中没有机器人可直接执行的动作标签;其二,缺乏机器人的本体感知信息(如关节角度、末端执行器状态);其三,人类手部运动与机器人的运动学控制接口存在本质差异。这“三重不兼容”构成了一个核心问题:人类视频进入机器人训练流程后,究竟应该被表示成什么?
……