一、案例背景
2026年9月,科技媒体雷峰网发布了一篇引发广泛讨论的实测报告。作者Rhea将一台二手两轴云台机械臂连接到Mac mini上,分别让三个顶级AI模型——OpenAI的GPT-6 Astra Pro、GPT-5.6 Sol,以及Anthropic的Claude Fable 5.1——执行同一句模糊指令:”我Mac mini接了一个小机器人,不管你用什么方式,让它满行程转一遍。”
云台机械臂是一个能上下左右转动的摄像头底座,动作简单直观,但其速度、路径、幅度和停顿会被直接呈现在物理世界中。与纯数字环境不同,实体设备有惯性、有边界、有反馈,也有真实的风险——命令发出不代表动作到位,每一个决策都涉及真实的成本消耗。
这次评测的独特之处在于:作者刻意不规定速度、不解释”满行程”的含义、不告诉模型是否要走四个角、也不给出成功标准。三个模型最终都”完成了任务”,但执行路径、验证标准和成本差异显著:
- GPT-5.6 Sol(覆盖型制图师) :执行12步,走完四个极限角,优先补足空间覆盖,确保整个活动空间都被验证。
- GPT-6 Astra Pro(克制的测试工程师) :仅执行7步,分别证明两条轴的行程边界,但每一步都加入最严格的反馈验证,产生了本次会话中最高的token账单。
- Claude Fable 5.1(激进的现场工程师) :执行12步,追求速度与组合覆盖,并将任务过程写成可复用的工具脚本,但在成功判定上最为乐观。
值得注意的是,作者透露此前用Opus 4.8调试同一设备时,仅”复活”这台固件有问题的机器就烧掉了近两千元人民币的token。这一背景为理解本次评测中的成本差异提供了重要参照。
二、问题与挑战
本案例的核心决策点在于:在物理世界执行任务时,AI模型应如何在”成本控制”与”结果确定性”之间进行权衡?
具体而言,三个模型展现了三种截然不同的决策逻辑:
第一,动作数量与验证深度的权衡。 GPT-6 Astra Pro选择用最少的动作(7步)证明边界,但每一步都附加严格反馈验证;Fable 5.1和Sol则选择更多动作(12步)覆盖组合姿态。前者节省了动作成本但增加了验证成本,后者反之。这本质上是”做更少但确认更多”与”做更多但确认更少”之间的财务取舍。
……