一、案例背景
2026年8月,AI开发者社区被一组数据点燃。开发者0xEvan在社交平台公布,其使用Pi Harness(以下简称Pi)调用DeepSeek V4 Flash模型,在处理近10亿输入Token的任务中,实现了99.93%的缓存命中率,最终仅花费2.65美元。若没有缓存,同等用量预计耗资132美元。几乎同一时间,另一位开发者Shantanu Goel观测到,DeepSeek V4 Flash在其他Harness中的缓存命中率通常为94%至97%,而在Pi中却能持续稳定在99%以上。
这并非孤例。早在三个月前,Pi的创始人Mario Zechner就曾对“Pi + DeepSeek V4”组合做出过大胆预判:“pi + ds4 == sovereign AI enterprise ready clearly.”(Pi + DeepSeek 4,企业级AI这不就成了吗)。当时,这仅是他看到开发者用Pi在终端运行俄罗斯方块游戏后的一句即兴调侃。然而,2026年8月由AI工具公司Composio进行的一项公开横向测试,为这句调侃提供了坚实的注脚。
Composio的测试选取了同一个底层模型——DeepSeek V4 Flash,让其在8种不同的智能体Harness(即AI智能体的控制框架或工具链)中运行,完成30项高难度、需独立调用工具并完成全流程的智能体任务。测试结果出乎许多人意料:
- 成功率:Pi Agent以通过20项任务(成功率66.7%)的成绩位列第一;Oh My Pi以17项紧随其后;而备受关注的Claude Code、Codex和Deep Agents均只通过16项。
- 成本:Pi平均完成一项成功任务仅花费0.028美元,而Claude Code则需0.195美元,成本相差近7倍。
- 速度:Pi完成任务的中位时间为132.2秒,略慢于Claude Code的122.7秒,但综合考量成功率、成本与速度,Pi是当之无愧的综合最优解。
……