Pi和DeepSeek Harness对比,Token消耗差距惊人🔥
结果很有意思:DeepSeek Harness Token 消耗直接是 PI 的 12.5 倍
昨天晚上 DeepSeek harness 发布了 GUI 版本,我就很好奇他们两个的 token 消耗和缓存占比,就用了三个题目去做测试
完整的测试记录:
1、订单数据提取:Harness 9,091 / Pi 669,相差 13.6 倍
2、按截止时间选择任务:Harness 约 9.3K / Pi 907,相差 约 10.3 倍
3、修复代码并运行测试:Harness 51,027 / Pi 3,956,相差 12.9 倍
三项合计:Harness 约 69,418 / Pi 5,532,约为 12.5 倍。
不仅仅只看 token 消耗,更要看测试的速度和结果,两个 Agent 测试下来的结果都是一致的,速度上甚至 PI 还占上风
所以我就很好奇 相差 12.5 倍的 token 消耗,到底用在哪里了?
后面我会去拆解对应 Agent 的上下文,看一下在同样缓存和正确结果的方向上,为什么差距会这么大?
Pi 和 Codex Token 消耗差距有多大?整整 12 倍🔥
很多人都知道PI 省 token,但是具体有多省 token 没有一个具体的量化标准和感知,我就跑了 3 个任务 然后把消耗的 token 都量化出来
同一个 gpt-6-sol(medium),让 Codex CLI 和 Pi 各完成 3 个小任务。每项都从新会话开始,6 次运行全部通过测试。记录的是完整任务的总 token:
1、修复时长格式化:Codex 99,880 / Pi 6,083,相差 16.4 倍
2、合并时间区间:Codex 100,453 / Pi 6,087,相差 16.5 倍
3、解析一行 CSV:Codex 79,145 / Pi 10,904,相差 7.3 倍
三项合计:279,478 / 23,074,Codex 约为 Pi 的 12.1 倍。差距主要来自输入上下文
任务都是一致的 而且输入也是一致的,但是最终的消耗却差 12 倍,这中间绝大部分都是系统提示词和对应的 skill 和插件
如果你想省 token,那不用想 直接用 PI 就对了!