美国 databricks 一家数据分析的公司,用市面上不同 agent 工具,搭配不同的大模型,做了一次真实开发测试(非 benchmark 测试集),pi coding agent表现亮眼。
图表中,纵轴越靠上成功率越高,横轴越靠左成本越低。可以看到 pi 搭配顶级模型后任务成功率都保持80%以上,并且 token 消耗远远低于其他 agent 工具。
我也用了 pi 一段时间了,搭配 grok-4.5 + DeepSeek-v4 和自己的工作流(主 agent 编排, subagent 并发、隔离上下文),产出成果很少出现返工、运行速度非常快,终于不用刷手机等结果了。
对了,主 agent 编排, subagent 并发将是 agent 趋势,最近不少 agent 工具开始支持这类工作流。