9月12日·星期六 10:13·来源:InfoQ

模型一模一样,Token 却相差 70 倍?三项实测揭开 AI 编程工具的成本黑洞

三项基准测试显示,AI编程智能体的成本差异主要来自框架而非模型。Composio用DeepSeek V4 Flash测试8种框架完成30个企业工作流,每次成功任务成本从Pi Agent的0.028美元到Claude Code的0.195美元不等,DeepAgents通过率与Claude Code相同但成本仅为其四分之一。6月的基准测试覆盖12种配置,每任务Token消耗从Aider architect模式的约3500个到OpenClaw的29.2万个,差距达70倍以上,且在两个不同模型上排名几乎不变。差异根源在于“启动税”:框架每轮发送的系统提示词与工具说明,Aider约700个Token,OpenClaw约2.6万个,乘以轮数可预测总消耗,R²达0.99。缓存命中率同样改写成本排名,Claude Code仅1.5%输入来自缓存,Codex约70%,导致原始Token更少的Claude Code实际账单更高。
本文摘要由千智坊基于公开报道整理,查看完整内容:阅读原文(InfoQ)→