据动察 Beating 监测,AI Agent 基础设施公司 Composio 将同一款 Kimi K3 接入 Kimi Code、Hermes 和 Claude Code,完成 28 项相同任务。三套运行框架的成功数只差 2 项,Token 用量和成本却相差很大。
Kimi Code 完成 22 项,Hermes 完成 21 项,Claude Code 完成 20 项。单项任务 Token 中位数分别为 6.1 万、6.7 万和 34 万。Composio 估算,平均每项任务成本约为 0.22 美元、0.28 美元和 2 美元。个别任务的 Token 用量最多相差 30 倍。
Hermes 速度最快,单项任务中位耗时为 179 秒。Kimi Code 为 297 秒,Claude Code 为 348 秒。
Writer 的另一项研究也得到相近结果。研究人员在 22 项企业任务和 6 款模型上只替换运行框架,Token 用量下降 38%,单项成本下降 41%,耗时下降 44%,完成质量基本持平。