AI News HubLIVE
站内改写2 分钟阅读

像穴居人一样对AI智能体说话真的能节省65%的Token吗?我们测试了

JetBrains测试了Claude Code的'穴居人'技能,该技能声称通过让智能体说话简洁节省65%的Token。在82个真实智能体任务的配对A/B基准测试中,强制激活时实际节省仅约8.5%。未发现明显的质量下降。广告中的节省适用于聊天风格,而非智能体工具调用。该技能安全有趣,但被过度宣传。

来源Hacker News AI作者: Sandman

JetBrains 对一种名为“穴居人”(Caveman)的 AI 智能体技能进行了严格的配对 A/B 测试,该技能声称可以让 AI 智能体像穴居人一样说话,从而节省高达 65% 的 Token。然而,测试结果表明,实际节省远低于宣传数字,但该技能并未对任务质量造成可测量的损害。

测试环境使用了 JetBrains 的 HarnessHarbor 0.17 沙箱,智能体为 Claude Code 2.1.200,模型为 claude-sonnet-5(低推理努力度)。基准测试采用 SkillsBench 中的 86 个任务,每个任务均通过自动测试评分(0-1 分)。实验分为两组:A 组为未启用技能的 Claude Code,B 组强制启用“穴居人”技能。共进行了 3 轮测试,约 240 个计费试验,总花费约 106 美元。

发现一:Token 节省约为 8.5%,而非 65%

宣传中的 65% 节省源自聊天风格的散文回答。但智能体的输出主要是代码、差异、工具调用和错误字符串,这些部分“穴居人”技能会原样保留。它只压缩工具调用之间的叙述性内容,而这部分占比很小。在强制启用的情况下,输出 Token 节省收敛至 8.5%(从 592k 降至 542k),远低于广告中的 65%。

发现二:未检测到质量下降

在全部 82 个配对任务中,两组的表现统计上无法区分。符号检验 p 值为 0.82,远未达到显著水平。平均任务得分:基准组 0.326,技能组 0.311,仅差 0.015 分。技能成功实现了风格转换,使智能体的对话变得像穴居人,但代码工件保持不变。

发现三:成本节省真实但脆弱

成本节省大致与 Token 节省一致,约 10%。但在完整运行中,技能组反而贵了 11.6%(40.60 美元 vs 36.39 美元),这完全归因于一个离群任务:一个依赖审计任务因进入长上下文定价区间而在技能组产生了 8.29 美元的费用,而基准组仅 0.33 美元。这表明成本节省容易被单次试验的变异所抵消。

结论

“穴居人”技能安全、诚实改变了风格,但在节省方面被过度宣传。强制启用时,它可靠地改变智能体的说话方式,而不会对任务结果造成可测量的损害。但在真实的智能体工作中,它最多只能削减约 8.5% 的输出 Token 和约 10% 的成本,因为占据主导的 Token 是代码和工具调用,而这些是技能刻意保留的。广告中的 65% 属于聊天式问答,而非编码智能体。建议:如果喜欢这种风格,可以用它,因为它有趣且不会降低质量。但不要指望在日常智能体任务中节省大量 Token,高个位数的百分比才是现实的上限。