Skip to content

NextClaw × DeepSeek:五阶段优化降低成本 62.0%,实测比 DeepSeek Harness 低 10.8%

同样完成三项任务,NextClaw 费用从 USD 0.022664 降至 0.008613,减少 62.0%。 在同一套测试中,优化版比官方 DeepSeek Harness 低 10.8%。

版本通过 ↑费用 USD ↓缓存命中 ↑总 token ↓耗时 秒 ↓
NextClaw · 原版3/30.02266461.99%239,07435.91
NextClaw · 优化版3/30.00861384.08%173,41128.90
DeepSeek Harness3/30.00965678.92%159,42828.48

粗体为最优值。费用由供应商原始用量计算,耗时含启动与验收。开发版、每阶段一组三任务实测;缓存受供应商状态影响,不代表所有任务或统计显著优势。

五个阶段,费用怎么变?

每个阶段只在上一个阶段上增加一组优化;S0 是未经这五项优化的原版。全部 21 个任务样本通过,没有删掉失败样本或挑选重跑。

NextClaw 五阶段费用曲线,包含原版与 DeepSeek Harness 参考线

阶段费用 USD缓存命中输入 token输出 token总 token耗时 秒调用
S0 原版0.02266461.99%236,2162,858239,07435.9115
S1 保留模型轮次0.01505477.85%250,0852,278252,36327.5516
S2 精简常驻提示0.01504177.82%248,8722,332251,20429.9817
S3 固定工具声明0.01175784.01%250,1842,249252,43330.2717
S4 修复压缩范围0.01164583.17%237,4622,230239,69228.7016
S5 参数按需查询0.00861384.08%170,9562,455173,41128.9016
DSH0.00965678.92%157,1532,275159,42828.4815

相对上一阶段,改善了多少?

费用、token、耗时的负值表示减少;缓存变化以百分点表示。“相对原版”用于看累计效果,不能把各行百分比相加。

阶段费用环比费用相对原版缓存变化总 token 变化耗时变化
S1 保留模型轮次-33.58%-33.58%+15.86 pp+5.56%-23.29%
S2 精简常驻提示-0.09%-33.64%-0.03 pp-0.46%+8.83%
S3 固定工具声明-21.83%-48.12%+6.19 pp+0.49%+0.98%
S4 修复压缩范围-0.95%-48.62%-0.84 pp-5.05%-5.21%
S5 参数按需查询-26.04%-62.00%+0.91 pp-27.65%+0.71%

每个阶段说明了什么?

S1:历史不再重写,是第一项主要收益

费用下降 33.58%,缓存命中率提高 15.86 个百分点,即使总 token 增加 5.56%,仍明显省钱。原因在于未缓存输入从 89,784 降至 55,397

原版历史/工具前缀改写共 9 次,S1 降为 1 次。持久化记录保存真实模型轮次后,追加工具调用不再重新合并旧历史;剩余一次与工具声明变化有关。这里的收益来自减少昂贵的未缓存输入,不是简单地少发 token。

S2:提示变短,没有带来同等幅度的费用下降

费用只下降 0.09%,缓存命中率下降 0.03 个百分点,总 token 减少 0.46%,耗时反而增加 8.83%。这组结果只能称为基本持平,不能宣传成独立的大幅降本。

逐任务看,文件核对费用从 USD 0.005476 升至 0.008267,配置诊断与修复则下降。文件任务的工具列表仍从 49 个变为 50 个,破坏前缀;执行路径也有变化。提示精简有输入收益,但整体费用必须连同缓存稳定性一起验证。

S3:工具声明稳定,是第二项主要收益

费用下降 21.83%,缓存命中率提高 6.19 个百分点,未缓存输入从 55,208 降至 40,008。总 token 略增 0.49%,调用次数仍是 17 次;前缀改写从 1 次降为 0 次

变化是会话搜索从启动就声明,索引准备情况通过执行结果返回。后台就绪不会再增加一个工具、改变缓存前缀。这是指标变化与请求证据相吻合的阶段。

S4:压缩修复已加入,但这组三任务没有触发压缩

费用下降 0.95%,缓存命中率下降 0.84 个百分点,总 token 减少 5.05%,调用从 17 次变成 16 次。

请求记录中没有摘要调用,因此不能把这点费用下降归因于压缩修复。 这一阶段证明完整修复组合仍能完成任务;费用与耗时变化主要伴随执行路径变化。要独立量化压缩收益,需要触发压缩的长会话实验,这份短任务曲线不提供该因果结论。

S5:减少常驻工具参数,是第三项主要收益

费用下降 26.04%,总 token 减少 27.65%,缓存命中率提高 0.91 个百分点。调用次数同为 16,耗时略增 0.71%,说明降本不等于同步加速。

工具声明从 29,898 降至 15,036 字符;输入 token 从 237,462 降至 170,956。部分完整参数通过稳定的 tool_schema 按需查询,基础工具仍提供完整参数,执行仍保留原校验与权限。

这些任务主要使用直接声明的基础工具,没有覆盖大量参数查询的场景;不能因此断言渐进加载对所有工具任务都更便宜或完全无损。

实验设置与完整数据

  • 模型:官方 deepseek-v4-flash;思考模式 enabled/high;DSH SDK 0.1.2-rc.1。
  • 任务:五文件核对与追问、配置故障诊断与追问、Python 运费边界修复与外部测试。
  • 每请求统一上限 2,048 输出 token;任务超时 120 秒。全部样本未出现输出截断。
  • 每样本独立进程、HOME、XDG 与工作目录;保留各自原生工具,排除用户安装的 skills 和历史。
  • 三类任务轮换阶段执行顺序;不清空供应商缓存、不额外预热。每阶段每任务仅一次,不估计置信区间。
  • 原版源码为 c0b131f19,只共同保留让公共测量入口可运行的 chatStream 接收者绑定修复;五项优化按 manifest 逐阶段累计。
  • 全部测量时间为 2026-09-08 05:15–05:18 UTC,同一价格窗口:每百万未缓存输入 / 缓存输入 / 输出为 USD 0.22 / 0.007 / 0.66
  • 21 个样本共 112 次模型调用,USD 0.094429860,低于 USD 0.25 的总预算。费用是用量估算,不是账单实扣。

核心命中率为全部缓存输入除以全部输入,包含首请求;输出包含思考,不重复相加。所有表格与曲线来自这一次统一实验,旧的 512-token 测量没有拼入。

缓存条件会影响领先幅度

S5 的三项首请求共命中 6,912 token,DSH 首请求没有命中。只将首请求改按未命中价重算,S5 费用为 USD 0.010085404,DSH 为 USD 0.009656344,NextClaw 约高 4.4%

因此“低 10.8%”是这次真实缓存条件下的观测结果,不能全部归于产品自身;全冷首请求重算只是敏感性分析,也不是清空缓存后的复测。相同任务规范不等于供应商缓存完全相同。

完整缓存、思考与请求指标
阶段缓存输入未缓存输入思考 tokenAPI 秒前缀改写
S0146,43289,7841,04523.869
S1194,68855,39766819.001
S2193,66455,20869420.431
S3210,17640,00852819.660
S4197,50439,95859118.400
S5143,74427,21274419.940
DSH124,03233,12158019.780
21 个任务的逐项结果
阶段任务通过费用 USD缓存命中输入输出耗时 秒调用
DSHconfig0.00257022474.63%34,9876598.164
DSHfiles0.00433012082.22%86,4046869.347
DSHrepair0.00275600075.16%35,76293010.974
S0config0.00588755658.50%56,0098269.264
S0files0.01230006459.03%123,3881,01216.077
S0repair0.00447616471.86%56,8191,02010.584
S1config0.00578701667.56%69,34377310.135
S1files0.00547648884.14%123,6786569.267
S1repair0.00379013276.71%57,0648498.164
S2config0.00337025683.32%66,2128409.995
S2files0.00826686071.78%116,79965010.047
S2repair0.00340341282.99%65,8618429.965
S3config0.00326875683.02%65,6776589.895
S3files0.00499490085.21%117,92668710.037
S3repair0.00349367682.86%66,58190410.355
S4config0.00326720479.15%53,2058068.724
S4files0.00497244485.22%117,76066710.587
S4repair0.00340544082.77%66,4977579.405
S5config0.00230096881.32%36,6768869.594
S5files0.00390166485.06%88,6346989.317
S5repair0.00241051684.41%45,6468719.995

如何重跑和追踪

实验代码在不发布的 @nextclaw/agent-benchmark 包中,复用同一任务、验收、请求观察器和预算机制。阶段 manifest 冻结源码及指纹,报告同时生成每阶段结果、相邻阶段与原版的增量;续跑跳过已完成样本,不挑选重跑失败。

在该包目录执行,先用 --dry-run 核对任务和预算,再移除该参数运行。查看已有 JSON / Markdown 报告不调用模型。

sh
pnpm exec tsx --conditions=development \
  --tsconfig ../../scripts/dev/dev-runtime.tsconfig.json \
  src/diagnostics/staged-study.manager.mjs \
  /absolute/new-result-dir /absolute/dsh-sdk-dir --dry-run

基于 MIT License 发布。