一个普通开发者的 DeepSeek 成本优化实录
5 月 19 号,我习惯性打开 DeepSeek 后台看了一眼账单。
单日费用:39.65 元。
我平时一天大概三块钱左右。这一天直接翻了十几倍。
那天我也没干什么特别的。代码照写,对话照聊。唯一的变化就是——我装了一个 AI 插件。
当时没当回事,想着可能是哪次对话特别长。但第二天、第三天还是这样,我就知道不对了。
追凶:谁在偷我的 Token?
那个插件叫 PUA Skill,是个多 Agent 协作系统。名字挺唬人,介绍里写的是「自动化工作流增强」,听着像是能让效率翻倍那种东西。
装上之后确实感觉响应变快了,但我没注意到的是——每次我跟 Claude 说一句话,它会在后台悄没声地派生 7 个 sub-agent。什么 verifier、reviewer、executor、guardian,一个比一个能整活。关键是每个 sub-agent 都带着完整的上下文,独立调一次 API。
我做了一件事,后台跑了 5 到 7 次。
这是翻完整张账单之后才意识到的。
先看总账
5 月 1 号到 15 号,总共花了 81.87 元。按这个速度推算,一个月大概 164,一年差不多 1968。
说实话,2000 块一年对有些人来说可能不算什么。但我是那种连视频会员都要等打折再买的人,所以这个数字让我有点肉疼。
然后我开始逐行拆单日数据。拿最高的 5 月 9 号来说,那天花了 17.51 元。拆完之后发现一个很有意思的现象——
我 97% 以上的 Token 都是缓存命中的输入,这部分单价最低,只占了总成本的 17% 左右。剩下不到 3% 的未命中输入,单价是缓存命中的 120 倍,吃了 54% 的预算。输出更夸张,虽然量很少,但单价是基准的 240 倍,又吃了 29%。
翻译成人话就是:我 97% 的请求都在走便宜通道,但剩下那 3% 的「奢侈品消费」,吃掉了 83% 以上的钱。
典型的二八定律,只不过这里更极端,大概是一九。
第一步:止血
看完账单之后我做的第一件事不是搞什么自动化,而是先把最蠢的习惯改掉。
别再 /clear 了
我之前有个特别蠢的习惯:对话快满的时候直接 /clear,从头开始。
这个操作会破坏缓存前缀的连续性。下一次请求会变成全额计费的未命中,单价直接翻 120 倍。也就是说,我为了省那几秒钟的等待,每次多花了上百倍的钱。
后来才知道应该用 /compact。它会生成摘要、保留上下文,同时保持缓存前缀不被破坏。效果差不多,成本天差地别。
同时我把所有固定的角色设定、项目规则、代码规范都写进了 ~/.claude/SYSTEM_PROMPT.md。这个文件会被 Claude Code 自动加载,作为所有请求的固定前缀,始终命中缓存。
这一步成本为零,效果立竿见影。
日常用 Flash,复杂才上 Pro
翻账单的时候发现一个数据:5 月前 15 天,v4-Pro 占了 98.9% 的费用。
而 DeepSeek Flash 的单价只有 Pro 的三分之一到十二分之一。日常代码补全、文本处理、概念解释——Flash 完全够用。我根本不需要为了一行 CSS 调用顶配模型。
改了默认配置:
{
"model": "deepseek-v4-flash",
"effortLevel": "medium"
}
需要深度推理的时候手动 /model deepseek-v4-pro 切回来就行。好钢用在刀刃上。
就这一项,日费从 3 块降到 1 块左右。
让模型少说废话
输出是所有计费项里单价最高的。我在系统提示里加了两句话:
- 修改代码时只输出 diff,不输出完整文件
- 回答尽量精简,优先用代码说话,别附带解释
就这么简单两句话,输出消耗直接砍了差不多一半。说实话以前让模型改个 bug,它能把整个文件重新打印一遍,附赠三百字解释为什么这么改。现在终于消停了。
回到那个插件
前面说 PUA Skill 让我日消耗翻了三倍,现在详细讲讲这东西到底怎么运作的。
它的模式是:每次用户工具调用,触发 7 个 hook 事件点。每个 hook 启动一个 sub-agent,拿完整上下文独立调 API。每个 sub-agent 还有自己的验证、审查、执行流程。
算一下:用户 1 次操作 → 7 个 sub-agent → 各自再来 N 次工具调用。实际消耗可能是正常情况的几十倍。
但最坑的不是这个。
最坑的是它不在你的日志里。
PUA 的调用经过插件内部路由,DeepSeek 后台只显示 Token 异常增多,不会告诉你某个插件正在后台疯狂调用。你看到账单飙升了,但根本不知道钱花在哪了。
我现在装任何插件之前,会先检查它文档里有没有这些关键词:agent-team、subagent、parallel、heartbeat、hook。如果每次工具调用都会触发额外请求,那就要小心了。装完之后至少观察 24 小时的日消耗,确认没异常再继续用。
第二步:治本
止血是人工操作,治本就是搭一套自动化的东西,让机器替你省钱。
思路很简单:搞一个统一的 API 网关,加上漏斗式的路由策略。
搭网关
用了一个开源项目叫 New API(原 One API),能把所有 API 统一成 OpenAI 格式。部署也很简单:
docker run -d --name new-api \
-p 3000:3000 \
-e TZ=Asia/Shanghai \
-v /home/ubuntu/data/new-api:/data \
justsong/one-api
之后 Claude Code 只需要配一个入口,网关帮你做路由。
漏斗路由
路由策略分三层:
第一层,免费模型。 字符数小于 1000 且不含复杂关键词的请求,直接转发到腾讯混元 lite 或者小米 API。这部分是永久免费的,预计能分流 40% 左右的请求。
第二层,性价比模型。 字符在 1000 到 4000 之间、中等难度的请求,走 DeepSeek Flash 或者阿里百炼 qwen-turbo。预计分流 30%。
第三层,旗舰模型。 长文本、复杂推理、或者显式指定要用 Pro 的,才走 DeepSeek Pro。大概保留 30% 的请求。
按这个策略跑了一段时间,效果还不错。优化前半个月花了大概 82 块,优化后降到 20 块左右。月均从 164 降到 30 到 40,降幅 75% 以上。
当然这个数字会因人而异,取决于你平时用 AI 做什么。如果你主要是聊天写文章,免费层能吃掉更多。如果你像我一样大量写代码,Pro 的比例会高一些。
最后说两句
复盘这次经历,我觉得最值钱的不是那些优化技巧——缓存、换模型、路由策略这些东西,网上到处都有人写。
真正值钱的是一个认知:
在 AI 工具链上,看不见的成本比看得见的更致命。
DeepSeek 的账单我能一眼看到,所以做了缓存优化、模型切换、输出节食。但 PUA 插件带来的后台调用是隐形的——它不在 DeepSeek 的日志里,不在我的终端输出里。直到我偶然看到账单飙升才发现。
所以我现在养成了两个习惯:
- 每天看一眼账单。不用精算,瞄一眼就行。异常三秒内就能跳出来。
- 装任何新东西之前,先想清楚它会怎么调 API。如果文档里没写清楚,大概率有坑。
AI 工具越来越强,但它的成本结构一点都不透明。养成看账单的习惯,真的比学会什么提示词技巧都管用。
以上,希望能帮到同样在用 AI 写代码的朋友。
⚡ 当前状态
| 字段 | 内容 |
|---|---|
| 上次讨论 | 2026-05-21:文章已发布至知乎。后续完成 CSV 数据驱动的第二轮优化分析 |
| 待决策 | 无(文章已发布,数据已同步) |
| 下一步 | 跟踪文章反响,如有读者提问可补充 FAQ 或写续篇 |