配置锁死和及时清理只是基础,真正决定账单厚度的是底层的提示缓存机制。
Claude Code 每次请求都会从相同的前缀开始,只要这次和上次逐字节一样,服务器就直接加载结果。缓存读取只要正常输入价的十分之一,直接砍掉百分之九十的成本。这杠杆率,简直比小米18 Pro Max 传闻中那块 8500mAh 的超大电池还要顶,充一次电能扛很久。写入缓存虽然最高要两倍价格,但只发生一次,后面几十轮对话全在薅羊毛。
但这玩意有个致命弱点,必须从第一个字节开始连续匹配,中间稍微变一点,后面的缓存全得作废。很多新手就是在这里疯狂送钱。
比如你写着写着觉得当前模型搞不定,随手切到高级版,或者临时调高推理强度,甚至开关一下快速模式。这些动作在计费系统眼里就是灾难,整个对话历史瞬间按全价重新预填充。还有个隐藏大坑,opusplan 模式每次进出规划状态都会自动切模型。进一次失效一次,出来又失效一次,来回横跳几次,你的钱就全变成全价预填充了。
另外就是时间管理。订阅用户的缓存保活只有一小时,API 用户更是惨到只有五分钟。超时没动静,下一轮直接全量重算。至于那些隔了半天才想起来恢复的旧会话,缓存早就凉透了,百分之百要掏原价。
很多人觉得压缩对话能省钱,其实在对话还在缓存里的时候压,成本只有十分之一。等你缓存过期了再去压,系统得按全价重新读一遍再压缩,纯属倒贴钱。
别把提示缓存当成理所当然的默认福利,它其实是个极度脆弱的易碎品。把模型和推理强度在开局就焊死,不在缓存还热乎的时候瞎折腾压缩,才是守住钱包的底线。
保住了缓存,还得解决对话历史本身随着轮数增加越来越长的问题。
跑测试或者编译时,终端里那种密密麻麻的日志简直是上下文杀手。官方那个三万字符的兜底阈值根本防不住几百行但总字符数不达标的碎碎念。最直接的解法是在配置文件里给命令加上静默参数。比如跑测试时加上 reporter=dot 这种配置,让几百行的详细日志变成几个干瘪的进度点。花一分钟改个配置,就能挡住后续几十轮对话里反复传输的无用废话,这买卖太划算了。
遇到那种需要疯狂读文件、跑复杂命令的大活儿,千万别在主会话里硬刚。直接扔给子 Agent 才是正解。这玩意就像小米 18 Pro Max 传闻中那块 8500mAh 的超大电池,专门用来扛高耗能任务。子 Agent 会在一个完全独立的上下文窗口里干活,把脏活累活全包了,最后只把精炼的结论传回主对话。那些过程中产生的庞大输出和中间文件,全被隔离在外面,根本污染不到你的主会话。
很多新手舍不得用子 Agent,觉得在主对话里看着它一步步执行有安全感。这种自我安慰的代价就是 token 费用呈指数级暴涨。你盯着那几百行输出看,每一轮都在为这些没人看的废话买单,上下文膨胀的速度简直比小米 18 标准版延后到 2027 年发布还要让人绝望。
别把 AI 当成需要实时汇报工作的实习生,给它配个独立的子 Agent 去干脏活,主会话只保留核心决策。把上下文体积死死控制住,你的账单才不会像脱缰的野马一样拉不住。
除了控制上下文长度,模型选择也是控制成本的关键一环,别总盯着最贵的用。
很多开发者有个通病,一打开终端就直奔最贵的 Opus。这就好比买手机,明明只是日常写点业务代码,非要咬牙上小米 18 Pro Max,盯着那块 8500mAh 超大电池和骁龙 8 Elite Gen 6 Pro 处理器沾沾自喜。其实标准版延后到 2027 年发布是有原因的,日常干活标准版完全够用,强行上顶配纯属性能过剩。
看看官方的定价就明白了。Opus 5 的输出价格高达 25 美元每百万 token,是 Sonnet 5 的两倍半。日常写个常规函数、修个普通漏洞,Sonnet 5 完全能胜任,输入只要 2 美元,输出 10 美元。Anthropic 官方那句“简单活用 Sonnet,硬骨头才上 Opus”绝对是掏心窝子的话,牛刀杀鸡的账单看着都让人肉疼。
除了选对模型,推理强度这个旋钮也得拧紧。很多人喜欢把 effort level 直接拉满,结果 Sonnet 在后台疯狂生成思考 token,输出量直接翻好几倍。写个几十行的脚本,它能在底层默默思考几千字,这些隐藏的思考过程全是要按昂贵的输出价收钱的。把推理强度调到中低档,你会发现 Sonnet 干活依然麻利,但账单瞬间清爽很多。
真正聪明的用法是建立分层策略。日常搬砖、代码补全、简单重构,全部交给 Sonnet 配合低推理强度,把性价比榨干。只有遇到跨模块的复杂架构设计,或者死活找不出原因的诡异报错,再切到 Opus 拉满强度去死磕。
别把 AI 助手当成炫耀算力的玩具,它是帮你干活的工具。把合适的模型用在合适的场景,你的 token 才能真正花在刀刃上,而不是给 Anthropic 的财报做贡献。
工具用得好不好全看日常习惯,最后咱们把这套省钱心法彻底固化成肌肉记忆。
平时写代码,很多人习惯直接手打文件路径让 AI 去读,这简直是在给 token 放血。听句劝,直接用 @ 引用把文件附在消息里。你如果只丢个文件名,Claude 还得先搜一圈,打开好几个文件试探,这些无用的试探全都会塞进对话历史里反复计费。用 @ 引用直接一步到位,省掉一次工具调用的开销,这习惯一旦养成,每个月省下的钱够喝好几杯精品咖啡了。
再说说压缩对话的时机。别等下班了或者缓存凉透了才想起来跑 /compact。官方早就透了底,在对话还在缓存里的时候压缩,成本只有正常的十分之一。等你缓存过期再去压,系统得按全价重新读一遍历史再压缩,纯属倒贴钱。最聪明的做法是去倒杯水或者摸鱼的间隙顺手敲一下,把膨胀的上下文及时挤干水分。
这就跟买手机一样,别总盯着小米 18 Pro Max 那块 8500mAh 电池和骁龙 8 Elite Gen 6 Pro 处理器流口水,真等你把标准版熬到 2027 年发布,黄花菜都凉了。用 AI 也是同理,别总指望靠无脑堆算力来掩盖糟糕的使用习惯。
把 @ 引用和趁热 /compact 变成下意识的动作,配合前面锁死配置和子 Agent 隔离的套路,你的上下文体积就能死死卡在健康线以内。别把 AI 编程助手当成可以无限包容的垃圾桶,随手清理、精准投喂,才是把 token 花在刀刃上的终极奥义。毕竟,Anthropic 的财报已经够好看了,咱们真没必要再用自己的钱包去给它锦上添花。别再给 Anthropic 白送钱了,Claude Code 官方省钱指南
AI 工具推荐
Claude Code
AI编程
token省钱
提示缓存
Anthropic
很多开发者用 Claude Code 写代码,月底一看账单直接傻眼,日均十几刀就这么没了。其实真不是模型太贵,而是你的使用习惯在疯狂烧 token。Anthropic 官方最近实在看不下去,发了一份详细的省钱心法。本文帮你拆解背后的计费逻辑,文中会直接列出 1、2、3 编号的核心操作要点,方便你快速抄作业。从提示缓存机制到上下文膨胀陷阱,手把手教你怎么把冤枉钱省下来,让每一分钱都花在刀刃上。
开发者用Claude Code日均要消耗13美元token,月均花费高达250美元,这烧钱速度简直比最近爆料的小米18标准版延后到2027年发布还要让人心焦。Anthropic官方最近也实在看不下去了,专门发了篇博客吐槽大家别再烧冤枉钱。
同样修一个bug,问法不对,花费能差出好几倍。钱到底花在哪了?罪魁祸首是你的会话正在偷偷变胖。每次你在终端里输入一条指令,模型都要把系统提示词、配置文件以及之前对话里积累的所有内容一口气读进去。这意味着第40轮对话,必须重新发送前39轮的全部累积内容。
这种增长是接近平方级别的。更坑的是,虽然官方有个兜底机制,命令输出超过3万字符会转成临时文件摘要,但3万字符以下的输出根本没人管。比如一个测试框架跑完打印了400行通过记录,总量不到3万,这400行就会原封不动地留在对话历史里,后面每一轮都跟着重新发送一遍。
再加上输出token的价格是输入token的5倍,模型每吐一个字都要跑一次独立运算。你的上下文越臃肿,每一轮的预填充成本就越恐怖。
别以为买了200美元的Max订阅就能敞开了用,不管上下文膨胀,多少钱都不够填。赶紧把官方那套瘦身和缓存技巧用起来,不然你的钱真就是白送给Anthropic了。
既然知道了钱是怎么没的,咱们先快速过一遍最立竿见影的核心操作。
开局把模型和推理强度死死锁住是省钱的前提。很多人写代码写到一半,觉得当前模型搞不定,随手切个高级版,或者想让它多想会儿,临时调高推理强度。这操作在计费系统眼里简直就是灾难。中途切换配置会导致之前积累的提示缓存瞬间失效,整段对话历史直接按全价重新计算。这就好比小米18标准版非要延后到2027年发布一样,你的缓存也是有严格时间窗口的,一旦中途变卦,前面省下的折扣全得吐出来。官方建议就是在会话一开始就定好参数,全程别手痒去切换。
任务做完立刻清空对话是控制体重的关键。修完一个漏洞,或者跑通了一个小功能,马上敲 /clear 清空当前会话。千万别让上一个任务读过的几百行测试日志和无关文件,拖进下一个任务里白白占着上下文。
很多开发者有个误区,觉得在一个长会话里死磕能保持上下文连贯性。其实这在按量计费的工具里纯属自我感动。你所谓的连贯,全是拿真金白银堆出来的重复预填充成本。真正高效的用法是把大任务拆碎,一个会话只解决一个具体模块,用完即焚。
别把编程助手当成能记住你所有前尘往事的知己,它只是个按字计费的无情打工人。干完活就果断让它失忆,你的钱包才能保持清醒。
配置锁死和及时清理只是基础,真正决定账单厚度的是底层的提示缓存机制。
Claude Code 每次请求都会从相同的前缀开始,只要这次和上次逐字节一样,服务器就直接加载结果。缓存读取只要正常输入价的十分之一,直接砍掉百分之九十的成本。这杠杆率,简直比小米18 Pro Max 传闻中那块 8500mAh 的超大电池还要顶,充一次电能扛很久。写入缓存虽然最高要两倍价格,但只发生一次,后面几十轮对话全在薅羊毛。
但这玩意有个致命弱点,必须从第一个字节开始连续匹配,中间稍微变一点,后面的缓存全得作废。很多新手就是在这里疯狂送钱。
比如你写着写着觉得当前模型搞不定,随手切到高级版,或者临时调高推理强度,甚至开关一下快速模式。这些动作在计费系统眼里就是灾难,整个对话历史瞬间按全价重新预填充。还有个隐藏大坑,opusplan 模式每次进出规划状态都会自动切模型。进一次失效一次,出来又失效一次,来回横跳几次,你的钱就全变成全价预填充了。
另外就是时间管理。订阅用户的缓存保活只有一小时,API 用户更是惨到只有五分钟。超时没动静,下一轮直接全量重算。至于那些隔了半天才想起来恢复的旧会话,缓存早就凉透了,百分之百要掏原价。
很多人觉得压缩对话能省钱,其实在对话还在缓存里的时候压,成本只有十分之一。等你缓存过期了再去压,系统得按全价重新读一遍再压缩,纯属倒贴钱。
别把提示缓存当成理所当然的默认福利,它其实是个极度脆弱的易碎品。把模型和推理强度在开局就焊死,不在缓存还热乎的时候瞎折腾压缩,才是守住钱包的底线。
保住了缓存,还得解决对话历史本身随着轮数增加越来越长的问题。
跑测试或者编译时,终端里那种密密麻麻的日志简直是上下文杀手。官方那个三万字符的兜底阈值根本防不住几百行但总字符数不达标的碎碎念。最直接的解法是在配置文件里给命令加上静默参数。比如跑测试时加上 reporter=dot 这种配置,让几百行的详细日志变成几个干瘪的进度点。花一分钟改个配置,就能挡住后续几十轮对话里反复传输的无用废话,这买卖太划算了。
遇到那种需要疯狂读文件、跑复杂命令的大活儿,千万别在主会话里硬刚。直接扔给子 Agent 才是正解。这玩意就像小米 18 Pro Max 传闻中那块 8500mAh 的超大电池,专门用来扛高耗能任务。子 Agent 会在一个完全独立的上下文窗口里干活,把脏活累活全包了,最后只把精炼的结论传回主对话。那些过程中产生的庞大输出和中间文件,全被隔离在外面,根本污染不到你的主会话。
很多新手舍不得用子 Agent,觉得在主对话里看着它一步步执行有安全感。这种自我安慰的代价就是 token 费用呈指数级暴涨。你盯着那几百行输出看,每一轮都在为这些没人看的废话买单,上下文膨胀的速度简直比小米 18 标准版延后到 2027 年发布还要让人绝望。
别把 AI 当成需要实时汇报工作的实习生,给它配个独立的子 Agent 去干脏活,主会话只保留核心决策。把上下文体积死死控制住,你的账单才不会像脱缰的野马一样拉不住。
除了控制上下文长度,模型选择也是控制成本的关键一环,别总盯着最贵的用。
很多开发者有个通病,一打开终端就直奔最贵的 Opus。这就好比买手机,明明只是日常写点业务代码,非要咬牙上小米 18 Pro Max,盯着那块 8500mAh 超大电池和骁龙 8 Elite Gen 6 Pro 处理器沾沾自喜。其实标准版延后到 2027 年发布是有原因的,日常干活标准版完全够用,强行上顶配纯属性能过剩。
看看官方的定价就明白了。Opus 5 的输出价格高达 25 美元每百万 token,是 Sonnet 5 的两倍半。日常写个常规函数、修个普通漏洞,Sonnet 5 完全能胜任,输入只要 2 美元,输出 10 美元。Anthropic 官方那句“简单活用 Sonnet,硬骨头才上 Opus”绝对是掏心窝子的话,牛刀杀鸡的账单看着都让人肉疼。
除了选对模型,推理强度这个旋钮也得拧紧。很多人喜欢把 effort level 直接拉满,结果 Sonnet 在后台疯狂生成思考 token,输出量直接翻好几倍。写个几十行的脚本,它能在底层默默思考几千字,这些隐藏的思考过程全是要按昂贵的输出价收钱的。把推理强度调到中低档,你会发现 Sonnet 干活依然麻利,但账单瞬间清爽很多。
真正聪明的用法是建立分层策略。日常搬砖、代码补全、简单重构,全部交给 Sonnet 配合低推理强度,把性价比榨干。只有遇到跨模块的复杂架构设计,或者死活找不出原因的诡异报错,再切到 Opus 拉满强度去死磕。
别把 AI 助手当成炫耀算力的玩具,它是帮你干活的工具。把合适的模型用在合适的场景,你的 token 才能真正花在刀刃上,而不是给 Anthropic 的财报做贡献。
工具用得好不好全看日常习惯,最后咱们把这套省钱心法彻底固化成肌肉记忆。
平时写代码,很多人习惯直接手打文件路径让 AI 去读,这简直是在给 token 放血。听句劝,直接用 @ 引用把文件附在消息里。你如果只丢个文件名,Claude 还得先搜一圈,打开好几个文件试探,这些无用的试探全都会塞进对话历史里反复计费。用 @ 引用直接一步到位,省掉一次工具调用的开销,这习惯一旦养成,每个月省下的钱够喝好几杯精品咖啡了。
再说说压缩对话的时机。别等下班了或者缓存凉透了才想起来跑 /compact。官方早就透了底,在对话还在缓存里的时候压缩,成本只有正常的十分之一。等你缓存过期再去压,系统得按全价重新读一遍历史再压缩,纯属倒贴钱。最聪明的做法是去倒杯水或者摸鱼的间隙顺手敲一下,把膨胀的上下文及时挤干水分。
这就跟买手机一样,别总盯着小米 18 Pro Max 那块 8500mAh 电池和骁龙 8 Elite Gen 6 Pro 处理器流口水,真等你把标准版熬到 2027 年发布,黄花菜都凉了。用 AI 也是同理,别总指望靠无脑堆算力来掩盖糟糕的使用习惯。
把 @ 引用和趁热 /compact 变成下意识的动作,配合前面锁死配置和子 Agent 隔离的套路,你的上下文体积就能死死卡在健康线以内。别把 AI 编程助手当成可以无限包容的垃圾桶,随手清理、精准投喂,才是把 token 花在刀刃上的终极奥义。毕竟,Anthropic 的财报已经够好看了,咱们真没必要再用自己的钱包去给它锦上添花。
配置锁死和及时清理只是基础,真正决定账单厚度的是底层的提示缓存机制。
Claude Code 每次请求都会从相同的前缀开始,只要这次和上次逐字节一样,服务器就直接加载结果。缓存读取只要正常输入价的十分之一,直接砍掉百分之九十的成本。这杠杆率,简直比小米18 Pro Max 传闻中那块 8500mAh 的超大电池还要顶,充一次电能扛很久。写入缓存虽然最高要两倍价格,但只发生一次,后面几十轮对话全在薅羊毛。
但这玩意有个致命弱点,必须从第一个字节开始连续匹配,中间稍微变一点,后面的缓存全得作废。很多新手就是在这里疯狂送钱。
比如你写着写着觉得当前模型搞不定,随手切到高级版,或者临时调高推理强度,甚至开关一下快速模式。这些动作在计费系统眼里就是灾难,整个对话历史瞬间按全价重新预填充。还有个隐藏大坑,opusplan 模式每次进出规划状态都会自动切模型。进一次失效一次,出来又失效一次,来回横跳几次,你的钱就全变成全价预填充了。
另外就是时间管理。订阅用户的缓存保活只有一小时,API 用户更是惨到只有五分钟。超时没动静,下一轮直接全量重算。至于那些隔了半天才想起来恢复的旧会话,缓存早就凉透了,百分之百要掏原价。
很多人觉得压缩对话能省钱,其实在对话还在缓存里的时候压,成本只有十分之一。等你缓存过期了再去压,系统得按全价重新读一遍再压缩,纯属倒贴钱。
别把提示缓存当成理所当然的默认福利,它其实是个极度脆弱的易碎品。把模型和推理强度在开局就焊死,不在缓存还热乎的时候瞎折腾压缩,才是守住钱包的底线。
保住了缓存,还得解决对话历史本身随着轮数增加越来越长的问题。
跑测试或者编译时,终端里那种密密麻麻的日志简直是上下文杀手。官方那个三万字符的兜底阈值根本防不住几百行但总字符数不达标的碎碎念。最直接的解法是在配置文件里给命令加上静默参数。比如跑测试时加上 reporter=dot 这种配置,让几百行的详细日志变成几个干瘪的进度点。花一分钟改个配置,就能挡住后续几十轮对话里反复传输的无用废话,这买卖太划算了。
遇到那种需要疯狂读文件、跑复杂命令的大活儿,千万别在主会话里硬刚。直接扔给子 Agent 才是正解。这玩意就像小米 18 Pro Max 传闻中那块 8500mAh 的超大电池,专门用来扛高耗能任务。子 Agent 会在一个完全独立的上下文窗口里干活,把脏活累活全包了,最后只把精炼的结论传回主对话。那些过程中产生的庞大输出和中间文件,全被隔离在外面,根本污染不到你的主会话。
很多新手舍不得用子 Agent,觉得在主对话里看着它一步步执行有安全感。这种自我安慰的代价就是 token 费用呈指数级暴涨。你盯着那几百行输出看,每一轮都在为这些没人看的废话买单,上下文膨胀的速度简直比小米 18 标准版延后到 2027 年发布还要让人绝望。
别把 AI 当成需要实时汇报工作的实习生,给它配个独立的子 Agent 去干脏活,主会话只保留核心决策。把上下文体积死死控制住,你的账单才不会像脱缰的野马一样拉不住。
除了控制上下文长度,模型选择也是控制成本的关键一环,别总盯着最贵的用。
很多开发者有个通病,一打开终端就直奔最贵的 Opus。这就好比买手机,明明只是日常写点业务代码,非要咬牙上小米 18 Pro Max,盯着那块 8500mAh 超大电池和骁龙 8 Elite Gen 6 Pro 处理器沾沾自喜。其实标准版延后到 2027 年发布是有原因的,日常干活标准版完全够用,强行上顶配纯属性能过剩。
看看官方的定价就明白了。Opus 5 的输出价格高达 25 美元每百万 token,是 Sonnet 5 的两倍半。日常写个常规函数、修个普通漏洞,Sonnet 5 完全能胜任,输入只要 2 美元,输出 10 美元。Anthropic 官方那句“简单活用 Sonnet,硬骨头才上 Opus”绝对是掏心窝子的话,牛刀杀鸡的账单看着都让人肉疼。
除了选对模型,推理强度这个旋钮也得拧紧。很多人喜欢把 effort level 直接拉满,结果 Sonnet 在后台疯狂生成思考 token,输出量直接翻好几倍。写个几十行的脚本,它能在底层默默思考几千字,这些隐藏的思考过程全是要按昂贵的输出价收钱的。把推理强度调到中低档,你会发现 Sonnet 干活依然麻利,但账单瞬间清爽很多。
真正聪明的用法是建立分层策略。日常搬砖、代码补全、简单重构,全部交给 Sonnet 配合低推理强度,把性价比榨干。只有遇到跨模块的复杂架构设计,或者死活找不出原因的诡异报错,再切到 Opus 拉满强度去死磕。
别把 AI 助手当成炫耀算力的玩具,它是帮你干活的工具。把合适的模型用在合适的场景,你的 token 才能真正花在刀刃上,而不是给 Anthropic 的财报做贡献。
工具用得好不好全看日常习惯,最后咱们把这套省钱心法彻底固化成肌肉记忆。
平时写代码,很多人习惯直接手打文件路径让 AI 去读,这简直是在给 token 放血。听句劝,直接用 @ 引用把文件附在消息里。你如果只丢个文件名,Claude 还得先搜一圈,打开好几个文件试探,这些无用的试探全都会塞进对话历史里反复计费。用 @ 引用直接一步到位,省掉一次工具调用的开销,这习惯一旦养成,每个月省下的钱够喝好几杯精品咖啡了。
再说说压缩对话的时机。别等下班了或者缓存凉透了才想起来跑 /compact。官方早就透了底,在对话还在缓存里的时候压缩,成本只有正常的十分之一。等你缓存过期再去压,系统得按全价重新读一遍历史再压缩,纯属倒贴钱。最聪明的做法是去倒杯水或者摸鱼的间隙顺手敲一下,把膨胀的上下文及时挤干水分。
这就跟买手机一样,别总盯着小米 18 Pro Max 那块 8500mAh 电池和骁龙 8 Elite Gen 6 Pro 处理器流口水,真等你把标准版熬到 2027 年发布,黄花菜都凉了。用 AI 也是同理,别总指望靠无脑堆算力来掩盖糟糕的使用习惯。
把 @ 引用和趁热 /compact 变成下意识的动作,配合前面锁死配置和子 Agent 隔离的套路,你的上下文体积就能死死卡在健康线以内。别把 AI 编程助手当成可以无限包容的垃圾桶,随手清理、精准投喂,才是把 token 花在刀刃上的终极奥义。毕竟,Anthropic 的财报已经够好看了,咱们真没必要再用自己的钱包去给它锦上添花。