# 📖 精读报告:Claude Code 省 Token:从可见性到检索路径的工程链路 **一句话总结**:Token 优化不是装一个插件,而是一条「可见性 → 输入压缩 → 输出压缩 → 检索路径」的工程链路,必须先定位瓶颈再对症下药。 **核心论点**:遇到用量见底,换套餐、换模型、要求「回答短一点」都没碰到真正的消耗结构;真正花钱的是反复进入上下文的 git diff、全仓搜索、无关规则与客套输出。 **论证结构**: 1. 先把用量看见:用监控确定瓶颈 —— 论据:Claude Code Usage Monitor 读取本机数据,优先使用官方 statusline 的 rate_limits,本地估算明确标记;价值是把事后才知的消耗变成任务进行中可取舍的信号。 2. 压缩工具输出:少把终端废话塞进上下文 —— 论据:rtk(Rust Token Killer)在 Agent 读取前压缩 stdout:git log 收敛为 hash/作者/标题、测试输出聚焦失败项、长搜索结果按文件归组。 3. 压缩模型输出:让模型少说,不是少想 —— 论据:Caveman 把回答改成短句、要点、路径与命令优先,删除礼貌用语与重复背景,但声明不改变代码、命令与错误文本。 4. 压缩检索路径:别让 Agent 从文件系统里猜答案 —— 论据:CodeGraph 先建本地语义图谱(函数/类/导入/调用链),Agent 通过 MCP 先问「谁调用它」,再读少量目标文件,减少反复 grep 与误读。 5. 不装插件也能立刻做的两件事 —— 论据:定期执行 /context 检查会话装了什么;任务切换用 /clear 开干净会话;审计 CLAUDE.md,把「每次启动都加载的 @引用」改成「任务相关时才读取」,即把常驻知识改成可检索知识。 **论证脉络**:常见误区(换套餐/换模型)→ 消耗结构分析(输入/输出/检索三环节)→ 四个模块逐层展开(监控 → rtk → Caveman → CodeGraph)→ 零成本习惯(/context、/clear、CLAUDE.md 审计)→ 落地清单(症状 → 先做什么 → 不要做什么)。 **核心概念**:rtk(Rust Token Killer:CLI 代理,压缩送入模型的命令输出);Caveman(输出侧压缩插件,通过 SessionStart / UserPromptSubmit hooks 维持模式);CodeGraph(本地语义图谱 + MCP 查询,把代码检索从 grep 变成结构化问答);Usage Monitor(本地 companion,终端监控/预测/导出/状态栏接入)。 **金句摘录**: - “先确认消耗,再定位浪费属于输入、输出还是检索路径,最后只在对应环节加工具。” - “把常驻知识改成可检索知识。尤其是团队共享配置,每一次无关加载都会被每位成员的每轮会话放大。” **批判性思考**: - 各工具的节省数字均来自项目方自己的 benchmark(作者也标注「只作方向性指标」)——你的任务类型下实际能省多少,是否应该先做一周基线测量? - 「默认压缩、失败再显式请求原始输出」的团队策略,在排障时被折叠的关键日志本身会不会成为新的风险? - CodeGraph 的常驻索引对团队是省 token 还是新增运维面?小仓库引入它的收益边界在哪里? --- (来源:https://mp.weixin.qq.com/s/IYIkYcxHgUYWe8VvNd1lnA · 字数:5155 · 深度:deep)