Spotify 用 shunt 插件把 Claude Code 的 token 消耗降低约 90%
原文标题:Spotify показал, как сократить расход Claude Code примерно на 90% — и идея тут на самом деле очень правильная.Проблема простая: огромная часть работы coding-агента — вообще не reasoning.Claude читает 5 больших файлов, чтобы найти один метод. Читает тысячи строк тестов, чтобы понять паттерн. Генерирует boilerplate, конфиги, стабы. И на всё это тратятся дорогие frontier-токены.В Spotify сделали плагин shunt, который буквально отбирает такую работу у Claude.Схема примерно такая:Claude Code → router → дешёвая модель → ClaudeОни сделали два worker-а через Portal/AiKA:→ bulk-reader — скармливаешь ему большие файлы, назад Claude получает только короткую структурированную выжимку;→ code-writer — генерирует тесты, конфиги, type stubs и другой предсказуемый код по существующему reference-файлу.В примере worker-модель — Gemini 2.5 Flash.Самое интересное — routing сделан не промптом в CLAUDE.md.Плагин использует PreToolUse hooks Claude Code. Если Claude пытается целиком прочитать файл больше 350 с
Spotify 开源插件 shunt,通过 Claude Code 的 PreToolUse hooks 拦截超过 350 行的整文件读取,把 Read 以及 cat。
Spotify 用 PreToolUse Hook 把大文件读取和样板代码生成转给廉价模型,给出可迁移的成本拆分思路。
Spotify 展示了如何把 Claude Code 的开销降低约 90%——这个思路其实非常对。
问题很简单:编程智能体干的活里,很大一部分根本不算推理。
Claude 要读 5 个大文件才能找到一个方法,要读几千行测试才能摸清一个模式,还要生成样板代码、配置、桩代码。这些全都在烧昂贵的前沿模型 token。
Spotify 做了个插件 shunt,就是把这些活从 Claude 手里拿走。
大致流程是这样:
Claude Code → 路由器 → 便宜模型 → Claude
他们通过 Portal/AiKA 做了两个 worker:
→ bulk-reader:把大文件喂给它,Claude 只拿回一份简短的结构化摘要;
→ code-writer:照着已有的 reference 文件,生成测试、配置、type stub 这类可预测的代码。
示例里 worker 用的是 Gemini 2.5 Flash。
最有意思的是,路由不是靠 CLAUDE.md 里的提示词做的。
插件用的是 Claude Code 的 PreToolUse hook。只要 Claude 想一次性读取超过 350 行的文件,hook 就会拦下 Read,把它转给 bulk-reader。cat、head、tail、less、more 也一样会被拦。
但读取文件里某个具体片段这种定向读取,是放行的。
也就是说,前沿模型从机制上就没法无意义地吞上下文。
在一个 162K 行的 Java 单体仓库上,结果是:
→ 大文件:33 684 → 5 737 tokens,−82%
→ 源码 + 测试:75 990 → 4 148,−94%
→ 多服务分析:16 221 → 821,−94%
bulk-read 平均能省下约 90% 的 Claude token。
但这里有个重要的前提:这不代表推理的总 token 量便宜了 90%。大上下文还是得 Gemini Flash 来读。你只是不再用前沿模型去为那些小模型完全能干的活付费。
我觉得这正是接下来 agentic coding 最重要的架构思路之一。
前沿模型不该包揽所有活,它该负责调度。
推理、调试、架构、复杂决策 → Claude。
搜索、读取、摘要、样板代码、各种转换 → 便宜的专用模型。
而且 Spotify 特别提到,把推理也交给 worker 效果很差:worker 漏掉了一个很隐蔽的线程安全 bug,Claude 一眼就找出来了。所以他们按任务难度来分工,而不是简单拿便宜模型替换 Claude。
本质上,这已经不是“一个 AI 编程智能体”,而是 harness 里的一套小型模型层级。
我觉得接下来 Codex / Claude Code / Kimi / OpenCode 这些迟早都会走到这一步:前沿模型在上面,下面挂一堆便宜的专用 worker。
毕竟什么都往 Opus/Sol 里塞,就跟招个 principal engineer 让他整天跑 grep 差不多。
https://engineering.atspotify.com/2026/9/portal-by-spotify-cut-my-claude-code-token-usage-by-90
来源:AI Coder · Telegram · t.me