花掉 8.5 万美元 token 后,我在 Lovable 扩展智能体编程的经验
Lovable 一名工程师从今年 1 月到 6 月把个人 token 花费从每月约 600 美元推到 5 月的约 2.5 万美元、累计约 8.5 万美元,同时把每周合并 PR 数从 20-30 个提升到 150 个以上。
推荐理由:作者公开了自己每月约 2.5 万美元 token 的智能体开发配置,包括风险分级、多智能体评审和上下文管理,可迁移到其他团队。
Subagent、并行 Agent、Agent 团队的编排方法和经验。
Lovable 一名工程师从今年 1 月到 6 月把个人 token 花费从每月约 600 美元推到 5 月的约 2.5 万美元、累计约 8.5 万美元,同时把每周合并 PR 数从 20-30 个提升到 150 个以上。
推荐理由:作者公开了自己每月约 2.5 万美元 token 的智能体开发配置,包括风险分级、多智能体评审和上下文管理,可迁移到其他团队。
Terminal-Bench 发布 Challenges,一种长周期、高 token 消耗的单任务基准,要求智能体在无时间与资源限制下自主完成整个项目,首批开放三个挑战。
推荐理由:Terminal-Bench 官方推出长周期单任务基准,并公开三个挑战的实测失败模式,可供评估智能体长时自主能力时参考。
Augment 在 Cosmos 平台推出 Project Builder,这个 Cosmos expert 能把一句功能描述变成基于真实代码库的设计文档,经人工评审后编排 worker agent 完成实现并推进到合并。
推荐理由:Augment 官方披露 Project Builder 的设计评审与编排流程,以及三个生产项目的代码量和上线周期,可据此判断设计先行加智能体编排的可行性。
Anthropic 在 Claude Code 中发布动态工作流,Claude 可针对具体任务即时编写自己的 harness,并支持分享和复用。工作流通过 agent()、parallel()、pipeline() 等函数编排子智能体,可指定每个智能体使用的模型和是否在独立 worktree 中运行,中断后恢复会话能接着执行。
推荐理由:Anthropic 团队拆解动态工作流的六种编排模式与适用边界,可迁移到多智能体任务设计。
Cloudflare 基于开源编码智能体 OpenCode 搭建 CI 原生的 AI 代码评审系统,用协调智能体调度最多 7 个按安全、性能、代码质量、文档、发布、内部规范划分的专职评审智能体,去重后只发一条结构化评审评论。
推荐理由:Cloudflare 公开了 CI 内多智能体代码评审的插件架构、风险分级与成本数据,可迁移到自建评审流水线。
Augment 把内部 Cosmos 平台的 Incident Investigator 专家接入 Slack 和 PagerDuty,对每条告警自动做分诊和根因分析,并给出代码修复、回滚、升级或仅监控四种处置建议,人只需审阅 RCA 并做判断。
推荐理由:Augment 公开了用 Cosmos Expert 接管告警排查的完整做法与前后一个月数据,可迁移到自家值班流程。
Anthropic 的 Claude Code 创建者 Boris Cherny 在红杉 AI Ascent 访谈中称,他整个 2026 年没写过一行代码,每天合并几十个 PR,单日记录 150 个,工作大多从手机完成,常驻 5 到 10 个 session、几百个 Agent,夜里还有几千个在跑深度任务。
推荐理由:Boris Cherny 复盘 Claude Code 从孵化到十亿美元营收的路径,并给出编程被解决、SaaS 护城河被抹平、组织流程才是领先点等判断。
作者分析 Claude Code 源码泄露后流出的架构,认为其核心并非秘密算法,而是一个不到 30 行 Python 的 while 循环加工具字典,由 stop_reason !
推荐理由:作者从泄露源码中提炼出 12 个可组合的智能体工程模式,并给出四周上手路径,适合对照自己的实现查漏。
作者让智能体在 stereOS 虚拟机里用 PyBoy 无头运行宝可梦红,速度约为实时的 100 倍,智能体自己输出 NAV、BATTLE、BACKTRACK 等日志前缀,这些日志经 tapes 代理流入 Kafka,再由 Flink SQL 做 STUCK_LOOP、TOKEN_SPIKE 异常检测,JSONL 与 DuckDB 负责跨会话查询。
推荐理由:作者用终端里跑宝可梦的智能体做实验,展示日志如何变成跨会话的观测记忆并反哺下一轮运行。
Bassim Eledath 把 AI 辅助编程的实践路径划分为 8 个等级,从 Tab 补全、智能体 IDE,到上下文工程、复合工程、MCP 与技能、Harness Engineering、后台智能体,最后到自主智能体团队。
推荐理由:作者把 AI 辅助编程从 Tab 补全到自主智能体团队划成 8 个等级,读者可据此定位自己团队所处阶段。
Superpowers 5 发布,作者称最喜欢的改动是 Visual Brainstorming 伴随工具,它会在智能体认为有内容需要展示时提示用户,通过本地 web 服务器加载智能体写出的 HTML 片段,并把浏览器里的点击和反馈回传给智能体,以替代 Claude 常生成的 ASCII 图。
推荐理由:作者是 Superpowers 维护者,文中说明了 5.0 的视觉头脑风暴、spec 评审循环和子智能体开发三项变化,可据此判断是否值得接入现有工作流。
Lovable 的基础设施团队公开了其 LLM 供应商负载均衡方案,用于在峰值每分钟超过十亿 token 的流量下避免“model provider unavailable”。
推荐理由:Lovable 公开了每分钟十亿 token 规模下的多供应商负载均衡方案,可借鉴其用 PID 控制器和项目级粘性保住 prompt caching 的做法。
作者 Jesse Vincent 发布 Superpowers,一套基于 Claude Code 新插件系统的 Skill 集合,安装后通过 session-start hook 注入引导提示,让 Claude 主动搜索并使用 Skill。
推荐理由:作者把自用的编码智能体工作流打包成可安装的 Skill 插件,读者能直接复用其头脑风暴到 TDD 的实现流程。
作者记录了自己用 Claude Code 的完整流程:先用 git worktree 隔离任务,再用 brainstorming 提示词让 Claude 一次只问一个问题并分段确认设计,随后用 planning 提示词把计划拆成小任务写入 docs/plans/。
推荐理由:作者把 Claude Code 拆成架构师与实现者两个会话,并给出可复用的提示词和 git worktree 隔离做法。
Anthropic 应用 AI 团队撰文提出,上下文工程是提示词工程的延续,核心是在有限注意力预算下挑选最小的高信号 token 集合。
推荐理由:Anthropic 官方给出上下文工程的系统方法,含压缩、笔记与子智能体三种长任务策略的取舍。
Lance Martin 撰文把智能体的上下文工程归纳为四类策略:写入(用 scratchpad、记忆把信息存到上下文窗口之外)、选择(按需拉入记忆、工具描述和知识)。
推荐理由:文章把智能体上下文管理归纳为写入、选择、压缩、隔离四类策略,并给出各家产品的具体做法,便于对照现有工作流。