为什么 Compound Engineering 成为我用 Claude Code 的新默认方案
作者在同一个代码库上分别用 GSD 和 Compound Engineering 各跑一周后,把 Claude Code 的默认工作流换成了 Every 的 Compound Engineering 插件。
作者在同一个代码库上分别用 GSD 和 Compound Engineering 各跑一周后,把 Claude Code 的默认工作流换成了 Every 的 Compound Engineering 插件。
OpenAI Codex 产品负责人 Alexander Embiricos 和开发者体验负责人 Romain Huet 在 Behind the Craft 节目中讲述 Codex 团队如何用自己的产品构建产品。
宝玉结合 Claude Code 的提示缓存机制,解释配额为何烧得快,并给出省 Token 的操作规则。他指出缓存只对前缀有效、主智能体缓存窗口 1 小时、子智能体 5 分钟,读取缓存成本约为重新计算的十分之一,因此频繁 /clear 反而会触发全价上下文重建;判断标准是缓存还热、任务没换就继续聊,缓存过期、任务切换或上下文噪音过多才开新会话。
推荐理由:从提示缓存机制出发解释 Claude Code 配额消耗,给出继续会话还是重开的判断条件和可复制的配置。
Sebastian Raschka 撰文拆解编程智能体的六大核心组件:实时代码仓库上下文、提示词形态与缓存复用、工具接入与调用、上下文瘦身、结构化会话记忆,以及任务委派与受限子智能体。
Steve Yegge 宣布 Gas Town 和 Beads 同日发布 v1.0.0。Beads 是面向编码智能体的记忆系统与知识图谱,v1.0 用 Dolt 替换了原先 SQLite + JSONL 的架构,双向同步、三方合并和合并冲突等问题被移除,同时支持嵌入式和服务器模式,本周 GitHub star 数突破 20k。
宝玉针对 Claude Code 源码泄漏后满屏的深度分析文章,提出学习大型开源项目的四步方法:先跑起来、从一个功能点切入、动手做二次开发、最后从零搭建。他认为大多数人卡在看了很多但没动手写过,AI 时代让 AI 分析代码太方便,但这种理解是借来的。
Superpowers 作者 Jesse Vincent 称项目 GitHub star 已超 12 万,随之而来大量由智能体自动提交的低质 PR,仓库 PR 拒绝率达 94%。
推荐理由:Superpowers 作者用 94% PR 拒绝率说明智能体批量提 PR 的现状,并给出可复用的 CLAUDE.md 拦截写法。
Paper Compute 发布面向生产环境 AI 智能体的基础设施,包含 tapes 和 stereOS 两个组件。tapes 是零埋点的可观测层,以反向代理形式部署在智能体与推理服务之间,无需 SDK 或改代码,只需一个环境变量,即可捕获并生成可验证、防篡改的执行记录,并支持异常检测。
过去一周有攻击者接连投毒多个开源包,从 Trivy 开始,波及 Telnyx(受影响包约 15 万次/周下载)、LiteLLM(约 2200 万次/周)以及 3 月 31 日被攻击的 axios npm 包(至少 1 亿次/周下载),恶意版本会植入木马窃取安装机器的敏感数据。
作者把一句要求证明影响或可利用性的红队提示词交给 Codex,在 Rust crate intaglio 中发现 intern 实现的 unwind 安全问题。
推荐理由:作者用一个极简提示词让 Codex 在 Rust crate 中找出真实漏洞并走完修复与披露流程,可借鉴的是把标准定在可复现而非猜测。
据 BeyondTrust Phantom Labs 演示,攻击者可通过恶意 GitHub 分支名(含不可见 Unicode 填充隐藏 payload)构造命令注入路径,从 Codex 容器中窃取 GitHub OAuth token,波及已连接的源代码和组织仓库。
飞书开源命令行工具 lark-cli,让 AI Agent 直接发消息、查日历、写文档、建多维表格、发邮件和管理任务,安装方式为 npm install -g @larksuite/cli 加 npx skills add https://github.com/larksuite/cli -y -g。
Notion 联合创始人 Simon Last 在 No Priors 播客访谈中表示,他从 2025 年夏天起不再手写代码,个人纪录是一个编码 Agent 连续运行 13 天。
作者 Drew Breunig 借用 Eric S. Raymond 的《大教堂与集市》提出第三种软件开发模式 Winchester Mystery House,指开发者用 AI 智能体为自己搭建高度个人化、不断扩张的工具。
作者两次在 pokemon-kafka 和 sweeper 两个项目中调试 Confluent Cloud 的 Kafka 配置,先后遇到 Unknown Topic Or Partition 和 SASL 认证错误,于是用 tapes skill generate 读取本地 SQLite 中的会话记录,生成 confluent-cloud-setup 这个 Skill。
UC San Diego 研究团队通过 13 场实地观察和 99 名资深开发者的问卷(共 112 人,中位经验 10 年,使用 Claude Code、Cursor、GitHub Copilot、Windsurf)发现,专业开发者并不 vibe coding,而是通过规划和监督严格控制智能体。
TeamPCP 通过被污染的 Trivy GitHub Action 劫持 LiteLLM 的 CI/CD 流水线,窃取 PyPI 发布凭证后发布了带后门的 LiteLLM 1.82.7 和 1.82.8。
推荐理由:复盘 LiteLLM 被投毒事件的三阶段攻击链与 .pth 持久化机制,可帮助排查自身 CI/CD 与 Kubernetes 风险。
awesome-mcp-servers 维护者发现 PR 量从每天几条涨到 20、50 条以上,且描述模板化、缺乏真人语气,于是按 Discord 用户的玩笑建议,在 CONTRIBUTING.md 中加入一段提示注入,要求自动化智能体在 PR 标题末尾加 🤖🤖🤖 以换取快速合并。
Google 工程师开源了面向 Linux 内核的智能体 AI 代码审查系统 Sashiko,此前已在 Google 内部使用,现覆盖 Linux 内核邮件列表的全部提交。
作者认为多数 AGENTS.md 写得太长,把编码规范、架构决策、产品背景全塞进一个文件,而 LLM 每次启动任务都要读一遍,大部分内容与当前工作无关。他建议把 AGENTS.md 控制在约 100 行,只作为目录链接到 docs/ 下的架构、规范、测试等文档和产品背景文档,让智能体按任务自行拉取所需内容。
Gumloop 联合创始人兼 CEO Max Brodeur-Urbas 在访谈中讲述,他因在美加边境被遣返并附带 5 年入境禁令,被迫在温哥华卧室创业,从 AutoGPT 的简单 UI 项目 AgentHub 起步,最终做成日处理 400 万工作流的自动化平台 Gumloop。
作者用 Claude Code 辅助,把主力工作站从 Windows 迁到 Fedora,并用 Wine 运行原本兼容性被评为 garbage 的 Airflow。
作者让智能体在 stereOS 虚拟机里用 PyBoy 无头运行宝可梦红,速度约为实时的 100 倍,智能体自己输出 NAV、BATTLE、BACKTRACK 等日志前缀,这些日志经 tapes 代理流入 Kafka,再由 Flink SQL 做 STUCK_LOOP、TOKEN_SPIKE 异常检测,JSONL 与 DuckDB 负责跨会话查询。
推荐理由:作者用终端里跑宝可梦的智能体做实验,展示日志如何变成跨会话的观测记忆并反哺下一轮运行。
一份运营者报告称,AI 辅助编码工具生成的 Next.js 应用固定了一个存在漏洞的依赖,该漏洞随后通过 CVE-2025-29927 被利用。部署后自动化扫描器访问了本应由中间件保护的内部端点,生产服务器上运行起挖矿程序。报告认为,引入已知严重依赖风险的 PR 在发布前应经过审批路径,而运行时利用仍需漏洞扫描和环境隔离。
Bassim Eledath 把 AI 辅助编程的实践路径划分为 8 个等级,从 Tab 补全、智能体 IDE,到上下文工程、复合工程、MCP 与技能、Harness Engineering、后台智能体,最后到自主智能体团队。
推荐理由:作者把 AI 辅助编程从 Tab 补全到自主智能体团队划成 8 个等级,读者可据此定位自己团队所处阶段。
作者 Geoffrey Huntley 给出用 Ralph loop 迁移代码库的方法:先跑一个 loop,让子智能体逐个研究 tests/* 下的文件,把测试压缩成 /specs/*.md 规格文档;再跑一个 loop 研究 src/* 下每个文件,同样把实现以引用形式写进规格。
Anthropic 为 Opus 4.6 和 Sonnet 4.6 推出 1M 上下文窗口正式版,作者实测约 500K token 的 Claude Code 会话仍能保持任务连贯。
作者 Ryan Lopopolo 以给东京办公室内部 alpha 应用加日语支持为例,说明在智能体辅助下,这类工作不再需要占用路线图时间,而是作为后台任务完成。
作者 Ryan Lopopolo 提出智能体利用率是新的性能天花板,认为模型智能要转化为工程产出,取决于智能体在整个软件生命周期中被允许做多少事。他给出的数据是 2026 年 3 月使用 GPT-5.2 时,无 Symphony 每人每天 3-5 个 PR,接入 Symphony 后每人每周约 75 个 PR,差别来自 Symphony 让智能体保持忙碌。
Ryan Lopopolo 以 Symphony 为例提出,代码不应被视为最终产物,规范才是分发物。Symphony 是一个基于 issue tracker 的智能体编排系统,先以 SPEC.md 形式分发,Elixir 参考实现只是衍生产物,README 邀请读者把 SPEC.md 交给自己的编码智能体,用任意语言重建。
推荐理由:作者用 Symphony 的 spec 蒸馏循环说明代码只是可替换产物,为规范驱动开发提供了一条可迁移的路径。
作者认为,软件组织一直把人的实现时间当作稀缺投入,智能体打破了这个假设,因此策略必须可执行、验证必须随实现规模扩展。他以在大型 TypeScript 代码库开启 ESLint 的 no-await-in-loop 规则为例,发现 600 处违规,过去这需要昂贵的迁移,现在一个 PR 就能完成修复并补齐测试覆盖。
推荐理由:作者以开启 ESLint 规则、迁移 600 处违规的亲身实践,说明智能体时代实现成本下降后,约束与验证为何成为新的稀缺环节。
作者在 Hacker News 分享生产环境中缓解提示词注入的多层做法。输入侧包括在系统提示词中强制角色边界、在 API 层用独立的 user 角色隔离用户内容与系统指令、对工具调用参数在执行前做 schema 校验;输出侧则用评估指标对模型输出打分,检查事实正确性、指令遵循与安全性,RAG 场景还要验证答案确实基于检索到的上下文。
作者构建的宝可梦红版自主 Agent 跑了 1000 回合仍停在卧室,原因是它把背景瓦片图地址 0xC4F2 当成文本框状态标志,一直按 A 键却不知道卡住。
推荐理由:作者用 1000 回合卡在卧室的失败复盘,说明记录并回放 Agent 会话状态比改提示词更能定位静默故障。
Superpowers 5 发布,作者称最喜欢的改动是 Visual Brainstorming 伴随工具,它会在智能体认为有内容需要展示时提示用户,通过本地 web 服务器加载智能体写出的 HTML 片段,并把浏览器里的点击和反馈回传给智能体,以替代 Claude 常生成的 ASCII 图。
推荐理由:作者是 Superpowers 维护者,文中说明了 5.0 的视觉头脑风暴、spec 评审循环和子智能体开发三项变化,可据此判断是否值得接入现有工作流。
OpenAI 用 Codex 配合仓库内的 Skills、AGENTS.md 和 GitHub Actions 维护 Agents SDK 仓库,把验证、发布准备、示例集成测试和 PR 评审变成可重复流程。
推荐理由:OpenAI 官方公开了用 Skills、AGENTS.md 和 GitHub Action 维护 Agents SDK 仓库的完整配置,可迁移到其他开源项目。
ETH Zurich 团队构建 AGENTbench,用 138 个来自小众仓库的真实 Python 任务,测试 Claude 3.5 Sonnet、Codex GPT-5.2、GPT-5.1 mini 和 Qwen Code 在无上下文文件、LLM 生成文件、人工编写文件三种场景下的表现。
Drew Breunig 在 MLOps Community 的 Coding Agents 会议上分享了他构建无代码库 whenwords 的经验,并提出规范驱动开发不是单向方程而是三角反馈循环:写代码会反过来改进规范和测试。
Martin Fowler 提出人类在 AI 辅助软件开发中应处于 on the loop 而非 in the loop,即构建和管理工作循环,而不是逐行检查智能体产出的代码。
作者在 Claude Code 中设计 Postgres 集成时会话崩溃,上下文窗口关闭导致一小时的设计工作全部丢失,靠此前用 tapes 代理写入本地 SQLite 的请求响应记录才重建了上下文。
stereOS 是一个基于 Linux 的操作系统,把 AI 编码智能体跑在各自独立的沙箱虚拟机里,每个智能体拥有独立内核、内存和磁盘,与宿主机不共享任何资源。它采用完整虚拟机而非 Firecracker、Cloud Hypervisor 等 microVM,以保留安全启动、GPU 直通和嵌套虚拟化能力,并称热 VM 可在 70ms 内让智能体执行首个有效动作。