为什么 Compound Engineering 成为我用 Claude Code 的新默认方案
作者在同一个代码库上分别用 GSD 和 Compound Engineering 各跑一周后,把 Claude Code 的默认工作流换成了 Every 的 Compound Engineering 插件。
Awaiting translation
作者在同一个代码库上分别用 GSD 和 Compound Engineering 各跑一周后,把 Claude Code 的默认工作流换成了 Every 的 Compound Engineering 插件。
Awaiting translation
OpenAI Codex 产品负责人 Alexander Embiricos 和开发者体验负责人 Romain Huet 在 Behind the Craft 节目中讲述 Codex 团队如何用自己的产品构建产品。
Awaiting translation
Baoyu walks through Claude Code's prompt caching mechanism to explain why quotas burn so fast, and lays out rules for saving tokens. He points out that caching only applies to prefixes, the main agent's cache window is 1 hour, and sub-agents' is 5 minutes. Reading from cache costs about one-tenth of recomputing, so frequent /clear actually triggers a full-price context rebuild. The rule of thumb: if the cache is still warm and the task hasn't changed, keep chatting; only start a new session when the cache has expired, the task has shifted, or there's too much context noise.
Why it matters: Starting from the prompt caching mechanism, this explains Claude Code's quota consumption and gives the criteria for deciding whether to continue a session or start over, plus configuration you can copy.
Sebastian Raschka 撰文拆解编程智能体的六大核心组件:实时代码仓库上下文、提示词形态与缓存复用、工具接入与调用、上下文瘦身、结构化会话记忆,以及任务委派与受限子智能体。
Awaiting translation
Steve Yegge 宣布 Gas Town 和 Beads 同日发布 v1.0.0。Beads 是面向编码智能体的记忆系统与知识图谱,v1.0 用 Dolt 替换了原先 SQLite + JSONL 的架构,双向同步、三方合并和合并冲突等问题被移除,同时支持嵌入式和服务器模式,本周 GitHub star 数突破 20k。
Awaiting translation
宝玉针对 Claude Code 源码泄漏后满屏的深度分析文章,提出学习大型开源项目的四步方法:先跑起来、从一个功能点切入、动手做二次开发、最后从零搭建。他认为大多数人卡在看了很多但没动手写过,AI 时代让 AI 分析代码太方便,但这种理解是借来的。
Awaiting translation
Superpowers 作者 Jesse Vincent 称项目 GitHub star 已超 12 万,随之而来大量由智能体自动提交的低质 PR,仓库 PR 拒绝率达 94%。
Awaiting translation
Why it matters: Superpowers 作者用 94% PR 拒绝率说明智能体批量提 PR 的现状,并给出可复用的 CLAUDE.md 拦截写法。
Paper Compute 发布面向生产环境 AI 智能体的基础设施,包含 tapes 和 stereOS 两个组件。tapes 是零埋点的可观测层,以反向代理形式部署在智能体与推理服务之间,无需 SDK 或改代码,只需一个环境变量,即可捕获并生成可验证、防篡改的执行记录,并支持异常检测。
Awaiting translation
过去一周有攻击者接连投毒多个开源包,从 Trivy 开始,波及 Telnyx(受影响包约 15 万次/周下载)、LiteLLM(约 2200 万次/周)以及 3 月 31 日被攻击的 axios npm 包(至少 1 亿次/周下载),恶意版本会植入木马窃取安装机器的敏感数据。
Awaiting translation
作者把一句要求证明影响或可利用性的红队提示词交给 Codex,在 Rust crate intaglio 中发现 intern 实现的 unwind 安全问题。
Awaiting translation
Why it matters: 作者用一个极简提示词让 Codex 在 Rust crate 中找出真实漏洞并走完修复与披露流程,可借鉴的是把标准定在可复现而非猜测。
据 BeyondTrust Phantom Labs 演示,攻击者可通过恶意 GitHub 分支名(含不可见 Unicode 填充隐藏 payload)构造命令注入路径,从 Codex 容器中窃取 GitHub OAuth token,波及已连接的源代码和组织仓库。
Awaiting translation
飞书开源命令行工具 lark-cli,让 AI Agent 直接发消息、查日历、写文档、建多维表格、发邮件和管理任务,安装方式为 npm install -g @larksuite/cli 加 npx skills add https://github.com/larksuite/cli -y -g。
Awaiting translation
Notion 联合创始人 Simon Last 在 No Priors 播客访谈中表示,他从 2025 年夏天起不再手写代码,个人纪录是一个编码 Agent 连续运行 13 天。
Awaiting translation
作者 Drew Breunig 借用 Eric S. Raymond 的《大教堂与集市》提出第三种软件开发模式 Winchester Mystery House,指开发者用 AI 智能体为自己搭建高度个人化、不断扩张的工具。
Awaiting translation
作者两次在 pokemon-kafka 和 sweeper 两个项目中调试 Confluent Cloud 的 Kafka 配置,先后遇到 Unknown Topic Or Partition 和 SASL 认证错误,于是用 tapes skill generate 读取本地 SQLite 中的会话记录,生成 confluent-cloud-setup 这个 Skill。
Awaiting translation
UC San Diego 研究团队通过 13 场实地观察和 99 名资深开发者的问卷(共 112 人,中位经验 10 年,使用 Claude Code、Cursor、GitHub Copilot、Windsurf)发现,专业开发者并不 vibe coding,而是通过规划和监督严格控制智能体。
Awaiting translation
TeamPCP 通过被污染的 Trivy GitHub Action 劫持 LiteLLM 的 CI/CD 流水线,窃取 PyPI 发布凭证后发布了带后门的 LiteLLM 1.82.7 和 1.82.8。
Awaiting translation
Why it matters: 复盘 LiteLLM 被投毒事件的三阶段攻击链与 .pth 持久化机制,可帮助排查自身 CI/CD 与 Kubernetes 风险。
awesome-mcp-servers 维护者发现 PR 量从每天几条涨到 20、50 条以上,且描述模板化、缺乏真人语气,于是按 Discord 用户的玩笑建议,在 CONTRIBUTING.md 中加入一段提示注入,要求自动化智能体在 PR 标题末尾加 🤖🤖🤖 以换取快速合并。
Awaiting translation
Google 工程师开源了面向 Linux 内核的智能体 AI 代码审查系统 Sashiko,此前已在 Google 内部使用,现覆盖 Linux 内核邮件列表的全部提交。
Awaiting translation
作者认为多数 AGENTS.md 写得太长,把编码规范、架构决策、产品背景全塞进一个文件,而 LLM 每次启动任务都要读一遍,大部分内容与当前工作无关。他建议把 AGENTS.md 控制在约 100 行,只作为目录链接到 docs/ 下的架构、规范、测试等文档和产品背景文档,让智能体按任务自行拉取所需内容。
Awaiting translation
Gumloop 联合创始人兼 CEO Max Brodeur-Urbas 在访谈中讲述,他因在美加边境被遣返并附带 5 年入境禁令,被迫在温哥华卧室创业,从 AutoGPT 的简单 UI 项目 AgentHub 起步,最终做成日处理 400 万工作流的自动化平台 Gumloop。
Awaiting translation
作者用 Claude Code 辅助,把主力工作站从 Windows 迁到 Fedora,并用 Wine 运行原本兼容性被评为 garbage 的 Airflow。
Awaiting translation
作者让智能体在 stereOS 虚拟机里用 PyBoy 无头运行宝可梦红,速度约为实时的 100 倍,智能体自己输出 NAV、BATTLE、BACKTRACK 等日志前缀,这些日志经 tapes 代理流入 Kafka,再由 Flink SQL 做 STUCK_LOOP、TOKEN_SPIKE 异常检测,JSONL 与 DuckDB 负责跨会话查询。
Awaiting translation
Why it matters: 作者用终端里跑宝可梦的智能体做实验,展示日志如何变成跨会话的观测记忆并反哺下一轮运行。
一份运营者报告称,AI 辅助编码工具生成的 Next.js 应用固定了一个存在漏洞的依赖,该漏洞随后通过 CVE-2025-29927 被利用。部署后自动化扫描器访问了本应由中间件保护的内部端点,生产服务器上运行起挖矿程序。报告认为,引入已知严重依赖风险的 PR 在发布前应经过审批路径,而运行时利用仍需漏洞扫描和环境隔离。
Awaiting translation
Bassim Eledath breaks the practical path of AI-assisted programming into 8 levels, from tab completion and agentic IDEs to context engineering, compound engineering, MCP and Skills, Harness Engineering, background agents, and finally autonomous agent teams.
Why it matters: The author lays out AI-assisted programming as 8 levels, from tab completion to autonomous agent teams, so readers can figure out where their own team stands.
作者 Geoffrey Huntley 给出用 Ralph loop 迁移代码库的方法:先跑一个 loop,让子智能体逐个研究 tests/* 下的文件,把测试压缩成 /specs/*.md 规格文档;再跑一个 loop 研究 src/* 下每个文件,同样把实现以引用形式写进规格。
Awaiting translation
Anthropic 为 Opus 4.6 和 Sonnet 4.6 推出 1M 上下文窗口正式版,作者实测约 500K token 的 Claude Code 会话仍能保持任务连贯。
Awaiting translation
作者 Ryan Lopopolo 以给东京办公室内部 alpha 应用加日语支持为例,说明在智能体辅助下,这类工作不再需要占用路线图时间,而是作为后台任务完成。
Awaiting translation
作者 Ryan Lopopolo 提出智能体利用率是新的性能天花板,认为模型智能要转化为工程产出,取决于智能体在整个软件生命周期中被允许做多少事。他给出的数据是 2026 年 3 月使用 GPT-5.2 时,无 Symphony 每人每天 3-5 个 PR,接入 Symphony 后每人每周约 75 个 PR,差别来自 Symphony 让智能体保持忙碌。
Awaiting translation
Ryan Lopopolo 以 Symphony 为例提出,代码不应被视为最终产物,规范才是分发物。Symphony 是一个基于 issue tracker 的智能体编排系统,先以 SPEC.md 形式分发,Elixir 参考实现只是衍生产物,README 邀请读者把 SPEC.md 交给自己的编码智能体,用任意语言重建。
Awaiting translation
Why it matters: 作者用 Symphony 的 spec 蒸馏循环说明代码只是可替换产物,为规范驱动开发提供了一条可迁移的路径。
作者认为,软件组织一直把人的实现时间当作稀缺投入,智能体打破了这个假设,因此策略必须可执行、验证必须随实现规模扩展。他以在大型 TypeScript 代码库开启 ESLint 的 no-await-in-loop 规则为例,发现 600 处违规,过去这需要昂贵的迁移,现在一个 PR 就能完成修复并补齐测试覆盖。
Awaiting translation
Why it matters: 作者以开启 ESLint 规则、迁移 600 处违规的亲身实践,说明智能体时代实现成本下降后,约束与验证为何成为新的稀缺环节。
作者在 Hacker News 分享生产环境中缓解提示词注入的多层做法。输入侧包括在系统提示词中强制角色边界、在 API 层用独立的 user 角色隔离用户内容与系统指令、对工具调用参数在执行前做 schema 校验;输出侧则用评估指标对模型输出打分,检查事实正确性、指令遵循与安全性,RAG 场景还要验证答案确实基于检索到的上下文。
Awaiting translation
作者构建的宝可梦红版自主 Agent 跑了 1000 回合仍停在卧室,原因是它把背景瓦片图地址 0xC4F2 当成文本框状态标志,一直按 A 键却不知道卡住。
Awaiting translation
Why it matters: 作者用 1000 回合卡在卧室的失败复盘,说明记录并回放 Agent 会话状态比改提示词更能定位静默故障。
Superpowers 5 发布,作者称最喜欢的改动是 Visual Brainstorming 伴随工具,它会在智能体认为有内容需要展示时提示用户,通过本地 web 服务器加载智能体写出的 HTML 片段,并把浏览器里的点击和反馈回传给智能体,以替代 Claude 常生成的 ASCII 图。
Awaiting translation
Why it matters: 作者是 Superpowers 维护者,文中说明了 5.0 的视觉头脑风暴、spec 评审循环和子智能体开发三项变化,可据此判断是否值得接入现有工作流。
OpenAI 用 Codex 配合仓库内的 Skills、AGENTS.md 和 GitHub Actions 维护 Agents SDK 仓库,把验证、发布准备、示例集成测试和 PR 评审变成可重复流程。
Awaiting translation
Why it matters: OpenAI 官方公开了用 Skills、AGENTS.md 和 GitHub Action 维护 Agents SDK 仓库的完整配置,可迁移到其他开源项目。
ETH Zurich 团队构建 AGENTbench,用 138 个来自小众仓库的真实 Python 任务,测试 Claude 3.5 Sonnet、Codex GPT-5.2、GPT-5.1 mini 和 Qwen Code 在无上下文文件、LLM 生成文件、人工编写文件三种场景下的表现。
Awaiting translation
Drew Breunig 在 MLOps Community 的 Coding Agents 会议上分享了他构建无代码库 whenwords 的经验,并提出规范驱动开发不是单向方程而是三角反馈循环:写代码会反过来改进规范和测试。
Awaiting translation
Martin Fowler 提出人类在 AI 辅助软件开发中应处于 on the loop 而非 in the loop,即构建和管理工作循环,而不是逐行检查智能体产出的代码。
Awaiting translation
作者在 Claude Code 中设计 Postgres 集成时会话崩溃,上下文窗口关闭导致一小时的设计工作全部丢失,靠此前用 tapes 代理写入本地 SQLite 的请求响应记录才重建了上下文。
Awaiting translation
stereOS 是一个基于 Linux 的操作系统,把 AI 编码智能体跑在各自独立的沙箱虚拟机里,每个智能体拥有独立内核、内存和磁盘,与宿主机不共享任何资源。它采用完整虚拟机而非 Firecracker、Cloud Hypervisor 等 microVM,以保留安全启动、GPU 直通和嵌套虚拟化能力,并称热 VM 可在 70ms 内让智能体执行首个有效动作。
Awaiting translation