编程智能体的四种提示词模式:plan mode、skills 与保存的提示词
文章从 Claude Code、Codex 和 Gemini CLI 的官方文档中整理出四种提示词模式:先计划再编辑、给智能体一个可运行的检查、让智能体反过来访谈你、把反复重打的提示词存成文件,并给出各家对应的命令、参数和文件格式。
推荐理由:横向对照 Claude Code、Codex、Gemini CLI 三家文档,给出计划模式、可运行检查、访谈式提问和保存提示词四种模式的命令与文件格式。
最佳实践、可复现的工作流和带命令、配置的教程。
文章从 Claude Code、Codex 和 Gemini CLI 的官方文档中整理出四种提示词模式:先计划再编辑、给智能体一个可运行的检查、让智能体反过来访谈你、把反复重打的提示词存成文件,并给出各家对应的命令、参数和文件格式。
推荐理由:横向对照 Claude Code、Codex、Gemini CLI 三家文档,给出计划模式、可运行检查、访谈式提问和保存提示词四种模式的命令与文件格式。
一个六人移动端团队用 Cursor 的 hooks、safe-list 和 Telegram 机器人,把项目约定从提示词变成运行时强制。
推荐理由:作者把 Cursor 的 hooks、safe-list 和 Telegram 机器人串成一套可复用的团队协作方案,读者能据此判断哪些约束该交给运行时而非提示词。
Cursor 工程师 Lauren Tan 分享了她让 AI 智能体自主提交并合并 PR 的方法:核心是验证能力,即让智能体自己跑代码、抓 CPU 追踪、打开 iOS 模拟器来检查工作结果。
推荐理由:Cursor 工程师把对 AI 智能体的信任拆成可复用的验证 Skill、feature map 与 evals,读者可据此搭建自己的自动化验证流程。
Spotify 开源插件 shunt,通过 Claude Code 的 PreToolUse hooks 拦截超过 350 行的整文件读取,把 Read 以及 cat。
推荐理由:Spotify 用 PreToolUse Hook 把大文件读取和样板代码生成转给廉价模型,给出可迁移的成本拆分思路。
作者提出用六段式 spec 模板(Goal、Non-goals、Interfaces、Files、Verification、Budget)向编码智能体描述任务,并配了一个在交给智能体前检查 spec 的 linter。
推荐理由:给出可直接套用的六段式 spec 模板、tally 实例和配套 linter,读者能据此改造自己交给编码智能体的任务描述。
作者给出一份按危害排序的十项 agent diff 检查清单,依次看被删除的测试、被跳过或弱化的断言、宽泛异常捕获、新增依赖、任务范围外文件、CI 配置改动、疑似密钥、遗留标记和净删除超过 40 行的文件。
推荐理由:给出按危害排序的十项 agent diff 检查清单,并附可复用的扫描脚本与行号定位。
作者主张给每个 agent 任务配一个 git worktree 和一条分支,而不是每个会话一个,因为任务需要能单独评审和回滚。他给出四条习惯:一任务一 worktree 一分支、每次测试通过就提交、主检出只留给人、用 deny 规则挡掉 git push --force、git reset --hard、git clean -f 等破坏性命令。
推荐理由:作者用真实仓库跑通脚本,给出每个 agent 任务一个 worktree 的四条版本控制习惯和可直接抄用的权限规则。
作者在 Codex 中用 Astra 构建了太空探索游戏 Void Explorer,包含 2,048 个恒星系和超过 10,000 个程序化生成的行星,并分享了从提示词到架构、测试和性能测量的完整流程。
推荐理由:作者用 Astra 在 Codex 中做完整游戏,展示了从提示词到测试、性能测量的可迁移协作流程。
Cline 把 VS Code 扩展从约 76,000 行单体核心迁移到 Cline SDK,并自建灰度发布机制:一个安装包内打包 loader、legacy 和 next 两套扩展,由 PostHog 功能开关按百分比决定激活哪套,崩溃时自动回退到 legacy,开关可随时降到 0% 作为 kill switch。
推荐理由:Cline 官方复盘如何把 1100 万用户的 VS Code 扩展迁到新 harness,含灰度机制与前后指标对比。
GitHub Copilot 团队复盘了四项降低 AI 编码成本的改动,核心原则是按完整任务而非单次工具调用衡量效率。
推荐理由:GitHub Copilot 团队复盘四项降本改动,并给出可迁移的评估方法:按完整任务而非单次工具调用衡量成本。
作者结合自己一次派 13 个子代理配分镜的实操,讲解 Claude Code 和 Codex 都有的 subagents 功能:子代理在独立窗口干活,只把结论交回主对话。
推荐理由:作者用一次派 13 个子代理配分镜的实操,说明子代理如何把过程留在主对话之外、只回传结论。
Anthropic 发布电商 AI 智能体解剖指南,基于与零售商、电商平台、旅游娱乐和电信团队的部署经验,提出把 Claude 放在标准智能体循环中、用技能覆盖长尾需求、用工具调用现有系统的单一智能体架构,并称对比测试中该架构在质量上优于子智能体设计和把所有内容塞进提示词的做法。
推荐理由:Anthropic 基于企业级电商智能体部署经验,给出单智能体加技能架构、延迟与成本优化、记忆与安全评估的完整工程做法。
作者提出用 agent 会话记录衡量一次工程决策的下游影响,即 blast radius(影响范围),并用自家 tapes 项目的一次架构决策做验证:设计文档会话花费 57.05 美元,后续引发 4704.74 美元工作量,分布在 70 个人工会话、3 名工程师、8 个仓库和 27 天中,另有 404 个自动化评测会话花费 431.54 美元。
推荐理由:作者用自家一次架构决策的 474 条会话记录,展示如何把决策的下游成本量化成可复用的指标。
Thoughtworks Europe 把 10 名工程师放进巴塞罗那办公室,用智能体工程在四天内构建了一套航空 IROps 系统。
推荐理由:作者复盘 10 名工程师用智能体四天构建 IROps 系统时,仓库意外变成智能体协调用的黑板。
作者 mattpocock 发布了一套自己日常使用的 AI 编程 Agent Skills,定位是真实工程而非 vibe coding,强调小而可改、可组合、兼容任意模型。
推荐理由:作者把多年工程经验拆成一组可组合的 Skill,并说明每个 Skill 针对的失败模式,读者可据此判断能否接入自己的开发流程。
Addy Osmani 建议每隔几周运行一次 Claude Code 的 /doctor,单独用 /memory 检查记忆,并让每条指令重新证明自己的价值,因为模型、harness 和代码库都在变,旧配置会留下。
推荐理由:作者结合自身配置审计经验与近期研究,说明 Agent 配置文件为何会腐化,以及如何按节奏清理。
Cline 团队用 Cline SDK 搭了一个代码审查智能体,把审查拆成 review 与 judge 两段 agent 循环,再由驱动脚本把存活的问题以一条 COMMENT 事件批量提交到 GitHub PR。
推荐理由:完整拆解一个代码审查智能体的插件、Hook 与两段式循环,可迁移到其他自动化审查场景。
Lovable 官方复盘了把平台应用接入第三方服务的做法:先支持 MCP 作为聊天内取上下文的临时方案,再自建 app connectors,用 Connector Gateway 代理已发布应用与第三方 API 之间的请求,由它持有凭证和刷新逻辑,部署后的应用不接触密钥。
推荐理由:Lovable 官方复盘如何把连接器做成可复用基础设施,对做第三方集成和凭证管理的团队有参考价值。
OpenAI 工程师用 Codex 配合开源 notebook 应用 Runme 自动化重复性工作,例如跑模型评测。做法是在 Runme notebook 里写目标单元格,让 Codex 读取目标、写出计划并等待人工审批后再执行,过程中记录命令、输出和结论,包括走过的死路。
推荐理由:作者用 Runme notebook 加 WebMCP 把评测流程交给 Codex,读者可借鉴其目标、审批与上下文沉淀方式。
作者 Jesse Vincent 在自研智能体框架 Evener 里用手机下达目标,让智能体自主实现一个能编译 SQLite 并通过基本冒烟测试的 ARM64 C 编译器,耗时约 21 小时,使用 Evener 加 GLM 5.2。
推荐理由:作者用自主智能体循环从零生成可编译 SQLite 的 C 编译器,可看到递归子智能体与目标设定的实际效果。