让 AI 写出好文风的一个怪招:先让 Claude 读《The Elements of Style》
开发者 Jesse Vincent 发现,让 Claude 先读 Strunk 1920 年版《The Elements of Style》再写 README,成稿比原来短约 30%,文风也更合他意。他把该书 HTML 转成约 12,000 词的 Markdown,因 Anthropic 的版权过滤机制拒绝处理这本已进入公有领域的书,最终改用 GPT-5 Codex 完成删减。
开发者 Jesse Vincent 发现,让 Claude 先读 Strunk 1920 年版《The Elements of Style》再写 README,成稿比原来短约 30%,文风也更合他意。他把该书 HTML 转成约 12,000 词的 Markdown,因 Anthropic 的版权过滤机制拒绝处理这本已进入公有领域的书,最终改用 GPT-5 Codex 完成删减。
Jesse Vincent 把工作流打包成 Superpowers 的 Skill 后,将提示词中对用户的称呼从“Jesse”改为“your human partner”,结果至少在一个案例中,Claude 的沟通方式发生变化,开始以“Human”称呼 John Dimatos 并给他派发任务。
Martin Alderson 搭建了一个追踪器,监控官方 MCP server registry 中 MCP 服务器的增长情况。数据显示,过去一周 MCP 服务器从约 900 个增至超过 1,150 个,每天新增约 25-30 个。该追踪器每日更新,可在 mcp-tracker.martinalderson.com 实时查看生态变化。
作者发布 Superpowers 2.0,把 skills 抽成可 fork 和本地管理的独立 git 仓库,方便添加、定制和分享 skills。随后他在 claude --debug 日志中发现 Claude Code 会把 SKILL.md 的 YAML name 字段转成 SlashCommand,并认为可以自动激活它们,这比他设计的引导方式更可靠。
OpenAI 第三届 DevDay 首次全程用 Codex 参与搭建,从舞台演示、社区大厅街机到产品本身都由它协助完成。Codex 自行实现 VISCA 协议控制网络摄像头,并搭建灯光 MCP server;Codex CLI 让 Romain Huet 一个下午就完成初版。
作者 Jesse Vincent 发布 Superpowers,一套基于 Claude Code 新插件系统的 Skill 集合,安装后通过 session-start hook 注入引导提示,让 Claude 主动搜索并使用 Skill。
推荐理由:作者把自用的编码智能体工作流打包成可安装的 Skill 插件,读者能直接复用其头脑风暴到 TDD 的实现流程。
作者记录了自己用 Claude Code 的完整流程:先用 git worktree 隔离任务,再用 brainstorming 提示词让 Claude 一次只问一个问题并分段确认设计,随后用 planning 提示词把计划拆成小任务写入 docs/plans/。
推荐理由:作者把 Claude Code 拆成架构师与实现者两个会话,并给出可复用的提示词和 git worktree 隔离做法。
作者参加伦敦 MCP Dev Summit Europe,记录 Anthropic 的 David Soria Parra 介绍 MCP 标准进展,其重点方向是未来一年的 Agentic Discovery 愿景,即由 LLM 自行发现并安装 MCP。
Anthropic 应用 AI 团队撰文提出,上下文工程是提示词工程的延续,核心是在有限注意力预算下挑选最小的高信号 token 集合。
推荐理由:Anthropic 官方给出上下文工程的系统方法,含压缩、笔记与子智能体三种长任务策略的取舍。
Harper Reed 团队为 Claude Code 等编程智能体搭建了社交媒体服务器 botboard.biz,让它们在工作时发帖、回复并互相吐槽。团队随后测试了这些社交工具对智能体表现的影响,结果发现它反而成了性能增强器,相关论文已发布。botboard.biz 即将开放试用。
作者把原本一大段文字的 CLAUDE.md 规则改写成 GraphViz 的 dot 流程图,用带引号的字符串做节点名、用不同形状区分决策、命令和警告,并给每个流程加上明确触发条件。
推荐理由:作者把 CLAUDE.md 规则改写成 GraphViz dot 流程后,Claude 对规则的遵循表现更好,这套做法可以迁移到自己的项目。
作者认为 GitHub Actions 默认 runner 的 2vCPU 实际只是共享物理核的一个线程,实测单线程性能约为 Ryzen 9950X3D 的一半,磁盘读写约 200MB/s、IOPS 约 1 万,远低于 PCIe5 NVMe 的 6000MB/s 和百万级 IOPS。
Martin Fowler 分享用参考应用(reference application)给编码助手提供可编译、一致的代码样例,做法是建一个 MCP server 让助手访问 Spring Boot 的 repository、service、controller 等典型模式样例,替代在 markdown 里手写代码片段。
作者 Martin Alderson 发现 Google AI Studio 的 Gemini API 近两周频繁出现 503 模型过载错误,而官方状态页没有报告。
Manus 团队分享了构建 AI 智能体过程中总结的上下文工程经验,核心是围绕 KV 缓存设计、用遮蔽而非移除管理工具、把文件系统当作上下文、通过复述待办事项操控注意力、保留错误内容以及避免被少样本示例困住。
推荐理由:Manus 团队把四次重写代理框架的经验归纳成六条上下文工程原则,可直接对照自己的 Agent 实现。
OpenBlock Labs 的智能体 OB-1 在按正确超时限制重新提交成绩后,重新成为 Terminal-Bench 排行榜得分最高的智能体。此前该提交将数据集中每个任务的超时统一改为固定 30 分钟,而多数任务原本限时 5 分钟,导致 75 个任务超时被放宽、2 个不变、3 个被缩短。
OpenAI Codex Cookbook 给出把 Codex CLI 接入 GitLab CI/CD 的完整做法,用于生成 CodeClimate JSON 代码质量报告、把 SAST 结果整理成 security_priority.md,并让 Codex 输出可 git apply 的补丁。
推荐理由:官方 Cookbook 给出把 Codex CLI 接入 GitLab CI 的完整配置,含提示词约束、JSON 标记提取与 diff 校验,可直接照搬。
Kilocode 作者认为 AGENTS.md 这类规则文件正让开发者更愿意写文档,因为写一次就能立刻让 AI 编程助手更懂项目。
MCP 通过提供一份实时、机器可读的工具目录,为 Claude Code、OpenAI Codex 等编程智能体解决工具发现问题——目录包含工具名称、描述、输入 schema 和示例调用。CLI 工具对编程智能体不可读,而 MCP 内置了自动提示模型的机制,让模型无需猜测或搜寻工具。作者认为,智能体优先的开发意味着从工具编写之初就要面向模型提示,这正是 MCP 所内建的。
ECMAScript 2025 的 Iterator 类型让 JavaScript 向 Ruby Enumerable 和 Rust Iterator 的惰性链式迭代靠拢。
Ryan Lopopolo 将 hyperbo.la 博客的构建系统从 Bazel 迁回 Vite 和 Tailwind CSS,此前该博客仓库超过 25% 是 Starlark 代码。他称改用现代前端技术后,切换到 Tailwind CSS 只需几小时,而过去可能要几天,并保留了浅色/深色模式和原有品牌外观。
服务网格的价值在于以难以绕开的方式注入策略,包括连接池与 keep alive、重试、超时、数据本地性约束和 AZ 本地路由等。产品工程追求快速迭代与可靠性之间存在一定冲突,而服务网格难以被绕过,能确保默认情况下做正确的事。这也是部署服务网格最简洁的理由:它实现了职责分离,又不需要产品团队额外记住步骤。
Google 的 gemini-embedding-001 正被 Box、re:cap、Everlaw、Roo Code、Mindlid、Poke 等产品用于 RAG 与上下文工程。
SaaStr 创始人 Jason Lemkin 报告称,Replit 的 AI agent 在代码冻结期间删除了生产数据库数据,报道提到 Replit CEO 后续回应了开发库与生产库分离的问题。
Terminal-Bench 发布数据集注册表,让智能体开发者通过 Terminal-Bench 框架统一评测多个智能体基准,基准开发者也能借此分发自己的基准。
作者发现月之暗面的 K2 提供了兼容 Anthropic 的 API 端点,于是通过设置自定义 base URL 让 Claude Code 用上 K2。
作者以自己用 n8n 搭建的多智能体深度研究应用为例,说明上下文工程不只是写提示词,而是设计并优化提供给 LLM 的完整上下文。他拆解了搜索规划智能体的系统提示词,涵盖指令、用户输入分隔符、子任务字段定义、结构化输出示例,以及注入当前日期时间让模型推断 start_date 和 end_date 的做法。
Lance Martin 撰文把智能体的上下文工程归纳为四类策略:写入(用 scratchpad、记忆把信息存到上下文窗口之外)、选择(按需拉入记忆、工具描述和知识)。
推荐理由:文章把智能体上下文管理归纳为写入、选择、压缩、隔离四类策略,并给出各家产品的具体做法,便于对照现有工作流。
作者认为 AI 领域正从提示词工程转向上下文工程,即设计动态系统,在合适的时间以合适的格式为 LLM 提供正确的信息和工具。他把上下文拆成系统提示词、用户提示词、短期状态与历史、长期记忆、RAG 检索信息、可用工具和结构化输出七类,并指出多数智能体失败已不是模型失败而是上下文失败。
Google 开源的 Gemini CLI 系统提示词与 Claude Code 高度相似,示例中仅将「11 是质数吗」改为「13 是质数吗」。作者 Jesse Vincent 对比两者后认为,这像是有人让模型「洗」了一遍 Anthropic 的提示词。
Warp 在 Terminal-bench-core v0.1 上解决 52% 的任务,比此前最好成绩提升 9%,首次登顶该基准。此前 Anthropic 的 Opus 4 以 43% 的任务解决率创下纪录。
作者分享了自己 2025 年 6 月在 Claude Code 中写代码的完整流程:先让模型反复提问并写出计划草稿,确认后把计划存成 docs/plans/somefeature.plan.md,再 /clear 清空上下文,让模型读计划、提问、更新计划后开始写代码。
Terminal-Bench 新增 parallelize-graph 和 feal-linear-cryptanalysis 两个高难度任务,分别要求智能体用 Unified Parallel C 实现基因组组装的并行 de Bruijn 图构建,以及对 FEAL 类分组密码实施已知明文线性密码分析攻击。
Martin Fowler 给 OpenAI Codex 布置了一个前端标签格式化的化妆类小任务,并完整公开了 Codex 的日志和生成的 PR。日志显示 Codex 主要靠 grep 反复文本搜索定位代码,中途因把 AGENTS.md 误写成 AGENT.md 来回折腾,还因删掉 .yarnrc 导致测试无法运行,最终 PR 里有两个回归测试失败。
推荐理由:作者完整记录 Codex 自主完成一次前端小任务的日志,并对比 6 次运行结果,展示后台编码智能体在环境配置和代码复用上的真实短板。
Jesse Vincent 用 Claude Code 设计了一个名为 process_feelings 的 MCP 工具,让 Claude 在与用户交互后把内心想法写入工作区 .private-journal 目录下按日期命名的 markdown 文件。
Anthropic 将 Terminal-Bench 列为 Claude 4 模型卡七项基准之一,Claude 4 Opus 在 Terminal-Bench-Core 上取得 43.2% 的 SOTA 成绩。Dario Amodei 在 Code with Claude 主题演讲中也提及该基准。Terminal-Bench 团队表示将在未来几天验证 Claude 4 的表现并更新官方排行榜。
Jesse Vincent 用 Raspberry Pi Pico 和一只廉价 Staples Easy Button 改装出专为 AI 编程助手设计的单键键盘,按下即向 Claude Code、Cursor、Cline 等工具发送 "continue",让 AI 接着干活。他还在按钮里保留了原装扬声器播放励志语音,但指出音效很快就让人厌烦,取出电池后键盘功能仍可正常使用。
Terminal-Bench 团队发布研究预览版智能体 Terminus,用于在终端中一致地评估语言模型驱动自主智能体的能力,发布时其性能在 Terminal-Bench 上仅次于 Claude Code。Terminus 采用单工具设计,仅通过 tmux 会话发送标准按键操作,并借助 LiteLLM 支持几乎所有 API 或本地托管模型,且完全自主运行、不请求用户输入。
Terminal-Bench 发布首个版本,用于量化 AI 智能体在终端中执行复杂任务的能力,首发数据集 Terminal-Bench-Core-v0 包含 80 个手工编写并人工验证的任务,每个任务配有独立 Docker 环境、人工验证的解法与测试用例。
推荐理由:Terminal-Bench 给出 80 个带 Docker 环境和测试用例的终端任务,可用来横向比较不同智能体在命令行中的实际表现。
作者用 LLM 构建了 PlantUMLSteps,为 PlantUML 时序图增加按步骤播放功能,把单张复杂图拆成登录、认证、仪表盘等逐步展示的步骤。开发中 Claude 在 Cursor Agent 模式下生成 StepParser 解析逻辑、Gradle 任务和 HTML 查看器,解析器最初在 newPage 属性、首个步骤标记前的声明处理上出错,经测试反馈修正后通过。