Skills 不是工具:作者复盘 11 个 MCP Server 为何拖垮编码智能体
作者在 2 月给编码智能体接了 11 个 MCP Server,空会话光工具列表就占 34,000 token,Datadog 一家贡献两百多个工具,智能体变慢并频繁选错工具。
推荐理由:作者用自己 11 个 MCP Server 拖垮上下文的经历,说明工具与知识该放在不同容器里。
CLAUDE.md、AGENTS.md、上下文压缩、记忆管理,让 Agent 知道该知道的。
作者在 2 月给编码智能体接了 11 个 MCP Server,空会话光工具列表就占 34,000 token,Datadog 一家贡献两百多个工具,智能体变慢并频繁选错工具。
推荐理由:作者用自己 11 个 MCP Server 拖垮上下文的经历,说明工具与知识该放在不同容器里。
作者开源了 claudemanager,一个本地守护进程,让 Claude Code 通过 ANTHROPIC_BASE_URL 指向它,只改动请求的 Authorization 头,就能把会话路由到 5 小时、每周和单模型窗口余量最多的 Max 账号,并在窗口填满前按自定义阈值切换。
推荐理由:作者开源了一个本地代理,把多个 Claude Code Max 账号按额度余量自动分流,并顺带记录了请求日志。
Spill 是一个 Apache-2.0 开源工具,通过 Hook 拦截超过 32 KiB 的 MCP 工具返回,将其存为本地 DuckDB 表(~/.spill/spill.duckdb),智能体只拿到一个紧凑描述符,再用 SQL 查询而不是读入 5 万 token 的原始 JSON。
推荐理由:Spill 把超大 MCP 返回落到本地 DuckDB,让智能体用 SQL 取数,为上下文窗口紧张提供了一种可复用的思路。
作者开源了 Project Athena v9.9.9 内核(MIT 许可),一套本地优先的记忆与治理框架,用于解决 Claude Code 反复纠正、子智能体越界改文件、以及中途撞上额度上限后状态丢失的问题。
推荐理由:作者用 1900 次会话验证的 CLAUDE.md 瘦身与本地记忆方案,给出了可直接复用的目录结构和验证规则。
作者让 GPT(gpt-6.1-sol,推理档位 high)在 Codex 里负责规划、关键判断和验收,通过 DeepSeek 官方 Harness 调用 DeepSeek-V4.1-Flash 负责写代码、跑试验和修复,一起做出五项功能跑通的本地 PDF 工具箱。
推荐理由:作者用 GPT 规划、DeepSeek 执行的分工跑通 PDF 工具箱,并给出三段提示词和缓存用量数据,可迁移到长任务降本。
Earendil 团队于 10 月 1 日发布 Agent Harness Pi 1.0,GitHub 仓库约 11.1 万 Star、1.4 万 Fork,同时推出实验性新包 Pi Durable。
推荐理由:Pi 1.0 与 Pi Durable 把检查点、幂等提交、所有权树等分布式概念搬进 Agent 运行时,可据此判断长时运行 Agent 的工程取舍。
一位有六年 SaaS 经验的产品设计师用 Claude Code 独自开发生活规划器 Котомка,几乎全部代码由 AI 编写,他负责提需求、验收和决策。
推荐理由:作者用真实仓库记录了一个人靠 Claude Code 做产品时踩过的坑,以及围绕 AI 搭起的规则、Hook 和测试护栏。
Lovable 发布 Chats,一个运行在工作区层级、可跨项目对话并触发构建的智能体,确认改动后会把任务交给项目里的 builder 智能体并把进展带回对话。
推荐理由:Lovable 公开 Chats 背后的轨迹、收件箱与激活三层架构,可迁移到自建多智能体编排。
作者参照自己的 Codex 配置,为 Claude Code 搭了一套按角色分配模型的路由:主线程做协调者,explorer 用 Haiku 只做代码搜索,worker 用 Opus 走 TDD 实现,verifier 用 Sonnet 独立跑检查,senior 用 high 档 Opus 处理资金、数据和并发,reviewer 换另一个模型做语义评审。
推荐理由:作者用一周实测给出 Claude Code 多模型分工的配置、Hook 强制约束和成本取舍,可迁移到自己的多智能体流程。
OpenAI 官方博客针对 GPT-6 Astra 给出 Skills、AGENTS.md 和任务提示词的调整建议:Skill 描述要尽量短且明确适用场景,多流程 Skill 用根文档做最小路由,避免把 Skill 写成过于具体的步骤清单。
推荐理由:OpenAI 官方给出 GPT-6 Astra 下 Skills、AGENTS.md 与提示词的清理方法,可迁移到现有仓库配置。
Cursor 推出「项目」功能,用于承接一项功能、一次迁移或一个完整应用这类长周期工作,可在数月内保持上下文并把任务委派给成千上万个子智能体。项目由云端智能体驱动,协调智能体不写代码,只负责规划、分派并交回成果,需要本机测试时再启动本地智能体;每个项目维护一组在云端和本地机器间同步的文件,持续积累研究成果、artifacts 和对代码库的了解。
推荐理由:官方给出项目式多智能体协作的上下文共享与自动触发机制,可据此判断长周期任务如何被接管。
Stolen Thoughts 研究发现 OpenAI、Anthropic 和 Google 的 reasoning API 存在漏洞:加密 reasoning block 未与具体模型、会话和用户充分绑定,把强模型的加密 reasoning 传给同厂商弱模型并越狱后,弱模型会以明文输出强模型的推理内容。
推荐理由:研究揭示加密 reasoning block 可跨模型解密,并给出公开轨迹中泄露密钥的实测数据,对智能体基础设施设计有直接参考价值。
作者 Ryan Lopopolo 提出,智能体是一组能力之上的参数化程序,这些能力包括模型与配置、推理与工具调用循环、计算机、磁盘、上下文、Skills、工具、连接器、运行时、网络策略、身份、IAM、护栏、I/O 通道和系统提示词。
推荐理由:作者用自己构建多个智能体的经历,提出把能力接口与实现解耦的平台架构思路,可供做 Agent 平台的团队参考。
作者提出用六段式 spec 模板(Goal、Non-goals、Interfaces、Files、Verification、Budget)向编码智能体描述任务,并配了一个在交给智能体前检查 spec 的 linter。
推荐理由:给出可直接套用的六段式 spec 模板、tally 实例和配套 linter,读者能据此改造自己交给编码智能体的任务描述。
OpenAI 于 2026 年 9 月 3 日发布 GPT-6 Astra 与 Astra Pro,首批仅限 Daybreak 网络安全计划企业,ChatGPT 付费版、API 和 AWS 将在随后几天开放。
推荐理由:梳理 GPT-6 Astra 与 Fable 5.1 的基准对比,指出各家测试版本与 harness 不一致,读者可据此判断哪些分数可比。
GitHub Copilot 团队复盘了四项降低 AI 编码成本的改动,核心原则是按完整任务而非单次工具调用衡量效率。
推荐理由:GitHub Copilot 团队复盘四项降本改动,并给出可迁移的评估方法:按完整任务而非单次工具调用衡量成本。
作者结合自己一次派 13 个子代理配分镜的实操,讲解 Claude Code 和 Codex 都有的 subagents 功能:子代理在独立窗口干活,只把结论交回主对话。
推荐理由:作者用一次派 13 个子代理配分镜的实操,说明子代理如何把过程留在主对话之外、只回传结论。
Anthropic 发布电商 AI 智能体解剖指南,基于与零售商、电商平台、旅游娱乐和电信团队的部署经验,提出把 Claude 放在标准智能体循环中、用技能覆盖长尾需求、用工具调用现有系统的单一智能体架构,并称对比测试中该架构在质量上优于子智能体设计和把所有内容塞进提示词的做法。
推荐理由:Anthropic 基于企业级电商智能体部署经验,给出单智能体加技能架构、延迟与成本优化、记忆与安全评估的完整工程做法。
作者 mattpocock 发布了一套自己日常使用的 AI 编程 Agent Skills,定位是真实工程而非 vibe coding,强调小而可改、可组合、兼容任意模型。
推荐理由:作者把多年工程经验拆成一组可组合的 Skill,并说明每个 Skill 针对的失败模式,读者可据此判断能否接入自己的开发流程。
Addy Osmani 建议每隔几周运行一次 Claude Code 的 /doctor,单独用 /memory 检查记忆,并让每条指令重新证明自己的价值,因为模型、harness 和代码库都在变,旧配置会留下。
推荐理由:作者结合自身配置审计经验与近期研究,说明 Agent 配置文件为何会腐化,以及如何按节奏清理。