什么是 AI Agent?一场暴露行业认知混乱的定义之争
围绕“AI Agent”的定义,业界至少存在五种互不兼容的用法:Russell 和 Norvig 1995 年提出“感知环境并通过执行器行动”的学术定义,Andrew Ng 强调与外部系统主动交互并完成特定任务。
围绕“AI Agent”的定义,业界至少存在五种互不兼容的用法:Russell 和 Norvig 1995 年提出“感知环境并通过执行器行动”的学术定义,Andrew Ng 强调与外部系统主动交互并完成特定任务。
作者 Martin Alderson 认为编码智能体的沙箱化比预想更难,因为命令白名单本身存在权限提升路径。
随着编码智能体和最新模型推动 token 消耗激增,AI 算力正面临严重短缺。作者估算自己三年内每日 token 消耗增长约 50 倍,目前全球约 10 亿活跃 LLM 用户,而超大规模厂商已承诺数千亿美元资本支出。Macquarie 指出当前 DRAM 供应仅能支撑 15GW 的 AI 基础设施部署,内存供应正成为比电力更难解决的瓶颈。
2025 年是从“以模型为中心”转向“以智能体为中心”的一年。Claude Code CLI 于 2 月 24 日以预览版发布,同日 GitHub Copilot 在 VS Code 推出 agent mode。
作者认为 Claude Code Skills 按需触发,仓库里放 40 到 100 个 Skill 在调用前不占上下文,而 MCP 每个会话都要加载全部工具描述并逐项目开关配置。
作者 Martin Alderson 认为 MCP 的核心问题在于 token 消耗过大,转而用自建 CLI 替代。他举例 Playwright MCP 开箱即用就要占用近 15000 token,超过 Claude Code 上下文窗口的 10%,而 Linear MCP 也因工具定义过多频繁触发上下文上限。
美国旅行社数量从 2000 年的 124,000 家降至 2012 年的 65,000 家,历时十年;而 LLM 在软件工程领域的采用率从 2022 年的 0% 升至 2025 年的 84%,速度远超当年互联网对旅行社的冲击。作者认为,只会把需求手动翻译成代码的通用型开发者,处境类似当年被 OTA 淘汰的普通旅行社代理。
针对"AI 扩展撞墙、资本开支过高"的质疑,Martin Alderson 指出批评者评判的是上一代硬件训练的模型,而一波约 6 倍的算力已经分配、正开始产出结果。
作者 Martin Alderson 用 acorn 生成两个 npm 包版本的 AST,让 Claude Code 对 AST 做 diff 并派出 10 个子智能体分头分析,不到 10 分钟就产出一份报告,涵盖功能开关、未发布功能、日志与遥测细节以及内部架构。
作者 Martin Alderson 认为当前模型进步是一次更微妙的 GPT-4 时刻,但现有基准测不出来。他指出 Gemini 3 Pro Preview 在设计网页和落地页上明显强于其他模型,并给出流程:上传产品 CSS 让模型提取设计系统,再结合产品截图生成 HTML 原型。
继 Shortcut 和 Microsoft 的 Agent Mode 之后,Claude for Excel 的推出让 Excel 智能体成为新热点。作者估算,美国约 7090 万管理及专业岗位从业者中,38% 的工作时间花在 Excel 上,对应约 2.4 万亿美元年人力成本,即使只提升 50% 效率,也意味着至少 1 万亿美元被浪费的工时。
针对 AI 数据中心将重演 2000 年代电信业崩盘的说法,Martin Alderson 对比历史数据后认为两者基本面不同。
作者 mbleigh 认为上下文工程普遍忽视了超链接这一手段,并提出只需一个接受 URI 列表的 read_resources 工具加一个入口 URI,就能让模型按需递归加载上下文。
一位非技术 CFO 借助 Claude Code 搭建出整合多个系统的内部运营看板,此前用 AirTable、低代码工具和 retool 外包机构都因规模或业务知识传递问题失败。
Martin Fowler 试用 Kiro、spec-kit 和 Tessl 三款自称实现 spec-driven development(SDD)的工具,把 SDD 归纳为 spec-first、spec-anchored、spec-as-source 三个层次,并指出目前所有方案都停留在 spec-first。
推荐理由:作者亲手试用 Kiro、spec-kit 和 Tessl 三款 SDD 工具,给出 spec-first、spec-anchored、spec-as-source 三层划分,并指出小任务被过度规格化的问题。
Martin Alderson 搭建了一个追踪器,监控官方 MCP server registry 中 MCP 服务器的增长情况。数据显示,过去一周 MCP 服务器从约 900 个增至超过 1,150 个,每天新增约 25-30 个。该追踪器每日更新,可在 mcp-tracker.martinalderson.com 实时查看生态变化。
作者发布 Superpowers 2.0,把 skills 抽成可 fork 和本地管理的独立 git 仓库,方便添加、定制和分享 skills。随后他在 claude --debug 日志中发现 Claude Code 会把 SKILL.md 的 YAML name 字段转成 SlashCommand,并认为可以自动激活它们,这比他设计的引导方式更可靠。
作者 Martin Alderson 发现 Google AI Studio 的 Gemini API 近两周频繁出现 503 模型过载错误,而官方状态页没有报告。
Kilocode 作者认为 AGENTS.md 这类规则文件正让开发者更愿意写文档,因为写一次就能立刻让 AI 编程助手更懂项目。
MCP 通过提供一份实时、机器可读的工具目录,为 Claude Code、OpenAI Codex 等编程智能体解决工具发现问题——目录包含工具名称、描述、输入 schema 和示例调用。CLI 工具对编程智能体不可读,而 MCP 内置了自动提示模型的机制,让模型无需猜测或搜寻工具。作者认为,智能体优先的开发意味着从工具编写之初就要面向模型提示,这正是 MCP 所内建的。
ECMAScript 2025 的 Iterator 类型让 JavaScript 向 Ruby Enumerable 和 Rust Iterator 的惰性链式迭代靠拢。
Lance Martin 撰文把智能体的上下文工程归纳为四类策略:写入(用 scratchpad、记忆把信息存到上下文窗口之外)、选择(按需拉入记忆、工具描述和知识)。
推荐理由:文章把智能体上下文管理归纳为写入、选择、压缩、隔离四类策略,并给出各家产品的具体做法,便于对照现有工作流。
作者认为 AI 领域正从提示词工程转向上下文工程,即设计动态系统,在合适的时间以合适的格式为 LLM 提供正确的信息和工具。他把上下文拆成系统提示词、用户提示词、短期状态与历史、长期记忆、RAG 检索信息、可用工具和结构化输出七类,并指出多数智能体失败已不是模型失败而是上下文失败。
Martin Fowler 结合 Thoughtworks 内部使用 GitHub Copilot 的经验,分析行内代码生成在什么情况下更有用。他给出的有利条件包括技术栈更主流、问题更常见、生成片段更小、开发者更有经验、出错代价更低,并指出经验不足的开发者使用这类工具时任务耗时可能反而增加 7% 到 10%。他建议开发者花一段时间在安全区内外实验,逐步建立对工具适用边界的判断。