什么是 AI Agent?一场暴露行业认知混乱的定义之争
围绕“AI Agent”的定义,业界至少存在五种互不兼容的用法:Russell 和 Norvig 1995 年提出“感知环境并通过执行器行动”的学术定义,Andrew Ng 强调与外部系统主动交互并完成特定任务。
Awaiting translation
围绕“AI Agent”的定义,业界至少存在五种互不兼容的用法:Russell 和 Norvig 1995 年提出“感知环境并通过执行器行动”的学术定义,Andrew Ng 强调与外部系统主动交互并完成特定任务。
Awaiting translation
作者 Martin Alderson 认为编码智能体的沙箱化比预想更难,因为命令白名单本身存在权限提升路径。
Awaiting translation
随着编码智能体和最新模型推动 token 消耗激增,AI 算力正面临严重短缺。作者估算自己三年内每日 token 消耗增长约 50 倍,目前全球约 10 亿活跃 LLM 用户,而超大规模厂商已承诺数千亿美元资本支出。Macquarie 指出当前 DRAM 供应仅能支撑 15GW 的 AI 基础设施部署,内存供应正成为比电力更难解决的瓶颈。
Awaiting translation
2025 年是从“以模型为中心”转向“以智能体为中心”的一年。Claude Code CLI 于 2 月 24 日以预览版发布,同日 GitHub Copilot 在 VS Code 推出 agent mode。
Awaiting translation
作者认为 Claude Code Skills 按需触发,仓库里放 40 到 100 个 Skill 在调用前不占上下文,而 MCP 每个会话都要加载全部工具描述并逐项目开关配置。
Awaiting translation
作者 Martin Alderson 认为 MCP 的核心问题在于 token 消耗过大,转而用自建 CLI 替代。他举例 Playwright MCP 开箱即用就要占用近 15000 token,超过 Claude Code 上下文窗口的 10%,而 Linear MCP 也因工具定义过多频繁触发上下文上限。
Awaiting translation
美国旅行社数量从 2000 年的 124,000 家降至 2012 年的 65,000 家,历时十年;而 LLM 在软件工程领域的采用率从 2022 年的 0% 升至 2025 年的 84%,速度远超当年互联网对旅行社的冲击。作者认为,只会把需求手动翻译成代码的通用型开发者,处境类似当年被 OTA 淘汰的普通旅行社代理。
Awaiting translation
针对"AI 扩展撞墙、资本开支过高"的质疑,Martin Alderson 指出批评者评判的是上一代硬件训练的模型,而一波约 6 倍的算力已经分配、正开始产出结果。
Awaiting translation
作者 Martin Alderson 用 acorn 生成两个 npm 包版本的 AST,让 Claude Code 对 AST 做 diff 并派出 10 个子智能体分头分析,不到 10 分钟就产出一份报告,涵盖功能开关、未发布功能、日志与遥测细节以及内部架构。
Awaiting translation
作者 Martin Alderson 认为当前模型进步是一次更微妙的 GPT-4 时刻,但现有基准测不出来。他指出 Gemini 3 Pro Preview 在设计网页和落地页上明显强于其他模型,并给出流程:上传产品 CSS 让模型提取设计系统,再结合产品截图生成 HTML 原型。
Awaiting translation
继 Shortcut 和 Microsoft 的 Agent Mode 之后,Claude for Excel 的推出让 Excel 智能体成为新热点。作者估算,美国约 7090 万管理及专业岗位从业者中,38% 的工作时间花在 Excel 上,对应约 2.4 万亿美元年人力成本,即使只提升 50% 效率,也意味着至少 1 万亿美元被浪费的工时。
Awaiting translation
针对 AI 数据中心将重演 2000 年代电信业崩盘的说法,Martin Alderson 对比历史数据后认为两者基本面不同。
Awaiting translation
作者 mbleigh 认为上下文工程普遍忽视了超链接这一手段,并提出只需一个接受 URI 列表的 read_resources 工具加一个入口 URI,就能让模型按需递归加载上下文。
Awaiting translation
一位非技术 CFO 借助 Claude Code 搭建出整合多个系统的内部运营看板,此前用 AirTable、低代码工具和 retool 外包机构都因规模或业务知识传递问题失败。
Awaiting translation
Martin Fowler 试用 Kiro、spec-kit 和 Tessl 三款自称实现 spec-driven development(SDD)的工具,把 SDD 归纳为 spec-first、spec-anchored、spec-as-source 三个层次,并指出目前所有方案都停留在 spec-first。
Awaiting translation
Why it matters: 作者亲手试用 Kiro、spec-kit 和 Tessl 三款 SDD 工具,给出 spec-first、spec-anchored、spec-as-source 三层划分,并指出小任务被过度规格化的问题。
Martin Alderson 搭建了一个追踪器,监控官方 MCP server registry 中 MCP 服务器的增长情况。数据显示,过去一周 MCP 服务器从约 900 个增至超过 1,150 个,每天新增约 25-30 个。该追踪器每日更新,可在 mcp-tracker.martinalderson.com 实时查看生态变化。
Awaiting translation
作者发布 Superpowers 2.0,把 skills 抽成可 fork 和本地管理的独立 git 仓库,方便添加、定制和分享 skills。随后他在 claude --debug 日志中发现 Claude Code 会把 SKILL.md 的 YAML name 字段转成 SlashCommand,并认为可以自动激活它们,这比他设计的引导方式更可靠。
Awaiting translation
作者 Martin Alderson 发现 Google AI Studio 的 Gemini API 近两周频繁出现 503 模型过载错误,而官方状态页没有报告。
Awaiting translation
Kilocode 作者认为 AGENTS.md 这类规则文件正让开发者更愿意写文档,因为写一次就能立刻让 AI 编程助手更懂项目。
Awaiting translation
MCP 通过提供一份实时、机器可读的工具目录,为 Claude Code、OpenAI Codex 等编程智能体解决工具发现问题——目录包含工具名称、描述、输入 schema 和示例调用。CLI 工具对编程智能体不可读,而 MCP 内置了自动提示模型的机制,让模型无需猜测或搜寻工具。作者认为,智能体优先的开发意味着从工具编写之初就要面向模型提示,这正是 MCP 所内建的。
Awaiting translation
ECMAScript 2025 的 Iterator 类型让 JavaScript 向 Ruby Enumerable 和 Rust Iterator 的惰性链式迭代靠拢。
Awaiting translation
In his article, Lance Martin groups context engineering for agents into four strategies: writing (using scratchpads and memory to store information outside the context window) and selecting (pulling in memory, tool descriptions, and knowledge on demand).
Why it matters: The article groups agent context management into four strategies—writing, selecting, compressing, and isolating—and shows how various products put them into practice, making it easy to compare against your existing workflow.
作者认为 AI 领域正从提示词工程转向上下文工程,即设计动态系统,在合适的时间以合适的格式为 LLM 提供正确的信息和工具。他把上下文拆成系统提示词、用户提示词、短期状态与历史、长期记忆、RAG 检索信息、可用工具和结构化输出七类,并指出多数智能体失败已不是模型失败而是上下文失败。
Awaiting translation
Martin Fowler 结合 Thoughtworks 内部使用 GitHub Copilot 的经验,分析行内代码生成在什么情况下更有用。他给出的有利条件包括技术栈更主流、问题更常见、生成片段更小、开发者更有经验、出错代价更低,并指出经验不足的开发者使用这类工具时任务耗时可能反而增加 7% 到 10%。他建议开发者花一段时间在安全区内外实验,逐步建立对工具适用边界的判断。
Awaiting translation