Thorsten Ball 谈工程中的 ownership:从问题定义到上线通知的完整清单
Thorsten Ball 把发给 Amp 同事的内部 Slack 消息整理成文,说明他所说的 ownership 是指端到端负责一个问题的解决,从“我们有个问题”到“不用再想它”。
Awaiting translation
Thorsten Ball 把发给 Amp 同事的内部 Slack 消息整理成文,说明他所说的 ownership 是指端到端负责一个问题的解决,从“我们有个问题”到“不用再想它”。
Awaiting translation
Martin Fowler 在 Apple M3 Max 48GB 和 M5 Pro 64GB 两台机器上,用 LM Studio、OpenCode 和 Pi 实测了 Qwen3.6 与 Gemma 4 系列本地模型做智能体编程,结论是仍不够即插即用。
Awaiting translation
作者主张把业务 AI 建在 marketplace plugin 的通用原语层上,而不是绑定单一厂商,这样厂商位于工作流之下而非包裹工作流。
Awaiting translation
作者实测智谱 GLM5.2 后认为,它是首个达到 Opus 和 GPT 同级水准的开源权重模型,在 Claude Code 中几乎难以分辨二者差异。他指出迁移成本极低,Z.ai 和 Fireworks 都提供 OpenAI 与 Anthropic 兼容端点,只需改 base URL 和 API key 即可替换。
Awaiting translation
Addy Osmani 结合自己在 Google 工作 14 年、参与 Chrome、Gemini 和 Cloud AI 的经历,提出智能体时代工程师的核心价值不再是解题,而是选题、写规格和验证。
Awaiting translation
Thorsten Ball 在休刊三周后回归 Joy & Curiosity 第 90 期,宣布今后将更随性地写这份 newsletter。本期重点介绍了 Agents in Orbs 的发布,他认为在 orb 中运行的远程智能体更像 async 函数,可并行启动多个、无需本地开发环境配置。
Awaiting translation
Drew Breunig 借用 Stewart Brand 的 Pace Layers 框架分析 AI 生态:数据中心建设正被巨额投资推着以"年"而非"数十年"的速度推进,快于其上层的组织、治理与大学,也快于能源生产层,由此引发强烈反弹。他指出模型近 18 个月的进步依赖雇佣数据与合成数据,有机人类数据已基本耗尽,而支撑上层的慢层反馈不足,导致上层狂奔却缺乏支撑。
Awaiting translation
结对编程被一些团队用来把同行评审嵌入开发过程,让评审在工作进行时完成,从而缓解 AI 辅助交付带来的 PR 审查瓶颈。其机制在于评审信心产生于编码过程中,而非事后检查;AI 智能体产出代码更快更多,若判断全部堆到 PR 阶段,瓶颈只会加剧。应对之策是把标准、质疑和判断前移到工作本身,让证据随 PR 一起到达。
Awaiting translation
作者评论 Eric Xing 等人在 CMU/MBZUAI 发表的 40 多页论文 Critique of Agent Model,认为其提出的 agentic 与 agentive 区分是当前最清晰的智能体分类。
Awaiting translation
一位工程师借助 AI 首次用从未在职业中使用过的 Python 交付生产代码,Claude Code 评价其代码达到 senior 甚至接近 staff 水准。
Awaiting translation
作者翻译了 Google 与 Kaggle 免费课程 5-Day AI Agents: Intensive Vibe Coding Course 五份白皮书中的第一份,主题是从随意提示词转向智能体工程的新 SDLC。
Awaiting translation
适配器模式的价值在于把外部供应商 API 翻译成应用自身理解的接口,避免供应商决策渗透整个产品,是商业杠杆而非整洁代码装饰。作者指出,让 AI 编程智能体"使用设计模式"多半只是空想,它能生成形似适配器的代码,却难以自行判断边界是否必要、测试该保护哪些行为、哪些取舍仍需人来做决定。作者附上一个 Ruby 供应商边界示例,展示适配器如何翻译供应商 API 并把接线留在核心调用代码之外。
Awaiting translation
一份面向 AI 工程岗位的面试题追问清单,覆盖代理网关(如 OpenRouter/LiteLLM)、MCP/CLI、从零手写 Agent、多智能体编码流程、自定义 benchmark 以及本地部署约 27B-Q3_K_M.gguf 模型等方向。作者认为,这些题目的通用版本如今谁都能靠 vibe coding 一晚做出来,已失去简历价值,真正稀缺的是把任务打磨到"理想"状态的能力。
Awaiting translation
Geoffrey Huntley 在迈阿密的访谈中提出,软件开发已是死路职业,因为任何人都能用 Cursor 等工具生成代码,但"会写代码"和"软件工程师"是两回事。他认为软件开发如今近乎免费、token 比人便宜,开发者数量将爆发式增长;无法演示 coding agent 如何工作的人只是消费者,两年内没有保持好奇心的人可被替代。他还建议,如果公司禁用 AI,就应该辞职。
Awaiting translation
针对 AI 编程智能体指令文件中常见的“写整洁代码”“用 TDD”“遵循 SOLID”等表述,作者指出这些说法本身没错,但都不是可自我执行的指令。智能体主要复用代码库中已有的模式,在好坏混杂的真实代码库里,这类指令只是表达愿望。作者主张改为展示好与坏的具体样例,并让智能体证明自己实际遵循了哪些模式、在哪里应用、如何验证结果。
Awaiting translation
Awaiting translation
Introducing Claude Tag, a new way for teams to work with Claude. In Slack, Claude joins as a team member with access to the channels and tools you choose. Tag Claude in and delegate tasks to it while you focus on other work.
让 AI 智能体先写代码、再用 CodeRabbit、Greptile 这类审查工具事后清理,可能已经太晚:等审查工具看到 PR 时,智能体早已定下实现形态、假设和测试策略。昂贵的错误通常发生在 PR 之前,比如误读系统、切片过大或沿用错误模式,事后打磨无法纠正方向。审查工具应作为检查环节而非交付模式,把结果、约束、验收标准和验证前置到工作流程中。
Awaiting translation
Drew Breunig 提出提示词债概念,认为用自然语言手写提示词来定义系统行为会带来三重后果:迭代变慢、团队难以读懂、应用被锁死在单一模型上。他引用 Datadog 报告称其观测到的流量中最常用的模型是 GPT-4o,并举例 Fable 的系统提示词把同一条版权规则重复了六次、Claude Code 让 Opus 七次要求在一次响应中返回多个工具调用。
Awaiting translation
Hacker News 上有人提问:ChatGPT 3.5 问世约三年半、Claude Code 于 2025 年 2 月发布,一个学年内 LLM 就从勉强应付高中数学进步到证明单位距离猜想,如今几乎每两个月就出现新的 SOTA。提问者想知道四年后 AI 编程会像 AlphaGo 之后的围棋那样让人无从对抗,还是只是今天的加强版、人类仍主导而 AI 充当助手。
Awaiting translation
用好 AI 智能体的关键不是提示词写得多好,而是做一名操作者:人守在循环的起点和终点,让智能体负责中间环节。作者的做法是让智能体先复述情况、选项、权衡与建议,由人拍板后再推进,并且只做小到能真正审阅的片段,然后认真读输出、检查它做了什么假设。
Awaiting translation
Steve Yegge 认为,前沿模型能力仍在指数增长,但最强大的模型会像核武器一样被各国政府管控,多数人和多数财富 500 强公司将只能用到 Fable 级别的模型,因此可获取的智能曲线对大多数人会人为走平。
Awaiting translation
一位开发者在 FrontEnd Conf 2025 圆桌讨论八个月后,逐条复盘了自己关于 AI 进入 SDLC 的 11 条预测。其中"开发者从执行者转向智能体编排者"、"隐性知识难以提取"、"自上而下买订阅和课程无法落地"等判断被完全证实,而"功能开发时间不变但迭代更多"只对了一半。他还观察到 AI 正在放大团队内部的不平等,AI 超级用户产出可达慢速采用者的数倍。
Awaiting translation
Johnny Butler 转述 Google 云 AI 总监 Addy Osmani 的观点,认为 AI 代码评审的出路不是增加评审者,而是让代码在进入评审前就值得评审。
Awaiting translation
作者对 Spec Kit 这类 Spec-First 方法成为团队使用编码智能体的默认方式持怀疑态度,认为它让工程师在了解足够信息前就要定义工作的完整形态,本质是重造瀑布流。他指出智能体让这一风险更尖锐:规格太薄会自行填补空白,太重则会自信执行本就错误的假设。作者主张保留迭代式交付,给智能体结果、护栏、标准和风险,而非更长的提示词或更重的流程。
Awaiting translation
作者认为把 AI 预算押在选当前跑分领先的模型上是错误下注,因为模型每半年就换一轮领先者,真正能积累的是公司独有的内部上下文。
Awaiting translation
作者梳理了 KV cache 压缩技术的发展脉络,指出存储一个上下文 token 所需内存自 2017 年以来下降约 100 倍,而同期顶级数据中心 GPU 显存仅从 16GB 增至 288GB。
Awaiting translation
前沿实验室正为 AI 编程的“轨迹”数据付费:Mercor 靠出售工程师与 AI 智能体协作的完整会话记录,在 6 月年化营收突破 10 亿美元、估值 100 亿美元;Anthropic 和 OpenAI 据称也在构建存储代码编写全过程记录的服务。而多数工程团队的会话在终端关闭后即被丢弃,团队因此无法检索和复用这些经验。
Awaiting translation
作者认为 Codex 尚未推出类似 Claude Design 的产品,是因为 GPT-5.5 的模型能力还做不好高精度可交互原型。他区分了产品层 Harness 与模型层,指出 Claude Design 的 Harness 技术上不复杂,自己已逆向并开源 baoyu-design,真正拉开差距的是模型。
Awaiting translation
作者为 prismvideos.com 构建媒体生成 Agent 时,发现竞品 Higgsfield 基于开源个人 Agent Hermes 推出的 Supercomputer 已具备跨会话记忆、Skills、自动化、计算机和文件系统,而自建这些功能需要数周。
Awaiting translation
一篇论文评估仓库级上下文文件(如 AGENTS.md、CLAUDE.md)对编程智能体的作用,在 SWE-bench Lite 和自建基准 AGENTBENCH(12 个仓库的 138 个 Python 任务)上对比无上下文文件、LLM 生成和开发者手写三种条件。
Awaiting translation
xAI 与 Anthropic、Google 达成算力合作,前者以每月 12.5 亿美元租用 300MW 容量(约 22 万块 GPU),后者以每月 9.2 亿美元租用 11 万块 GPU。xAI 已并入 SpaceX,这些收入将直接流入即将 IPO 的实体。作者认为 xAI 在数据中心建设上确有优势,但其定位正越来越像一家附带前沿实验室的数据中心 REIT。
Awaiting translation
Thorsten Ball 的 Joy & Curiosity 通讯在写了三年后进入两三周、最多四周的暑期休更。本期链接包括 Anthropic 发布的《When AI builds itself》文档、Ted Chiang 关于 AI 是否具有意识的文章,以及 Ladybird 浏览器宣布不再接受公开 pull request,理由是 AI 工具已迅速改变开源信任的经济学。
Awaiting translation
针对英国政界主张必须在本土大规模建设数据中心,Martin Alderson 认为理由站不住脚:Opus 模型首 token 延迟为 1.6s-3.6s,而英国到美国东海岸往返延迟仅约 80ms,到欧洲 10-20ms,到亚洲约 200ms,延迟并非瓶颈。他还指出,把全球在建的 30GW 数据中心全部搬到英国,商业地产税年收入约 £3bn,仅占政府支出约 0.2%。
Awaiting translation
Amp 团队的 Thorsten Ball 认为,构建新软件本质上是学习过程,无法避免“这不是我想要的”这类反馈。他建议用 1 小时做原型、30 分钟写方案、每天拆分上线、伪造演示视频或先写 README 示例代码等方式,尽快让想法接受现实检验。核心是不断追问:如何最快获得反馈,从而学会自己到底在构建什么。
Awaiting translation
AI 对多数企业的即时价值是放大而非自动化:让资深工程师、合规负责人和产品团队在保持原有判断与责任归属的前提下大幅提速。当产出变得更快更便宜,瓶颈会从产能转向信任、系统契合度、决策归属和哪些不该自动化。作者认为,赢家不是最早移除人的公司,而是给对的人更大杠杆并牢牢掌控人类所有权边界的公司。
Awaiting translation
Software Dark Factory(SDF)提出治理应适配开发流程而非接管流程,目标是让 AI 辅助产出的改动仍以可识别的 PR 形式接受审查,并让证据随手可得。SDF 正围绕一个实际运营问题做 dogfooding:从一个小型受治理改动到可审查的 draft PR 能有多快,同时保持证据齐备、审查体验正常。作者强调要的是可控的速度,而非为流程而流程或事后补上的合规包装。
Awaiting translation
作者指出 AI 工具在个体层面带来 21% 任务完成量和 98% PR 合并量提升,但组织交付指标持平、稳定性略降,METR 随机对照实验中 16 名开发者在 246 个真实 issue 上实测反而慢 19%。
Awaiting translation
Drew Breunig 提出,当 AI 智能体可以解释一切时,面向人类的文档应转向帮读者建立心智模型,而非追求完整参考。他认为人们愿意写 Skill 却抗拒写文档,是因为智能体承担了大部分写作、可边用边改、能立即产生价值且不必反复精修,Skill 本身也兼具文档作用。
Awaiting translation
Steve Yegge 结合自己 35 年技术面试经历判断,传统技术面试已走到尽头,因为它无法可靠回答候选人能否胜任工作。他引用 Google 的统计称面试官之间一致性很低、面试分数与入职后表现几乎无关,并回忆 Google 招聘委员会曾误将自家成员的面试包评为不录用。
Awaiting translation
Google 在 Gemini 3.5 Flash 上选择了一条不同于 OpenAI 和 Anthropic 的路线:该模型输出速度达 206 t/s,约为 Opus 4.8 和 GPT-5.5 的 4 倍,但定价 $9/MTok,是上一代 Flash 的 3 倍。
Awaiting translation