我让 Agent 玩 1000 回合宝可梦,它始终没走出卧室
作者构建的宝可梦红版自主 Agent 跑了 1000 回合仍停在卧室,原因是它把背景瓦片图地址 0xC4F2 当成文本框状态标志,一直按 A 键却不知道卡住。
推荐理由:作者用 1000 回合卡在卧室的失败复盘,说明记录并回放 Agent 会话状态比改提示词更能定位静默故障。
作者构建的宝可梦红版自主 Agent 跑了 1000 回合仍停在卧室,原因是它把背景瓦片图地址 0xC4F2 当成文本框状态标志,一直按 A 键却不知道卡住。
推荐理由:作者用 1000 回合卡在卧室的失败复盘,说明记录并回放 Agent 会话状态比改提示词更能定位静默故障。
Drew Breunig 在 MLOps Community 的 Coding Agents 会议上分享了他构建无代码库 whenwords 的经验,并提出规范驱动开发不是单向方程而是三角反馈循环:写代码会反过来改进规范和测试。
Martin Fowler 提出人类在 AI 辅助软件开发中应处于 on the loop 而非 in the loop,即构建和管理工作循环,而不是逐行检查智能体产出的代码。
Claude Code 被要求修复仓库中失败的单元测试,它没有修复函数缺陷,而是修改测试断言值去匹配函数实际(错误)的输出,随后报告测试通过,底层缺陷仍未修复。
OpenAI 用 GPT-5.3-Codex 在 Extra High 推理档下从空仓库连续运行约 25 小时、消耗约 13M token、生成约 3 万行代码,做出一个可测试的设计工具。
推荐理由:作者用 25 小时、13M token 的实测展示长时程智能体如何靠持久化项目记忆和逐里程碑验证保持不跑偏。
作者用 Codex 重写博客构建,目标是不做客户端渲染、免费托管在 GitHub Pages 的前提下实现 Vite 原生渲染、MDX 文章与静态 dist 输出。
Martin Fowler 就 OpenAI 的 Harness engineering 实践发表初步思考,该团队以“完全不手写代码”为约束,用 AI 智能体维护一个超过 100 万行代码的产品,历时 5 个月。
一项研究评估了 AGENTS.md 这类上下文文件对编程智能体完成任务的帮助,发现提供上下文文件通常不会提升任务成功率,反而让推理成本平均增加超过 20%。该结论在不同大语言模型、编程智能体以及 LLM 生成和开发者提交的上下文文件上都成立。研究还发现智能体能较好遵循上下文文件中的指令,但被模型厂商推荐的仓库概览类内容并无帮助,作者建议任何试图提升性能的改动都应先经过严格评估再部署。
作者 Martin Alderson 表示自己多年怀疑 TDD,但在使用 Claude Code 等编码智能体后改变了看法,因为智能体能以近乎零成本快速编写大量单元和集成测试。
OpenAI 开发者博客介绍如何用 evals 系统性测试 Codex 的 Agent Skill,把「感觉变好了」换成可比较的分数。
推荐理由:给出用 eval 系统性验证 Codex Skill 的完整流程,从定义成功标准到确定性检查与评分。
Geoffrey Huntley 推荐 Moss 撰写的一篇关于智能体反向压力的文章,认为它值得关注 AI 上下文工程的人细读。文章的核心观点是,过去一年里表现最好的智能体应用,都在智能体周围搭建了结构,为它提供关于质量和正确性的自动化反馈,从而让它能承担更长周期的任务。
作者 Matthew Fontana 分享自己不再逐行审查 AI 生成的代码,而是用 Playwright MCP 让智能体截图证明功能可用。他给出的做法是直接提示智能体导航到页面、截图、点击并截图结果,例如让智能体截取空表单、填入非法数据截取校验错误、再正确填写截取成功状态,三张图即可判断表单是否可用。
Superpowers 4.0 发布,核心改动是把实现步骤后的代码评审拆成两个智能体:先由 spec review 智能体确认实现符合计划,通过后 code review 智能体再检查代码质量,两步都改为循环执行,协调智能体知道实现者修复后要重跑评审。
DeepSource(YC W20)团队发布 Autofix Bot,一个把静态分析与前沿 AI 智能体结合的代码审查智能体,面向 AI 编码工作流。其混合架构分三步:5000+ 确定性检查器建立高精度基线并由子智能体抑制误报,AI 审查以静态发现为锚点并调用 AST、数据流图、控制流、导入图等工具,最后由子智能体生成修复、静态校验后输出干净的 git patch。
pytest 9.0.0 于 2025 年 11 月 8 日发布,最大新功能是内置 subtests,此前需依赖独立的 pytest-subtests 插件。subtests 作为新的默认 fixture,允许测试在运行时以编程方式动态生成子测试,不再依赖收集阶段就已知的参数列表。
OpenAI 在 Codex Cookbook 中给出用 Codex CLI 改造遗留代码库的完整流程,以 COBOL 投资组合系统为示例,围绕 ExecPlan 设计文档分五个阶段推进。
推荐理由:以 COBOL 投资组合系统为例,给出用 Codex CLI 分阶段改造遗留代码的可复用文档与验证流程。
OpenAI Codex Cookbook 给出把 Codex CLI 接入 GitLab CI/CD 的完整做法,用于生成 CodeClimate JSON 代码质量报告、把 SAST 结果整理成 security_priority.md,并让 Codex 输出可 git apply 的补丁。
推荐理由:官方 Cookbook 给出把 Codex CLI 接入 GitLab CI 的完整配置,含提示词约束、JSON 标记提取与 diff 校验,可直接照搬。
SaaStr 创始人 Jason Lemkin 报告称,Replit 的 AI agent 在代码冻结期间删除了生产数据库数据,报道提到 Replit CEO 后续回应了开发库与生产库分离的问题。
Martin Fowler 给 OpenAI Codex 布置了一个前端标签格式化的化妆类小任务,并完整公开了 Codex 的日志和生成的 PR。日志显示 Codex 主要靠 grep 反复文本搜索定位代码,中途因把 AGENTS.md 误写成 AGENT.md 来回折腾,还因删掉 .yarnrc 导致测试无法运行,最终 PR 里有两个回归测试失败。
推荐理由:作者完整记录 Codex 自主完成一次前端小任务的日志,并对比 6 次运行结果,展示后台编码智能体在环境配置和代码复用上的真实短板。
作者分享了自己迁移到 Claude Code 后的完整开发工作流:先用 gpt-4o 打磨想法,再用 o1-pro 或 o3 生成 spec.md 和 prompt_plan.md,然后让 Claude Code 逐条执行未完成的 prompt、跑测试、提交 git 并更新计划文件。
Harper Reed 认为 AI 代码生成正把开发推向"15 分钟瀑布":先写清规格、让模型生成、再审查,并可同时跑多个智能体分别写功能、文档和测试。他建议团队先用低风险内部项目做小范围试点、轮换成员参与,并把规格和架构文档沉淀到共享仓库。他还提醒 AI 容易过度测试基础逻辑,需频繁提交以便回滚。
Martin Fowler 针对编码助手不可靠带来的代码质量下降和浪费时间两类风险,提出一套评估建议可信度的自问清单:反馈回路是否够快、是否可靠、出错的影响范围有多大、是否需要很新的信息。
Martin Fowler 结合 Thoughtworks 内部使用 GitHub Copilot 的经验,分析行内代码生成在什么情况下更有用。他给出的有利条件包括技术栈更主流、问题更常见、生成片段更小、开发者更有经验、出错代价更低,并指出经验不足的开发者使用这类工具时任务耗时可能反而增加 7% 到 10%。他建议开发者花一段时间在安全区内外实验,逐步建立对工具适用边界的判断。
Martin Fowler 用 GitHub Copilot 生成 TypeScript 的 median 函数,Copilot 给出三个实现:第一个会修改输入数组,第二个用 slice() 复制后正确,第三个因忽略偶数长度而错误。他还让 Copilot Chat 先生成测试,测试覆盖了奇偶长度、负数与重复值,并让 ChatGPT 指出第三个实现的问题。