跳到正文

测试与验证

怎么让 Agent 写出能过测试的代码、怎么验证它说的“完成了”。

最新精选

第 21–32 条 · 共 32 条
7/22周三
  1. Augment Code · Blog62

    什么是循环工程,领先软件工程团队如何用它

    Augment Code 提出循环工程,即设计从触发、执行、验证到完成结果的智能体循环,让智能体承担中间环节、人类只在需要判断的检查点介入。文章把循环工程与提示词工程、上下文工程分层对比,并给出触发、执行、验证、结果、改进五个阶段,以及代码评审、工单转 PR、漏洞修复、事故响应四种已在生产运行的团队级循环。

    推荐理由:Augment Code 把循环工程拆成触发、执行、验证、结果、改进五阶段,并给出四种已在生产运行的团队级循环形态。

7/20周一
7/11周六
  1. Habr · Kova13v80

    用证据契约约束 Claude Code 的测试结论:一套 QA Skill 包

    一位 QA 工程师把半年在 Claude Code 上做 Web 测试的经验整理成开源 Skill 包 paranoid-qa,核心是一份证据契约:Pass/Fail 只能依据截图、请求体、日志等实际产物,未验证写 Not tested,环境受阻写 Blocked,表单必须检查真实提交 payload。

    推荐理由:作者把半年 QA 经验固化成 Claude Code 的测试 Skill 包,并给出可直接复用的证据契约与失败清单。

7/8周三
  1. AI Hero · Skills Updates65

    AI Hero skills 仓库发布 v1.1:新增 /wayfinder,重命名 /to-spec 与 /to-tickets

    AI Hero 的 skills 仓库发布 v1.1,把 /to-prd 重命名为 /to-spec,将 /to-plan 和 /to-issues 合并为 /to-tickets,并新增 /wayfinder、/research、/prototype 等 Skill。

    推荐理由:作者把 grilling 到部署的完整 Skill 流程讲清楚,并给出重命名、合并和新增 /wayfinder 的迁移命令,适合想搭 AI 开发工作流的人参考。

6/15周一
  1. Jesse Vincent78

    Superpowers 6 发布:构建提速最高 50%、token 花费降低最高 60%

    Superpowers 6 发布,作者称在 Anthropic 评测基准上构建耗时降低 50%、token 花费降低 60%,主要来自合并规范符合性与代码质量两个评审 agent、预先生成评审用的 diff 包让评审者少跑 git,以及调整编排器对任务所需 agent 类型的指引。

    推荐理由:作者用自建评测套件量化了 Superpowers 6 在构建耗时和 token 花费上的改进,并公开了实验记录与失败结论。

3/13周五
  1. Ryan Lopopolo74

    智能体时代的生产函数变了:实现不再稀缺,验证才是

    作者认为,软件组织一直把人的实现时间当作稀缺投入,智能体打破了这个假设,因此策略必须可执行、验证必须随实现规模扩展。他以在大型 TypeScript 代码库开启 ESLint 的 no-await-in-loop 规则为例,发现 600 处违规,过去这需要昂贵的迁移,现在一个 PR 就能完成修复并补齐测试覆盖。

    推荐理由:作者以开启 ESLint 规则、迁移 600 处违规的亲身实践,说明智能体时代实现成本下降后,约束与验证为何成为新的稀缺环节。

3/9周一
2/23周一
  1. OpenAI Developer Blog · Codex72

    用 Codex 跑 25 小时长时程任务:一份可复用的项目记忆文件栈

    OpenAI 用 GPT-5.3-Codex 在 Extra High 推理档下从空仓库连续运行约 25 小时、消耗约 13M token、生成约 3 万行代码,做出一个可测试的设计工具。

    推荐理由:作者用 25 小时、13M token 的实测展示长时程智能体如何靠持久化项目记忆和逐里程碑验证保持不跑偏。

1/22周四
11/19周三
  1. OpenAI · Codex Cookbook67

    如何用 Codex CLI 分阶段改造遗留代码库

    OpenAI 在 Codex Cookbook 中给出用 Codex CLI 改造遗留代码库的完整流程,以 COBOL 投资组合系统为示例,围绕 ExecPlan 设计文档分五个阶段推进。

    推荐理由:以 COBOL 投资组合系统为例,给出用 Codex CLI 分阶段改造遗留代码的可复用文档与验证流程。

8/29周五
  1. OpenAI · Codex Cookbook74

    在 GitLab CI/CD 中用 Codex CLI 自动做代码质量检查与安全修复

    OpenAI Codex Cookbook 给出把 Codex CLI 接入 GitLab CI/CD 的完整做法,用于生成 CodeClimate JSON 代码质量报告、把 SAST 结果整理成 security_priority.md,并让 Codex 输出可 git apply 的补丁。

    推荐理由:官方 Cookbook 给出把 Codex CLI 接入 GitLab CI 的完整配置,含提示词约束、JSON 标记提取与 diff 校验,可直接照搬。

6/4周三
  1. Martin Fowler · Exploring Generative AI66

    自主编码智能体实测:一次 OpenAI Codex 运行记录

    Martin Fowler 给 OpenAI Codex 布置了一个前端标签格式化的化妆类小任务,并完整公开了 Codex 的日志和生成的 PR。日志显示 Codex 主要靠 grep 反复文本搜索定位代码,中途因把 AGENTS.md 误写成 AGENT.md 来回折腾,还因删掉 .yarnrc 导致测试无法运行,最终 PR 里有两个回归测试失败。

    推荐理由:作者完整记录 Codex 自主完成一次前端小任务的日志,并对比 6 次运行结果,展示后台编码智能体在环境配置和代码复用上的真实短板。