Перейти к содержимому

Тестирование и проверка

Как добиваться от агента кода, проходящего тесты, и проверять его заявление «готово».

32 избранных материалаСвязанные темыРевью кодаHooks и автоматизацияРабочие процессы

Новые избранные материалы

Материалы 21–32 · Всего 32
22.07ср
  1. Augment Code · Blog62

    Что такое циклический инжиниринг и как его применяют ведущие команды разработки ПО

    Augment Code предлагает циклический инжиниринг — проектирование цикла ИИ-агента, который охватывает путь от триггера и выполнения до верификации и получения результата: агент берёт на себя промежуточные шаги, а человек подключается только на контрольных точках, где нужно принять решение. В статье циклический инжиниринг сравнивается по уровням с промпт-инжинирингом и контекстным инжинирингом, а также описаны пять стадий — триггер, выполнение, верификация, результат и улучшение — и четыре командных цикла, уже работающих в продакшене: код-ревью, превращение тикета в PR, исправление уязвимостей и реагирование на инциденты.

    Почему это важно: Augment Code разбивает циклический инжиниринг на пять этапов — триггер, выполнение, верификацию, результат и улучшение — и приводит четыре командных цикла, уже работающих в продакшене.

20.07пн
  1. Addy Osmani · Blog74

    Эдди Османи о «фабриках ПО»: явные и скрытые фабрики, где узкое место — проверка

    Эдди Османи описывает «фабрику ПО» как три уровня: loop, harness и factory. Фабрика — это не более умный ИИ-агент, а несколько loop с harness, которые сходятся в один шлюз проверки, а внешний цикл остаётся под управлением человека.

    Почему это важно: Автор разбирает «фабрику ПО» на три уровня — loop, harness и factory — и показывает, что настоящее узкое место — проверка, а не генерация.

11.07сб
  1. Habr · Kova13v80

    Как ограничить выводы Claude Code о тестировании с помощью договора о доказательствах: набор QA-навыков

    QA-инженер собрал полугодовой опыт веб-тестирования в Claude Code в открытый набор навыков paranoid-qa. В его основе — договор о доказательствах: статус «Пройдено/Не пройдено» можно ставить только по реальным артефактам — скриншотам, телам запросов, логам; если проверка не выполнена, пишется «Не тестировалось», если мешает окружение — «Заблокировано», а формы обязательно проверяются по реальному payload отправки.

    Почему это важно: Автор превратил полугодовой опыт QA в набор навыков для тестирования в Claude Code и приложил готовые к использованию договор о доказательствах и список типичных провалов.

08.07ср
  1. AI Hero · Skills Updates65

    Репозиторий skills от AI Hero выпустил v1.1: добавлен /wayfinder, переименованы /to-spec и /to-tickets

    Репозиторий skills от AI Hero выпустил v1.1: /to-prd переименован в /to-spec, /to-plan и /to-issues объединены в /to-tickets, а также добавлены новые Skill — /wayfinder, /research, /prototype и другие.

    Почему это важно: Автор подробно разбирает весь процесс работы со Skill — от grilling до развёртывания — и приводит команды миграции для переименования, объединения и добавления /wayfinder. Будет полезно тем, кто хочет собрать собственный рабочий процесс для разработки с ИИ.

15.06пн
  1. Jesse Vincent78

    Superpowers 6 发布:构建提速最高 50%、token 花费降低最高 60%

    Superpowers 6 发布,作者称在 Anthropic 评测基准上构建耗时降低 50%、token 花费降低 60%,主要来自合并规范符合性与代码质量两个评审 agent、预先生成评审用的 diff 包让评审者少跑 git,以及调整编排器对任务所需 agent 类型的指引。

    Ожидает перевода

    Почему это важно: 作者用自建评测套件量化了 Superpowers 6 在构建耗时和 token 花费上的改进,并公开了实验记录与失败结论。

13.03пт
  1. Ryan Lopopolo74

    智能体时代的生产函数变了:实现不再稀缺,验证才是

    作者认为,软件组织一直把人的实现时间当作稀缺投入,智能体打破了这个假设,因此策略必须可执行、验证必须随实现规模扩展。他以在大型 TypeScript 代码库开启 ESLint 的 no-await-in-loop 规则为例,发现 600 处违规,过去这需要昂贵的迁移,现在一个 PR 就能完成修复并补齐测试覆盖。

    Ожидает перевода

    Почему это важно: 作者以开启 ESLint 规则、迁移 600 处违规的亲身实践,说明智能体时代实现成本下降后,约束与验证为何成为新的稀缺环节。

09.03пн
  1. Paper Compute · Engineering Blog78

    我让 Agent 玩 1000 回合宝可梦,它始终没走出卧室

    作者构建的宝可梦红版自主 Agent 跑了 1000 回合仍停在卧室,原因是它把背景瓦片图地址 0xC4F2 当成文本框状态标志,一直按 A 键却不知道卡住。

    Ожидает перевода

    Почему это важно: 作者用 1000 回合卡在卧室的失败复盘,说明记录并回放 Agent 会话状态比改提示词更能定位静默故障。

23.02пн
  1. OpenAI Developer Blog · Codex72

    用 Codex 跑 25 小时长时程任务:一份可复用的项目记忆文件栈

    OpenAI 用 GPT-5.3-Codex 在 Extra High 推理档下从空仓库连续运行约 25 小时、消耗约 13M token、生成约 3 万行代码,做出一个可测试的设计工具。

    Ожидает перевода

    Почему это важно: 作者用 25 小时、13M token 的实测展示长时程智能体如何靠持久化项目记忆和逐里程碑验证保持不跑偏。

22.01чт
  1. OpenAI Developer Blog · Codex82

    Системное тестирование Agent Skills в Codex с помощью Evals

    В блоге разработчиков OpenAI рассказывается, как системно тестировать Agent Skill в Codex с помощью evals и заменить «стало казаться лучше» на сравнимые баллы.

    Почему это важно: Полный процесс системной проверки Skill в Codex с помощью eval — от определения критериев успеха до детерминированных проверок и оценки.

19.11ср
  1. OpenAI · Codex Cookbook67

    Как поэтапно переделать легаси-кодовую базу с помощью Codex CLI

    OpenAI в Codex Cookbook описывает полный процесс переделки легаси-кодовой базы с помощью Codex CLI на примере системы управления инвестиционным портфелем на COBOL: пять этапов вокруг проектного документа ExecPlan.

    Почему это важно: На примере системы управления инвестиционным портфелем на COBOL показаны переиспользуемые документы и процесс проверки для поэтапной переделки легаси-кодовой базы с помощью Codex CLI.

29.08пт
  1. OpenAI · Codex Cookbook74

    在 GitLab CI/CD 中用 Codex CLI 自动做代码质量检查与安全修复

    OpenAI Codex Cookbook 给出把 Codex CLI 接入 GitLab CI/CD 的完整做法,用于生成 CodeClimate JSON 代码质量报告、把 SAST 结果整理成 security_priority.md,并让 Codex 输出可 git apply 的补丁。

    Ожидает перевода

    Почему это важно: 官方 Cookbook 给出把 Codex CLI 接入 GitLab CI 的完整配置,含提示词约束、JSON 标记提取与 diff 校验,可直接照搬。

04.06ср
  1. Martin Fowler · Exploring Generative AI66

    自主编码智能体实测:一次 OpenAI Codex 运行记录

    Martin Fowler 给 OpenAI Codex 布置了一个前端标签格式化的化妆类小任务,并完整公开了 Codex 的日志和生成的 PR。日志显示 Codex 主要靠 grep 反复文本搜索定位代码,中途因把 AGENTS.md 误写成 AGENT.md 来回折腾,还因删掉 .yarnrc 导致测试无法运行,最终 PR 里有两个回归测试失败。

    Ожидает перевода

    Почему это важно: 作者完整记录 Codex 自主完成一次前端小任务的日志,并对比 6 次运行结果,展示后台编码智能体在环境配置和代码复用上的真实短板。