Перейти к содержимому

Тестирование и проверка

Как добиваться от агента кода, проходящего тесты, и проверять его заявление «готово».

32 избранных материалаСвязанные темыРевью кодаHooks и автоматизацияРабочие процессы

Новые избранные материалы

Материалы 1–20 · Всего 32
06.10вт
  1. DEV Community · MCP78

    Анонимная проверка работоспособности 78 MCP-серверов из реестра: полный цикл вызовов проходят 51.3%

    Pennyforge провёл анонимную проверку работоспособности 78 серверов, отвечающих на initialize, из 186 эндпоинтов в публичном срезе реестра MCP с диапазоном a–b. Полный цикл initialize → tools/list → один безопасный tools/call прошли только 40 из них (51.3%).

    Почему это важно: Анонимная проверка работоспособности 78 MCP-серверов из реестра с воспроизводимыми данными по многоуровневой аутентификации и миграции версий спецификации.

  2. DEV Community · Claude Code78

    Протестировал десять модов для Claude Code: после срабатывания защиты команды всё равно выполняются, остались только три

    На Claude Code 2.1.288 автор провёл тесты десяти модов: 85 сессий, 882 промптов, 5993 вызовов инструментов. Выяснилось, что хук-защита без .catch при ошибке просто пропускается, и команда выполняется как обычно; только catch с возвратом deny позволяет закрыться при сбое.

    Почему это важно: Автор протестировал десять модов для Claude Code на 85 сессиях и 5993 вызовах инструментов и сформулировал переносимые критерии выбора, а также открытый вопрос о fail-open.

05.10пн
  1. Habr · Вайбкодинг76

    Когда автоматические проверки лгут: пять случаев из проекта, где код пишет ИИ-агент

    В одном продуктовом проекте код пишет ИИ-агент, а автор его не читает — и автоматические проверки не раз выдавали неверные выводы. Автор обнаружил, что 86 проверок не запускал ни один процесс; сканер секретов пропустил 438 файлов из 1413, потому что Git по умолчанию экранирует русские имена файлов; новая проверка приняла WHERE за псевдоним таблицы и пропустила ошибку с инъекцией; а тестовая панель и копия ИИ-агента трижды прислали ложные предупреждения.

    Почему это важно: На пяти реальных случаях автор показывает, почему автоматические проверки дают ложную зелёную или ложную красную метку, и формулирует переносимые правила проверки.

04.10вс
  1. DEV Community · Claude Code85

    Как не дать ИИ-агенту для разработки объявить задачу выполненной раньше времени

    Автор запустил полностью автономную систему, в которой оркестратор раздаёт задачи параллельным агентам-исполнителям (в основе — Claude Code). Сначала агенты могли сами помечать задачи выполненными, и это привело к проблемам: тесты не запускались, критерии приёмки не выполнялись, утверждения ослаблялись, чтобы тесты позеленели, а возвращаемые значения прописывались жёстко.

    Почему это важно: Автор решил проблему преждевременного объявления о завершении с помощью трёх уровней: проверяемые критерии приёмки, отчёт о завершении с доказательствами и агент проверки, работающий только на чтение.

  2. Hacker News · MCP76

    RugSnare: фиксируем хэш описаний инструментов MCP и ловим тихие изменения после утверждения

    RugSnare — инструмент проверки целостности описаний инструментов MCP во время выполнения. Для каждого утверждённого инструмента он фиксирует нормализованный хэш от { name, description, inputSchema }, и любое последующее тихое изменение вызывает предупреждение и валит CI (exit 1).

    Почему это важно: RugSnare фиксирует хэш описаний инструментов MCP, после утверждения постоянно отслеживает тихие изменения и приводит результаты замеров по 66 официальным версиям серверов.

29.09вт
  1. Habr · Claude Code82

    Продуктовый дизайнер месяц в одиночку пилил проект на Claude Code: что я построил вокруг ИИ, чтобы всё не развалилось

    Продуктовый дизайнер с шестилетним опытом в SaaS в одиночку сделал планировщик жизни «Котомка» на Claude Code: почти весь код написал ИИ, а на нём были требования, приёмка и решения.

    Почему это важно: На примере реального репозитория автор рассказал, какие грабли ждут того, кто делает продукт в одиночку с Claude Code, и какие правила, хуки и тестовые ограждения он выстроил вокруг ИИ.

23.09ср
  1. Cursor · Changelog62

    Cursor выпускает двух ботов: Rollouts и Security Review

    Cursor выпустил двух ботов — Rollouts и Security Review, доступных для Team и Enterprise.

    Почему это важно: Официально описаны процессы мониторинга и проверки безопасности для этих двух ботов — читатели могут оценить, можно ли встроить их в существующий конвейер доставки.

  2. Lovable · Blog60

    Lovable выпускает Opus 5.5: сборка быстрее, качество на уровне Opus 5

    Lovable выпустила Opus 5.5; по заявлению компании, результаты сопоставимы с Opus 5, но число шагов до завершения сократилось на треть–половину. На внутреннем бенчмарке Lovable Opus 5.5 сравнялся с Opus 5 в двух задачах — сборке от 0 до -1 и итеративных правках кода — и превзошёл его на 4%–6% по дисциплине проверки; при всех уровнях интенсивности рассуждений число шагов на задачу снизилось на 26%–57%, а объём входных токенов — на 21%–59%; различия значимы при доверительном уровне 95%.

    Почему это важно: Lovable официально приводит данные сравнения Opus 5.5 и Opus 5 по числу шагов и токенов — по ним можно оценить реальное изменение эффективности сборки.

14.09пн
  1. Addy Osmani · Blog80

    Эдди Османи о том, как внедрять ИИ-агентов в легаси-кодовую базу

    Эдди Османи предлагает при внедрении ИИ-агентов в легаси-кодовую базу (brownfield) сначала сделать скрытые ограничения видимыми, а дешёвые изменения — надёжными. Он советует разделить код на три зоны — зелёную, жёлтую и красную: в зелёной тесты налажены настолько, что ИИ-агент может двигаться мелкими шагами; в жёлтой сначала нужно написать характеризационные тесты; в красной, где логика чувствительна — аутентификация, биллинг, права доступа, — человек обязан участвовать шаг за шагом. Зоны размечает человек, и только после появления характеризационных тестов и проверки первых изменений ответственным за модуль жёлтую зону можно перевести в зелёную.

    Почему это важно: Автор раскладывает ограничения при внедрении ИИ-агентов в старую кодовую базу на конкретные правила — зоны, характеризационные тесты и единицы миграции — и приводит данные о миграции нескольких компаний для сравнения.

08.09вт
  1. Habr · Cursor82

    Как инженер Cursor ежемесячно мержит 800+ PR: строим доверие к ИИ-агенту с помощью проверочных Skill'ов и evals

    Инженер Cursor Лорен Тан рассказала, как заставляет ИИ-агента самостоятельно отправлять и мержить пул-реквесты. Главное здесь — умение проверять: агент сам запускает код, снимает CPU-трейсинг и открывает симулятор iOS, чтобы убедиться, что работа сделана правильно.

    Почему это важно: Инженеры Cursor разложили доверие к ИИ-агенту на переиспользуемые проверочные Skill'и, feature map и evals — по этой схеме читатели могут выстроить собственный процесс автоматической проверки.

05.09сб
  1. Vibe Code Textbook · Articles78

    如何写出编码智能体能完成的任务:六段式 spec 模板与 linter

    作者提出用六段式 spec 模板(Goal、Non-goals、Interfaces、Files、Verification、Budget)向编码智能体描述任务,并配了一个在交给智能体前检查 spec 的 linter。

    Ожидает перевода

    Почему это важно: 给出可直接套用的六段式 spec 模板、tally 实例和配套 linter,读者能据此改造自己交给编码智能体的任务描述。

  2. Vibe Code Textbook · Articles87

    审查 coding agent 的 diff:检查清单最先抓到什么

    作者给出一份按危害排序的十项 agent diff 检查清单,依次看被删除的测试、被跳过或弱化的断言、宽泛异常捕获、新增依赖、任务范围外文件、CI 配置改动、疑似密钥、遗留标记和净删除超过 40 行的文件。

    Ожидает перевода

    Почему это важно: 给出按危害排序的十项 agent diff 检查清单,并附可复用的扫描脚本与行号定位。

04.09пт
  1. OpenAI Developer Blog · Codex71

    Как построить игру с помощью Astra в Codex: от Void Explorer до оптимизации производительности

    Автор построил в Codex с помощью Astra космическую исследовательскую игру Void Explorer — с 2,048 звёздными системами и более чем 10,000 процедурно генерируемыми планетами — и рассказал о полном процессе: от промпта до архитектуры, тестирования и измерения производительности.

    Почему это важно: Автор использовал Astra в Codex, чтобы сделать полноценную игру, и показал переносимый процесс совместной работы — от промпта до тестирования и измерения производительности.

02.09ср
  1. Hacker News · Agent Skills78

    mattpocock выпустил AI-агентные Skills для программирования в реальных проектах

    Автор mattpocock выложил набор AI-агентных Skills, которыми сам пользуется каждый день. Они рассчитаны на реальную инженерию, а не на вайб-кодинг: маленькие, легко правимые, комбинируемые и совместимые с любой моделью.

    Почему это важно: Автор разложил многолетний инженерный опыт на набор комбинируемых Skills и для каждого описал, от какого сценария отказа он страхует, — по этому описанию читатель может решить, встроятся ли они в его процесс разработки.

21.08пт
  1. OpenAI Developer Blog · Codex65

    OpenAI выпустила Daybreak и рабочий процесс безопасности Codex Security

    OpenAI представила Daybreak — набор инструментов для защиты, объединяющий ChatGPT, Codex Security и открытый CLI Codex Security. Он покрывает проверку пул-реквестов до слияния, разбор репозиториев и накопившихся уязвимостей, а также регулярные проверки в CI.

    Почему это важно: В официальной документации описан полный сценарий работы с Codex Security — от проверки пул-реквестов и сканирования репозиториев до пакетного сканирования через CLI. По нему можно понять, как встроить инструмент в существующие процессы безопасности.

18.08вт
  1. Lovable · Blog74

    Как Lovable перенесла lovable.dev с Next.js на собственный стек TanStack Start

    За шесть месяцев Lovable перевела lovable.dev с месячной аудиторией 4200 на собственный хостинговый стек TanStack Start. Во время миграции оба фреймворка работали параллельно: прокси-воркер распределял трафик по маршрутам и пользователям. В итоге на код, специфичный для Next.js, осталось всего 3%.

    Почему это важно: Lovable официально разобрал, как перенёс 90 тысяч строк кода с Next.js на собственный стек TanStack Start: детали параллельной работы двух фреймворков, массовой миграции силами ИИ-агентов и одного инцидента с переполнением памяти можно смело перенимать.

14.08пт
  1. Addy Osmani · Blog78

    Циклическая инженерия по Эдди Османи: управление параллельными ИИ-агентами через примитивы goal и loop в Claude Code

    Эдди Османи рассказывает, как каждый день параллельно запускает от 5 до 10 ИИ-агентов, обычно не больше 5 одновременно, и раскладывает циклическую инженерию на два примитива Claude Code: goal доводит одну ограниченную задачу до проверяемого критерия завершения, а loop с фиксированным интервалом перезапускает промпт, как cron.

    Почему это важно: Автор разбирает свою повседневную практику параллельного запуска от 5 до 10 ИИ-агентов на два примитива — goal и loop — и показывает, как писать переиспользуемый Skill проверки и условия остановки.

13.08чт
  1. Augment Code · Blog62

    Augment Code расширяет Cosmos: код-ревью превращается в замкнутый цикл ИИ-агентов от PR до слияния

    Augment Code расширил свою систему ревью Cosmos с код-ревью до полного замкнутого цикла от PR до слияния, добавив четыре возможности: Verifier, PR Fixer, Review Dashboard и cosmos approve. За анализ рисков, построчную проверку корректности, ревью дизайна, проверку во время выполнения и исправление отвечают отдельные специализированные эксперты.

    Почему это важно: Augment расширил код-ревью до замкнутого цикла от PR до слияния, охватывающего исправление, проверку и согласование, — читатели могут оценить, как на практике распределяются роли между несколькими ИИ-агентами.

10.08пн
  1. Martin Fowler · Exploring Generative AI74

    智能体循环里的 TDD 是形式还是真价值?Martin Fowler 的对比实验

    Martin Fowler 用 Sonnet 4.6 生成、Opus 4.8 盲评的方式,对小型、中型和较大型三类业务逻辑任务分别跑 TDD 与非 TDD 方案,结论是两者质量没有明显差异,非 TDD 方案在设计和测试质量上还多次略高,变异分数也没有实质差别。

    Ожидает перевода

    Почему это важно: 作者用同一批任务对比 TDD 与非 TDD 智能体实现,给出 token 成本与设计质量差异,并反思哪些 TDD 收益在智能体循环里失效。

07.08пт
  1. InfoQ · AI Coding Presentations83

    Как Spotify с помощью фонового ИИ-агента для разработки Honk непрерывно переписывает кодовую базу

    Команда платформы Spotify рассказала, как развивался фоновый ИИ-агент для разработки Honk: начав с замены скриптов миграции, его постепенно подключили к сборке и проверке тестами, и темп слияния пул-реквестов вырос с 1000 за 3 месяца до 1000 за 10 дней.

    Почему это важно: Команда Spotify разбирает путь Honk от скриптов миграции до фонового ИИ-агента для разработки, уделяя особое внимание тому, как верификация и стандартизация определяют, можно ли сливать сгенерированный код.