Перейти к содержимому
Оригинал
Augment Code · Blog·· 30.04.2026Избранное редакциейОценка ИИ71

Augment Code проверила на практике правила в стиле Карпати: ИИ-агент для разработки не написал код лучше, но сделал это быстрее и дешевле

Оригинальный заголовок: Karpathy skills on OpenClaw: agents don't write better code. But they do it more efficiently.

Краткий обзор ИИ

Augment Code добавила в начало AGENTS.md около 2.5 тыс. символов правил кодирования в стиле Карпати и сравнила, как Auggie, Claude Code и Codex справляются с 40 пул-реквестами OpenClaw.

Почему это важно

Сравнительный тест трёх ИИ-агентов для разработки на одной и той же партии пул-реквестов показывает: ограничения в промпте в основном экономят деньги, а не повышают качество, и при этом каждый харнесс работает по-своему.

Полный текст · Перевод ИИ

Мы добавили правила кодирования в духе Карпати в корень AGENTS.md и прогнали трёх ИИ-агентов для разработки через 40 пул-реквестов OpenClaw. Судья оценил качество кода как практически неизменное, но агенты приходили к тем же решениям с меньшими усилиями: меньше вызовов инструментов и чтений файлов, стабильно ниже время и затраты.

Мы протестировали Auggie, Claude Code и Codex на 40 пул-реквестах из OpenClaw. Для каждого PR мы запускали каждого агента дважды: один раз с существующим AGENTS.md, другой — с AGENTS.md, к которому в начало файла было добавлено около 2.5 тыс. символов правил кодирования в стиле Карпати.

Правила Карпати — это как раз то, что обычно пишут вверху командного гайдлайна.

Вот краткое резюме:

Короче говоря: решай задачу, не выходи за её рамки, не блуждай.

Схема эксперимента:

  • 40 отобранных вручную пул-реквестов из OpenClaw средней сложности (100–300 строк кода без учёта тестов)
  • Три исполнителя: Auggie на Opus 4.7, Claude Code на Opus 4.7, Codex на GPT-5.4
  • Две версии для каждого PR: базовая AGENTS.md (~18 тыс. символов) и AGENTS-karpathy.md (~20.5 тыс. символов)
  • По 6 запусков на каждую конфигурацию, всего 18 повторов на каждый отдельный PR
  • Оценка судьёй-LLM по полноте, корректности, соблюдению лучших практик, переиспользованию кода и непрошеной документации

Что мы не проверяли:

  • Мы не проверяли, как рекомендации в стиле Карпати влияют на простые или сложные PR, поэтому эффект может быть другим. К тому же они подходят не для всех AGENTS.md.
  • Мы провели тест на другом репозитории, где инструкции сильно пересекаются со skill Карпати, и, как и ожидалось, статистически значимой разницы не оказалось.

Затраты, время и количество токенов снизились

Каждый исполнитель сделал меньше вызовов инструментов и завершил работу быстрее. Каждая точка — это отдельный полный запуск на 40 PR. Относительное изменение считается как процент от среднего по базовым запускам (без Карпати).

Изображение поста

Базовый вариант vs Карпати — результаты за один запуск

AuggieClaude CodeCodex
Длительность−3%−7%−7%
Вызовы инструментов−3%−8%−6%
Затраты−3%−10%−8%

Снижение произошло в основном за счёт меньшего числа поисков и чтений файлов. Агенты находили нужное за меньшее количество обращений. Правда, это не всегда проходит бесследно для производительности. Доля отказов при вызовах инструментов осталась на уровне 5–8%. Направление изменения одинаково у всех исполнителей.

Количество выходных токенов снизилось примерно одинаково у всех исполнителей. В расчёте на каждый PR Карпати оказался быстрее и дешевле примерно на 30 из 40 PR. Эта закономерность сохранилась у всех трёх агентов.

Прирост эффективности на 3–10% от небольшого изменения промпта — это не прорыв модели. Но если вы запускаете ИИ-агента для разработки в масштабе, это всё равно реальные деньги, реальная задержка и реальные ресурсы.

Меньше побочных задач при том же качестве (в основном)

AuggieClaude CodeCodex
Оценка качества+0.00-0.07+0.00

По оценке судьи, код не стал лучше.

Открытые круги — базовый вариант, сплошные зелёные маркеры — Карпати. Каждая оценка находится в диапазоне [-1.0, 1.0], разница показана на графике.

Изображение поста

Результаты по оценке качества за один запуск

Auggie и Codex показали то же самое, а вот у Claude Code — -0.07 (похоже на падение от Opus к Sonnet). При этом он просел по нескольким подпоказателям: корректность снизилась на 0.07, полнота — на 0.06. Более детальный взгляд на данные объясняет причину: Claude Code с рекомендациями Карпати идёт по более консервативной траектории, трогая примерно на 5% меньше файлов за задачу.

Рекомендации в стиле Карпати работают по-разному в разных агентных фреймворках и репозиториях. Цели у них общие — задачи программной инженерии, — но базовый системный промпт и организация работы у каждой системы свои. В Codex такие рекомендации, скорее всего, добавляют полезную структуру и повышают эффективность. В Augment базовый промпт уже содержит похожие ограничения, поэтому эффект от них меньше. В Claude Code системный промпт и без того может быть сильно ограничен, так что дополнительные ограничения способны сузить пространство для исследования и ухудшить результат.

AuggieClaude CodeCodex
Общий балл+0.00-0.07+0.00
Полнота-0.02-0.06+0.01
Корректность-0.01-0.07-0.02
Лучшие практики-0.01-0.03−0.00
Повторное использование кода-0.00-0.05+0.02
Незапрошенная документация+0.06+0.05+0.06

У всех испытуемых в одну сторону сдвинулся один и тот же подпоказатель: «Незапрошенная документация» стала лучше.

Всё сходится. Правила Карпати запрещали агентам добавлять функции сверх запрошенного и «улучшать» соседний код, комментарии или форматирование. Агенты послушались и стали делать меньше незапрошенной работы.

На один PR

В среднем по всем испытуемым на один PR:

  • Стоимость и длительность: с Карпати быстрее и дешевле в 30 из 40 PR, причём у всех испытуемых
  • Качество: с Карпати всё стабильно — 20 побед из 20, кроме Claude Code

Сам код надёжнее не становился, зато путь до него сокращался.

Хороший AGENTS.md — это дешёвый слой управления, который в каком-то смысле расширяет ваш системный промпт (с поправкой на конкретные репозитории). Он задаёт поведенческие и предметные ограничения под ваш репозиторий. Эксперимент показывает, что такие рекомендации стабильно дают более быстрые и дешёвые запуски с меньшим числом вызовов инструментов, но качество остаётся прежним или падает — в зависимости от фреймворка.

Если вы запускаете агентов для разработки в больших масштабах, рекомендации в стиле Карпати могут стать бесплатным обедом, но их стоит откалибровать под вашу текущую конфигурацию.

Источник: Augment Code · Blog · augmentcode.com