Cline открывает методику оценки своих открытых моделей и выкладывает для скачивания и анализа трассировки и результаты «восхождения», стоившие больше тысячи долларов. В статье приводится Hill Climber's Checklist — пять эвристик: задать метрику-«Полярную звезду», измерить шум, разложить режимы отказа по задачам, моделям и поставщикам, не считать по умолчанию, что чем больше рассуждений, тем лучше, и сохранять закрытый оценочный набор.
Почему это важно: Cline публикует методику оценки и трассировки на тысячи долларов и даёт пять переносимых эвристик «восхождения», полезных командам, которые собирают собственный harness.
OpenAI Developer Blog · CodexИзбранное редакциейОценка ИИ7171
OpenAI выложила в открытый доступ harness, на котором работают приложение Codex, CLI и расширения для IDE, а через клиентский протокол Codex app-server открыла такие возможности, как создание потоков, запуск раундов, получение событий и обработка запросов на утверждение.
Почему это важно: Компания официально опубликовала harness Codex и протокол app-server — по ним можно понять, как встраивать ИИ-агентов в собственные продукты и где проходят границы такого встраивания.
За шесть месяцев Lovable перевела lovable.dev с месячной аудиторией 4200 на собственный хостинговый стек TanStack Start. Во время миграции оба фреймворка работали параллельно: прокси-воркер распределял трафик по маршрутам и пользователям. В итоге на код, специфичный для Next.js, осталось всего 3%.
Почему это важно: Lovable официально разобрал, как перенёс 90 тысяч строк кода с Next.js на собственный стек TanStack Start: детали параллельной работы двух фреймворков, массовой миграции силами ИИ-агентов и одного инцидента с переполнением памяти можно смело перенимать.
Эдди Османи рассказывает, как каждый день параллельно запускает от 5 до 10 ИИ-агентов, обычно не больше 5 одновременно, и раскладывает циклическую инженерию на два примитива Claude Code: goal доводит одну ограниченную задачу до проверяемого критерия завершения, а loop с фиксированным интервалом перезапускает промпт, как cron.
Почему это важно: Автор разбирает свою повседневную практику параллельного запуска от 5 до 10 ИИ-агентов на два примитива — goal и loop — и показывает, как писать переиспользуемый Skill проверки и условия остановки.
11.08вт
вторник
Paper Compute · Engineering BlogИзбранное редакциейОценка ИИ8080
Команда платформы Spotify рассказала, как развивался фоновый ИИ-агент для разработки Honk: начав с замены скриптов миграции, его постепенно подключили к сборке и проверке тестами, и темп слияния пул-реквестов вырос с 1000 за 3 месяца до 1000 за 10 дней.
Почему это важно: Команда Spotify разбирает путь Honk от скриптов миграции до фонового ИИ-агента для разработки, уделяя особое внимание тому, как верификация и стандартизация определяют, можно ли сливать сгенерированный код.
OpenAI Codex Cookbook предлагает набор репозиторных соглашений для встраивания Codex в процесс разработки: AGENTS.md хранит постоянные инструкции для репозитория, PLANS.md служит источником поэтапных планов, а сами этапы разбиваются на файлы сборки в harness/build/ — для каждого этапа указаны цели, критерии приёмки, границы и точки согласования.
Почему это важно: OpenAI официально описывает полное соглашение о структуре каталогов для ограничения Codex через AGENTS.md, PLANS.md и поэтапные файлы сборки — его можно перенести в свой репозиторий.
30.07чт
четверг
Martin Fowler · Exploring Generative AIИзбранное редакциейОценка ИИ7878
Участник технической команды Anthropic Тарик Шихипар написал статью, в которой обобщил новые правила контекстной инженерии для моделей Claude 5-го поколения. По его словам, для таких моделей, как Claude Opus 5 и Claude Fable 5, из Claude Code уже удалили более 80% системного промпта, и при этом в оценках кода не удалось измерить никаких потерь.
Почему это важно: Anthropic официально опубликовала новые правила контекстной инженерии для моделей Claude 5-го поколения и рассказала, как сокращать системный промпт, CLAUDE.md и Skills.
Augment Code предлагает циклический инжиниринг — проектирование цикла ИИ-агента, который охватывает путь от триггера и выполнения до верификации и получения результата: агент берёт на себя промежуточные шаги, а человек подключается только на контрольных точках, где нужно принять решение. В статье циклический инжиниринг сравнивается по уровням с промпт-инжинирингом и контекстным инжинирингом, а также описаны пять стадий — триггер, выполнение, верификация, результат и улучшение — и четыре командных цикла, уже работающих в продакшене: код-ревью, превращение тикета в PR, исправление уязвимостей и реагирование на инциденты.
Почему это важно: Augment Code разбивает циклический инжиниринг на пять этапов — триггер, выполнение, верификацию, результат и улучшение — и приводит четыре командных цикла, уже работающих в продакшене.
Эдди Османи описывает «фабрику ПО» как три уровня: loop, harness и factory. Фабрика — это не более умный ИИ-агент, а несколько loop с harness, которые сходятся в один шлюз проверки, а внешний цикл остаётся под управлением человека.
Почему это важно: Автор разбирает «фабрику ПО» на три уровня — loop, harness и factory — и показывает, что настоящее узкое место — проверка, а не генерация.
19.07вс
воскресенье
Hacker News · Claude Code 高分Избранное редакциейОценка ИИ8080
Автор, опираясь на опыт участия в первом code yellow в Stripe, отмечает, что после большинства code red остаются лишь разбор инцидента и уставшие инженеры, а метрики снова оказываются без внимания. Он считает, что после каждого code red нужно запускать цикл поддержки и использовать команду /goal в OpenAI Codex, чтобы превратить разовый запрос на написание кода в постоянную цель с чёткими критериями завершения: тогда постоянно работающий кластер ИИ-агентов будет следить за метриками, выполнять нужные действия и запрашивать ручную проверку.
Почему это важно: Опираясь на опыт code yellow в Stripe, автор предлагает с помощью /goal в Codex превратить разовый аварийный ремонт в долгосрочный цикл поддержки, который можно перенести в управление SLO.
08.07ср
среда
AI Hero · Skills UpdatesИзбранное редакциейОценка ИИ6565
Репозиторий skills от AI Hero выпустил v1.1: /to-prd переименован в /to-spec, /to-plan и /to-issues объединены в /to-tickets, а также добавлены новые Skill — /wayfinder, /research, /prototype и другие.
Почему это важно: Автор подробно разбирает весь процесс работы со Skill — от grilling до развёртывания — и приводит команды миграции для переименования, объединения и добавления /wayfinder. Будет полезно тем, кто хочет собрать собственный рабочий процесс для разработки с ИИ.
Martin Fowler · Exploring Generative AIИзбранное редакциейОценка ИИ7171
Команда Claude Code определяет цикл ИИ-агента как повторяющийся рабочий цикл, который выполняется до заданного условия остановки, и делит такие циклы на четыре типа — пошаговые, целевые, временные и проактивные — по четырём признакам: способу запуска, условию остановки, используемым базовым командам и типу задач.
Почему это важно: Команда Claude Code делит циклы на четыре типа — пошаговые, целевые, временные и проактивные — и описывает для каждого способ запуска, остановки и контроля токенов.
Автор Джесси Винсент в Prime Radiant использует Claude Code и работает через Slackline — консольный клиент Slack, — чтобы взаимодействовать со своим ИИ-агентом Ada: Claude предлагает изменения, Ada их рецензирует и тестирует, после чего Claude разворачивает обновления. Так замыкается цикл разработки с взаимным рецензированием между агентами.
Почему это важно: Автор показывает переносимую модель совместной разработки с участием ИИ-агентов, построенную на цикле взаимного рецензирования, тестирования и развёртывания двумя агентами.