Вышел AI Hero Skills v1.3: добавлены три навыка — /implement-spec, /pr и /retro, а основной процесс, который раньше шёл от /grill-with-docs через /to-spec к /to-tickets, теперь охватывает ещё реализацию, пул-реквесты и ретроспективу.
Почему это важно: Автор достроил набор навыков до полной цепочки — от написания спецификации до пул-реквеста и ретроспективы — и рассказал, чем пришлось пожертвовать на каждом этапе и что пока сделано грубо.
1 октября команда Earendil выпустила Agent Harness Pi 1.0: у репозитория на GitHub около 11.1 тыс. звёзд и 1.4 тыс. форков, а вместе с ним — экспериментальный пакет Pi Durable.
Почему это важно: Pi 1.0 и Pi Durable переносят в среду выполнения агентов распределённые концепции — контрольные точки, идемпотентные коммиты, дерево владения, — и по ним можно судить об инженерных компромиссах при долго работающих агентах.
Открытый проект Paseo собирает командные агенты Claude Code, Codex, OpenCode и Pi в одном интерфейсе управления; при этом все агенты по-прежнему работают локально на компьютере. На данный момент у проекта 18700+ звёзд.
Почему это важно: В оригинале показан подход, при котором несколько командных агентов собираются в единый интерфейс и задачи передаются между агентами — это пригодится разработчикам, которые одновременно запускают несколько агентов.
Lovable выпустила Chats — агента, который работает на уровне рабочего пространства, может вести диалог между проектами и запускать сборку. После подтверждения изменений он передаёт задачу builder-агенту внутри проекта и возвращает ход выполнения обратно в диалог.
Почему это важно: Lovable раскрыла трёхуровневую архитектуру Chats: траектории, входящие сообщения и активация. Её можно перенести на собственную оркестрацию мультиагентных систем.
Почему это важно: Официально описаны процессы мониторинга и проверки безопасности для этих двух ботов — читатели могут оценить, можно ли встроить их в существующий конвейер доставки.
Lovable выпустила Opus 5.5; по заявлению компании, результаты сопоставимы с Opus 5, но число шагов до завершения сократилось на треть–половину. На внутреннем бенчмарке Lovable Opus 5.5 сравнялся с Opus 5 в двух задачах — сборке от 0 до -1 и итеративных правках кода — и превзошёл его на 4%–6% по дисциплине проверки; при всех уровнях интенсивности рассуждений число шагов на задачу снизилось на 26%–57%, а объём входных токенов — на 21%–59%; различия значимы при доверительном уровне 95%.
Почему это важно: Lovable официально приводит данные сравнения Opus 5.5 и Opus 5 по числу шагов и токенов — по ним можно оценить реальное изменение эффективности сборки.
Lovable выпустила превью-движок OJ, с нуля реализованный на Rust: он читает существующий vite.config.ts и через слой совместимости запускает настоящие плагины Vite — один бинарник, без установки инструментов в проект.
Почему это важно: Lovable переписала превью-движок OJ на Rust и привела сравнение с Vite по холодному старту и потреблению памяти, а также данные канареечного развёртывания в продакшене.
Cline выпустил раннюю версию открытого настольного приложения Cline Desktop: фреймворк для запуска ИИ-агентов, который раньше жил в расширении для VS Code и в CLI, переехал в отдельное рабочее пространство. Поддерживаются параллельные сессии, задачи по расписанию и Marketplace для расширения инструментов и интеграций.
Почему это важно: В официальной документации описаны границы возможностей настольной версии и открытые точки входа — по ним можно оценить, подходит ли она для параллельных задач с участием нескольких ИИ-агентов.
Cursor выпустил функцию «Проекты» для длительной работы — например, над одной фичей, миграцией или целым приложением. Она месяцами удерживает контекст и делегирует задачи тысячам подчинённых ИИ-агентов. Проекты работают на облачных агентах: координирующий агент не пишет код, а только планирует, распределяет задачи и принимает результаты; когда нужны локальные тесты, он запускает локальных агентов. В каждом проекте поддерживается набор файлов, синхронизируемых между облаком и локальными машинами, — так постепенно накапливаются результаты исследований, артефакты и понимание кодовой базы.
Почему это важно: В официальном описании приведены механизмы совместного использования контекста и автоматического запуска для многолетней работы нескольких агентов в рамках проекта — по ним можно понять, как именно берут на себя длительные задачи.
05.09сб
суббота
GitHub Blog · CopilotИзбранное редакциейОценка ИИ7171
GitHub выпустил Project HydraFusion в Copilot CLI в статусе исследовательского превью: оркестрация на уровне рантайма выбирает, какая модель из нескольких провайдеров будет выполнять задачу. Пользователь выбирает HydraFusion так же, как обычную модель, а оплата идёт по стандартным тарифам каждой модели.
Почему это важно: GitHub приводит сравнение трёх режимов оркестрации HydraFusion и трёх базовых вариантов по стоимости и качеству — по нему можно судить, что даёт многомодельная оркестрация на реальных задачах программирования.
Машины, артефакты сборки и секреты остаются на вашей инфраструктуре, а вызовы инструментов агент обрабатывает локально. My Machines подключает отдельный ноутбук к личному рабочему процессу, а Team Pool — это именованные воркеры для команды или компании: ёмкость растёт по запросу и уменьшается при отключении воркера, а пул не привязан к репозиторию и возобновляет работу после спящего режима в течение окна переподключения.
Почему это важно: В статье описаны пуловое планирование и подключение песочниц для self-hosted машин — по этому описанию можно понять, останется ли выполнение инструментов внутри вашей сети.
21.08пт
пятница
OpenAI Developer Blog · CodexИзбранное редакциейОценка ИИ6565
OpenAI представила Daybreak — набор инструментов для защиты, объединяющий ChatGPT, Codex Security и открытый CLI Codex Security. Он покрывает проверку пул-реквестов до слияния, разбор репозиториев и накопившихся уязвимостей, а также регулярные проверки в CI.
Почему это важно: В официальной документации описан полный сценарий работы с Codex Security — от проверки пул-реквестов и сканирования репозиториев до пакетного сканирования через CLI. По нему можно понять, как встроить инструмент в существующие процессы безопасности.
Cursor обновил облачного агента и Cursor harness: теперь облачный агент может подписываться на источники событий и возобновлять работу при новых изменениях в PR, обсуждениях в Slack или по расписанию, продолжая работу до завершения — исправляя проблемы CI и обрабатывая комментарии ботов.
Почему это важно: Облачный агент переходит от однократного выполнения к подписке на события и постоянному сопровождению PR и обсуждений в Slack — читатели могут оценить, как меняются границы автоматизации.
OpenAI Developer Blog · CodexИзбранное редакциейОценка ИИ7171
OpenAI выложила в открытый доступ harness, на котором работают приложение Codex, CLI и расширения для IDE, а через клиентский протокол Codex app-server открыла такие возможности, как создание потоков, запуск раундов, получение событий и обработка запросов на утверждение.
Почему это важно: Компания официально опубликовала harness Codex и протокол app-server — по ним можно понять, как встраивать ИИ-агентов в собственные продукты и где проходят границы такого встраивания.
Augment Code расширил свою систему ревью Cosmos с код-ревью до полного замкнутого цикла от PR до слияния, добавив четыре возможности: Verifier, PR Fixer, Review Dashboard и cosmos approve. За анализ рисков, построчную проверку корректности, ревью дизайна, проверку во время выполнения и исправление отвечают отдельные специализированные эксперты.
Почему это важно: Augment расширил код-ревью до замкнутого цикла от PR до слияния, охватывающего исправление, проверку и согласование, — читатели могут оценить, как на практике распределяются роли между несколькими ИИ-агентами.
10.08пн
понедельник
Hacker News · Claude Code 高分Избранное редакциейОценка ИИ8383
Vercel выпустил новую версию API v0 — программный, безголовый доступ к агентам генерации приложений v0: отправляешь промпт, v0 создаёт приложение, поднимает сервер разработки в Vercel Sandbox и возвращает URL превью, который можно встроить в свой интерфейс. API уже доступен.
Команда Terminal-Bench выпустила набор новых возможностей Harbor: датасеты теперь можно публиковать по версиям, а таблицу лидеров — переносить на новую версию, для чего нужно либо переиспользовать, либо переоценить, либо перезапустить trial. Задачи версионируются семантически: при изменениях уровня патча старые результаты просто переиспользуются, при изменениях валидатора достаточно переоценить уже сохранённые артефакты, и только существенные изменения, заметно меняющие среду ИИ-агента, требуют перезапуска. Версия датасета соответствует максимальной версии среди задач, а таблица лидеров через diff перезапускает только задачи с существенными изменениями.
Почему это важно: Команда Terminal-Bench относится к бенчмарку как к программному обеспечению и описывает конкретный механизм семантического версионирования задач и обновления таблицы лидеров, который можно перенести в собственный процесс оценки.
20.07пн
понедельник
OpenAI Developer Blog · CodexИзбранное редакциейОценка ИИ7171
OpenAI добавила в Codex Code Review возможность задавать собственные правила для репозитория: в AGENTS.md можно описать указания по ревью, и Codex применит их при проверке и сошлётся на источник в выводах. По данным официальных тестов, версия с правилами нашла 98% необходимых кастомных проблем, тогда как в контрольной группе — 58.3%. Правила стоит начинать с неочевидных инвариантов вроде требований к совместимости или границ данных: правила уровня репозитория кладём в корень, правила уровня сервиса — в соответствующий каталог, а форматирование и механические проверки по-прежнему оставляем CI.
Почему это важно: OpenAI рассказывает, какие возможности даёт настройка правил в Codex Code Review, как их писать и что показывают тесты, — по этому можно решить, как закрепить опыт ревью команды в AGENTS.md.