Augment выпустила на платформе Cosmos инструмент Project Builder — эксперта Cosmos, который превращает описание функции в проектный документ на основе реальной кодовой базы; после ручной проверки он распределяет задачи между рабочими агентами, доводит реализацию до слияния.
Почему это важно: Augment официально раскрыла, как в Project Builder устроены проверка проектного документа и распределение задач, а также привела объём кода и сроки запуска трёх продакшн-проектов — по этим данным можно оценить, насколько жизнеспособен подход «сначала проектирование, затем оркестрация ИИ-агентов».
Terminal-Bench выпустил версию 2.0 и пакет Harbor: первый — это более строго проверенный и сложный бенчмарк для оценки агентов, второй — для их оценки и оптимизации. Harbor переписал тестовый фреймворк Terminal-Bench: теперь можно разворачивать контейнеры в облаке, есть интерфейсы rollout для RL и SFT, а также совместимость с любыми агентами, которые упаковываются в контейнер.
Anthropic одновременно запустила собственную систему Skills в Claude Code, Claude.ai и Claude API, и вскоре автор Джесси Винсент выпустил новую версию Superpowers, переведённую на официальные Skills.
Почему это важно: Опираясь на почти месяц реального использования, автор сравнивает официальные Skills с собственными решениями и рассказывает, чем пришлось пожертвовать при переходе.