В блоге разработчиков OpenAI рассказывается, как системно тестировать Agent Skill в Codex с помощью evals и заменить «стало казаться лучше» на сравнимые баллы.
Почему это важно: Полный процесс системной проверки Skill в Codex с помощью eval — от определения критериев успеха до детерминированных проверок и оценки.
11.01вс
воскресенье
OpenAI Developer Blog · CodexИзбранное редакциейОценка ИИ7171
Автор на практике проверил новую поддержку Skills в OpenAI Codex CLI: пока функция скрыта за фич-флагом, включить её можно командой codex --enable skills.
Почему это важно: Автор протестировал поддержку Skills в Codex, сравнил её с тем, как загружаются Skills в Claude Code, и показал структуру каталогов и правила срабатывания.
Когда автор разрабатывает веб-приложение с помощью ИИ-агента, он часто натыкается на баги в клиентском JavaScript. Если агент не может решить их, просто читая код, он запускает интерактивную отладку через браузерный MCP — только чтобы посмотреть логи в консоли браузера. И токены тратятся, и медленно.
Почему это важно: Автор предлагает переиспользуемый способ организовать мост логов между фронтендом и бэкендом, чтобы ИИ-агент видел логи фронтенда и без браузерного MCP.
OpenAI в Codex Cookbook описывает полный процесс переделки легаси-кодовой базы с помощью Codex CLI на примере системы управления инвестиционным портфелем на COBOL: пять этапов вокруг проектного документа ExecPlan.
Почему это важно: На примере системы управления инвестиционным портфелем на COBOL показаны переиспользуемые документы и процесс проверки для поэтапной переделки легаси-кодовой базы с помощью Codex CLI.
Почему это важно: Автор перенёс систему SKILL.md из Claude в Codex CLI, показал соответствие инструментов и способ установки — по этому можно судить, реально ли переиспользовать Skill между моделями.
OpenAI Developer Blog · CodexИзбранное редакциейОценка ИИ6464
Anthropic одновременно запустила собственную систему Skills в Claude Code, Claude.ai и Claude API, и вскоре автор Джесси Винсент выпустил новую версию Superpowers, переведённую на официальные Skills.
Почему это важно: Опираясь на почти месяц реального использования, автор сравнивает официальные Skills с собственными решениями и рассказывает, чем пришлось пожертвовать при переходе.
15.10ср
среда
Martin Fowler · Exploring Generative AIИзбранное редакциейОценка ИИ7474
Автор Джесси Винсент выпустил Superpowers — набор Skill на основе новой плагинной системы Claude Code. После установки плагин через hook session-start внедряет вводные подсказки, чтобы Claude сам искал и применял Skill.
Почему это важно: Автор упаковал свой рабочий процесс с ИИ-агентом для разработки в устанавливаемый плагин Skill — читатели могут напрямую воспользоваться его подходом от мозгового штурма до реализации через TDD.
Автор описал свой полный процесс работы с Claude Code: сначала изолировал задачи с помощью git worktree, затем с помощью промпта для мозгового штурма заставлял Claude задавать по одному вопросу и поэтапно уточнять дизайн, после чего с помощью промпта для планирования разбивал план на небольшие задачи и записывал их в docs/plans/.
Почему это важно: Автор разделил работу с Claude Code на две сессии — архитектора и реализатора — и привёл промпты для повторного использования, а также способ изоляции через git worktree.
Команда Anthropic, занимающаяся прикладным ИИ, пишет, что контекстный инжиниринг — продолжение промпт-инжиниринга, а его суть в том, чтобы при ограниченном бюджете внимания отобрать минимальный набор токенов с высоким сигналом.
Почему это важно: Anthropic официально описывает системный подход к контекстному инжинирингу, включая выбор между тремя стратегиями для длительных задач: сжатием, заметками и субагентами.
Автор переписал правила CLAUDE.md — вместо длинного текста получилась блок-схема на языке dot из GraphViz: имена узлов заданы строками в кавычках, разные формы обозначают решения, команды и предупреждения, а у каждого шага есть явное условие запуска.
Почему это важно: После того как правила CLAUDE.md превратились в граф на dot из GraphViz, Claude стал лучше их соблюдать. Этот подход можно перенести и на свои проекты.
Команда Manus поделилась опытом контекстной инженерии, накопленным при создании ИИ-агентов. В основе — проектирование с учётом KV-кэша, управление инструментами через маскирование, а не удаление, использование файловой системы как контекста, управление вниманием через повторение списка задач, сохранение ошибочного содержимого и отказ от привязки к few-shot примерам.
Почему это важно: Команда Manus обобщила опыт четырёх переписываний фреймворка агентов в шесть принципов контекстной инженерии — их можно напрямую применить к собственной реализации агента.