Ryan Lopopolo 认为,AI 让验证问题变得明显,因为每个真实任务都依赖一个我们几乎从不写下来的问题,即怎样才算把活干好。产出和评审都涉及语气、品味、风险容忍度、打磨程度、可接受的捷径和完成标准等大量非功能性决策,过去团队靠组织设计、社交规范、招聘和入职把这些隐含规则传递给人,而模型无法走招聘流程,因此交给它的任务基本都欠规范。
В блоге разработчиков OpenAI рассказывается, как системно тестировать Agent Skill в Codex с помощью evals и заменить «стало казаться лучше» на сравнимые баллы.
Почему это важно: Полный процесс системной проверки Skill в Codex с помощью eval — от определения критериев успеха до детерминированных проверок и оценки.
11.01вс
воскресенье
OpenAI Developer Blog · CodexИзбранное редакциейОценка ИИ7171
Автор на практике проверил новую поддержку Skills в OpenAI Codex CLI: пока функция скрыта за фич-флагом, включить её можно командой codex --enable skills.
Почему это важно: Автор протестировал поддержку Skills в Codex, сравнил её с тем, как загружаются Skills в Claude Code, и показал структуру каталогов и правила срабатывания.
OpenAI в Codex Cookbook описывает полный процесс переделки легаси-кодовой базы с помощью Codex CLI на примере системы управления инвестиционным портфелем на COBOL: пять этапов вокруг проектного документа ExecPlan.
Почему это важно: На примере системы управления инвестиционным портфелем на COBOL показаны переиспользуемые документы и процесс проверки для поэтапной переделки легаси-кодовой базы с помощью Codex CLI.
Почему это важно: Автор перенёс систему SKILL.md из Claude в Codex CLI, показал соответствие инструментов и способ установки — по этому можно судить, реально ли переиспользовать Skill между моделями.
OpenAI Developer Blog · CodexИзбранное редакциейОценка ИИ6464