用 Evals 系统性测试 Codex 的 Agent Skills
OpenAI 开发者博客介绍如何用 evals 系统性测试 Codex 的 Agent Skill,把「感觉变好了」换成可比较的分数。
推荐理由:给出用 eval 系统性验证 Codex Skill 的完整流程,从定义成功标准到确定性检查与评分。
最佳实践、可复现的工作流和带命令、配置的教程。
OpenAI 开发者博客介绍如何用 evals 系统性测试 Codex 的 Agent Skill,把「感觉变好了」换成可比较的分数。
推荐理由:给出用 eval 系统性验证 Codex Skill 的完整流程,从定义成功标准到确定性检查与评分。
Skyscanner 工程师把 OpenAI 的 Codex CLI 接入 JetBrains IDE 的 MCP server,让 Codex 能调用 IDE 的 get_file_problems 检查文件错误、执行预设的 run configurations 跑测试和 lint。
推荐理由:Skyscanner 工程师把 Codex CLI 接入 JetBrains MCP,让 AI 直接读取 IDE 报错并跑测试,读者可借鉴这套反馈闭环。
作者把 Wordiest 最后一个 Android APK 交给 Codex + ChatGPT 5.2,半小时内得到可玩的核心游戏,几小时后完成 Android 与 iOS 版本,全程未写也未读一行代码。
推荐理由:作者用 Codex 反编译 Android 游戏并移植到 iOS,展示了智能体开发中难易直觉失效的真实体验。
作者实测 OpenAI Codex CLI 新增的 Skills 支持,该功能目前藏在 feature flag 后,需用 codex --enable skills 开启。
推荐理由:作者实测 Codex 的 Skills 支持,对比 Claude Code 的加载方式,并给出目录结构与触发规则。
作者在让智能体开发 Web 应用时,常遇到客户端 JavaScript 的 bug,智能体靠读代码解决不了就会启动浏览器 MCP 交互调试,只为看浏览器控制台日志,既费 token 又慢。
推荐理由:作者给出一个可复用的前后端日志桥接做法,让编码智能体不用浏览器 MCP 也能看到前端日志。
OpenAI 在 Codex Cookbook 中给出用 Codex CLI 改造遗留代码库的完整流程,以 COBOL 投资组合系统为示例,围绕 ExecPlan 设计文档分五个阶段推进。
推荐理由:以 COBOL 投资组合系统为例,给出用 Codex CLI 分阶段改造遗留代码的可复用文档与验证流程。
作者 Jesse Vincent 用一下午把 Superpowers 和整套 SKILL.md 体系移植到 OpenAI Codex CLI,随 Superpowers 3.3.0 发布。
推荐理由:作者把 Claude 的 SKILL.md 体系移植到 Codex CLI,并给出工具映射与安装方式,可据此判断跨模型复用 Skill 的可行性。
Dagster Labs 分享了用 OpenAI Codex 加速技术文档写作、跨媒介内容转换和文档覆盖度评估的实践。他们重写了 CONTRIBUTING.md,明确文档层级、结构和最佳实践,让 Codex 能据此生成符合规范的文档;还借助 gh 命令让 Codex 解读 PR 的 diff 和描述,并让 Codex 把教程改写成 YouTube 视频脚本。
推荐理由:Dagster 团队把 Codex 用于文档写作、PR 解读和内容跨媒介转换,其中用文档生成代码来反向衡量文档覆盖度的做法可以迁移。
Anthropic 在 Claude Code、Claude.ai 和 Claude API 同步上线第一方 Skills 系统,作者 Jesse Vincent 随即发布改用官方 Skills 的 Superpowers 新版本。
推荐理由:作者以近一个月的实际使用经验,对比官方 Skills 与自建方案的差异,并给出迁移中的取舍。
Martin Fowler 试用 Kiro、spec-kit 和 Tessl 三款自称实现 spec-driven development(SDD)的工具,把 SDD 归纳为 spec-first、spec-anchored、spec-as-source 三个层次,并指出目前所有方案都停留在 spec-first。
推荐理由:作者亲手试用 Kiro、spec-kit 和 Tessl 三款 SDD 工具,给出 spec-first、spec-anchored、spec-as-source 三层划分,并指出小任务被过度规格化的问题。
作者 Jesse Vincent 发布 Superpowers,一套基于 Claude Code 新插件系统的 Skill 集合,安装后通过 session-start hook 注入引导提示,让 Claude 主动搜索并使用 Skill。
推荐理由:作者把自用的编码智能体工作流打包成可安装的 Skill 插件,读者能直接复用其头脑风暴到 TDD 的实现流程。
作者记录了自己用 Claude Code 的完整流程:先用 git worktree 隔离任务,再用 brainstorming 提示词让 Claude 一次只问一个问题并分段确认设计,随后用 planning 提示词把计划拆成小任务写入 docs/plans/。
推荐理由:作者把 Claude Code 拆成架构师与实现者两个会话,并给出可复用的提示词和 git worktree 隔离做法。
Anthropic 应用 AI 团队撰文提出,上下文工程是提示词工程的延续,核心是在有限注意力预算下挑选最小的高信号 token 集合。
推荐理由:Anthropic 官方给出上下文工程的系统方法,含压缩、笔记与子智能体三种长任务策略的取舍。
作者把原本一大段文字的 CLAUDE.md 规则改写成 GraphViz 的 dot 流程图,用带引号的字符串做节点名、用不同形状区分决策、命令和警告,并给每个流程加上明确触发条件。
推荐理由:作者把 CLAUDE.md 规则改写成 GraphViz dot 流程后,Claude 对规则的遵循表现更好,这套做法可以迁移到自己的项目。
Manus 团队分享了构建 AI 智能体过程中总结的上下文工程经验,核心是围绕 KV 缓存设计、用遮蔽而非移除管理工具、把文件系统当作上下文、通过复述待办事项操控注意力、保留错误内容以及避免被少样本示例困住。
推荐理由:Manus 团队把四次重写代理框架的经验归纳成六条上下文工程原则,可直接对照自己的 Agent 实现。
OpenAI Codex Cookbook 给出把 Codex CLI 接入 GitLab CI/CD 的完整做法,用于生成 CodeClimate JSON 代码质量报告、把 SAST 结果整理成 security_priority.md,并让 Codex 输出可 git apply 的补丁。
推荐理由:官方 Cookbook 给出把 Codex CLI 接入 GitLab CI 的完整配置,含提示词约束、JSON 标记提取与 diff 校验,可直接照搬。
Martin Fowler 给 OpenAI Codex 布置了一个前端标签格式化的化妆类小任务,并完整公开了 Codex 的日志和生成的 PR。日志显示 Codex 主要靠 grep 反复文本搜索定位代码,中途因把 AGENTS.md 误写成 AGENT.md 来回折腾,还因删掉 .yarnrc 导致测试无法运行,最终 PR 里有两个回归测试失败。
推荐理由:作者完整记录 Codex 自主完成一次前端小任务的日志,并对比 6 次运行结果,展示后台编码智能体在环境配置和代码复用上的真实短板。