一句偷懒的提示词如何让 Codex 找出 RustSec 漏洞
作者把一句要求证明影响或可利用性的红队提示词交给 Codex,在 Rust crate intaglio 中发现 intern 实现的 unwind 安全问题。
推荐理由:作者用一个极简提示词让 Codex 在 Rust crate 中找出真实漏洞并走完修复与披露流程,可借鉴的是把标准定在可复现而非猜测。
作者把一句要求证明影响或可利用性的红队提示词交给 Codex,在 Rust crate intaglio 中发现 intern 实现的 unwind 安全问题。
推荐理由:作者用一个极简提示词让 Codex 在 Rust crate 中找出真实漏洞并走完修复与披露流程,可借鉴的是把标准定在可复现而非猜测。
据 BeyondTrust Phantom Labs 演示,攻击者可通过恶意 GitHub 分支名(含不可见 Unicode 填充隐藏 payload)构造命令注入路径,从 Codex 容器中窃取 GitHub OAuth token,波及已连接的源代码和组织仓库。
Notion 联合创始人 Simon Last 在 No Priors 播客访谈中表示,他从 2025 年夏天起不再手写代码,个人纪录是一个编码 Agent 连续运行 13 天。
作者认为多数 AGENTS.md 写得太长,把编码规范、架构决策、产品背景全塞进一个文件,而 LLM 每次启动任务都要读一遍,大部分内容与当前工作无关。他建议把 AGENTS.md 控制在约 100 行,只作为目录链接到 docs/ 下的架构、规范、测试等文档和产品背景文档,让智能体按任务自行拉取所需内容。
一份运营者报告称,AI 辅助编码工具生成的 Next.js 应用固定了一个存在漏洞的依赖,该漏洞随后通过 CVE-2025-29927 被利用。部署后自动化扫描器访问了本应由中间件保护的内部端点,生产服务器上运行起挖矿程序。报告认为,引入已知严重依赖风险的 PR 在发布前应经过审批路径,而运行时利用仍需漏洞扫描和环境隔离。
作者认为,软件组织一直把人的实现时间当作稀缺投入,智能体打破了这个假设,因此策略必须可执行、验证必须随实现规模扩展。他以在大型 TypeScript 代码库开启 ESLint 的 no-await-in-loop 规则为例,发现 600 处违规,过去这需要昂贵的迁移,现在一个 PR 就能完成修复并补齐测试覆盖。
推荐理由:作者以开启 ESLint 规则、迁移 600 处违规的亲身实践,说明智能体时代实现成本下降后,约束与验证为何成为新的稀缺环节。
针对 Forbes 报道称 Claude Code Max 的 200 美元订阅可消耗约 5000 美元算力,作者认为该数字混淆了 API 零售价与真实推理成本。
OpenAI 用 Codex 配合仓库内的 Skills、AGENTS.md 和 GitHub Actions 维护 Agents SDK 仓库,把验证、发布准备、示例集成测试和 PR 评审变成可重复流程。
推荐理由:OpenAI 官方公开了用 Skills、AGENTS.md 和 GitHub Action 维护 Agents SDK 仓库的完整配置,可迁移到其他开源项目。
ETH Zurich 团队构建 AGENTbench,用 138 个来自小众仓库的真实 Python 任务,测试 Claude 3.5 Sonnet、Codex GPT-5.2、GPT-5.1 mini 和 Qwen Code 在无上下文文件、LLM 生成文件、人工编写文件三种场景下的表现。
作者认为 AI 算力紧缺已经不是“即将到来”而是正在发生。Anthropic 上周可用性一度跌到“一个 9”,员工称源于难以预测的增长,公司为此把 Opus 4.6 默认 effort 降到 medium、在 Claude Code 中暂时移除 Opus 4、4.1 和 Sonnet 4.5,并关闭 prompt suggestions。
作者用开源智能体编码 CLI OpenCode 搭配 Codex 5.3(走 ChatGPT Plus/Team 订阅)在任意 YAML 型 CI/CD 中做 PR 审查,避免把仓库权限交给第三方 SaaS。
OpenAI 宣布 Codex 可通过 Figma MCP Server 生成 Figma 设计文件,并支持设计稿与代码双向流转。
推荐理由:官方给出 Codex 与 Figma MCP 双向打通的具体操作步骤,读者可据此判断设计到代码的往返流程能否落地。
OpenAI 用 GPT-5.3-Codex 在 Extra High 推理档下从空仓库连续运行约 25 小时、消耗约 13M token、生成约 3 万行代码,做出一个可测试的设计工具。
推荐理由:作者用 25 小时、13M token 的实测展示长时程智能体如何靠持久化项目记忆和逐里程碑验证保持不跑偏。
Martin Fowler 就 OpenAI 的 Harness engineering 实践发表初步思考,该团队以“完全不手写代码”为约束,用 AI 智能体维护一个超过 100 万行代码的产品,历时 5 个月。
Drew Breunig 分析了 Claude Code、Cursor、Gemini CLI、Codex CLI、OpenHands 和 Kimi CLI 六个 CLI 编程智能体的系统提示词,发现它们长度和指令分布差异明显,原因在于模型校准和用户体验定位不同。
作者认为纠结选 Claude Code、Codex 还是 Cursor 是问错了问题,因为三家都在拼通用编码能力这一商品化层,而真正拉开差距的是组织自己的领域术语、数据布局、认证流程和发布规则。
作者提出用智能体会话日志来改进 CLAUDE.md 或 AGENTS.md 文件:Claude Code 的会话存在 ~/.claude/projects,Codex 存在 ~/.codex/sessions,都是 JSONL 格式但 schema 不同。
推荐理由:作者用智能体会话日志反推 CLAUDE.md 的改进点,并开源了一个 CLI 把搜索从几分钟压到几秒。
Simon Willison 出于安全考虑没有直接在 Mac 上运行 OpenClaw,而是用官方 Docker Compose 配置把它跑在容器里。
作者 Martin Alderson 观察到 AI 用户正分化为两类:一类是深度使用 Claude Code、MCP、Skills 等工具的用户,其中不少并非技术出身,财务岗位用它处理原本受限于 Excel 的任务;另一类仍停留在与 ChatGPT 对话的阶段。
OpenAI 开发者博客介绍如何用 evals 系统性测试 Codex 的 Agent Skill,把「感觉变好了」换成可比较的分数。
推荐理由:给出用 eval 系统性验证 Codex Skill 的完整流程,从定义成功标准到确定性检查与评分。
Crafter Station 发布首个上下文工程 Skill /intent-layer,可通过 npx skills add crafter-station/skills --skill intent-layer -g 安装,支持 Claude Code、Codex、Cursor、Copilot 等 10 多个智能体。
作者因 Amazon 在 Echo 上频繁推销 Alexa Plus 订阅,用一台 Mac Mini 自建语音助手,架构为麦克风→唤醒词→语音转文字→LLM+工具→文字转语音→扬声器,各组件可替换。
Skyscanner 工程师把 OpenAI 的 Codex CLI 接入 JetBrains IDE 的 MCP server,让 Codex 能调用 IDE 的 get_file_problems 检查文件错误、执行预设的 run configurations 跑测试和 lint。
推荐理由:Skyscanner 工程师把 Codex CLI 接入 JetBrains MCP,让 AI 直接读取 IDE 报错并跑测试,读者可借鉴这套反馈闭环。
作者用 RosettaCode 数据集中 19 种语言都有的编程任务,配合 Hugging Face 上 Xenova/gpt-4 分词器,比较各语言的 token 效率。
作者为 Discord 游戏项目搭建了一条 AI 内容流水线,用 Claude Code Skill 把图像生成、Discord 表情包转换和 Sora 视频动画串成可复用工具。
2025 年是从“以模型为中心”转向“以智能体为中心”的一年。Claude Code CLI 于 2 月 24 日以预览版发布,同日 GitHub Copilot 在 VS Code 推出 agent mode。
Dragos 调查显示,攻击者用 Claude Code 和 OpenAI GPT-4.1 针对墨西哥一家水务公司的 OT 环境发起攻击,Claude Code 负责大范围发现、识别 vNode 工业网关、研究厂商凭据、生成密码列表并执行密码喷洒,GPT-4.1 负责结构化数据分析和西班牙语输出。
推荐理由:Dragos 复盘了攻击者用 Claude Code 与 GPT-4.1 对墨西哥水务 OT 环境做侦察和密码喷洒的完整链路,可看到 AI 在入侵生命周期中的实际分工。
Zenity Labs 披露 Microsoft Copilot Studio 的 Connected Agents 功能默认在所有新建智能体上开启,恶意智能体可静默调用同一环境中受信任智能体的工具,且目标智能体的活动标签页不产生任何记录。
作者把 Wordiest 最后一个 Android APK 交给 Codex + ChatGPT 5.2,半小时内得到可玩的核心游戏,几小时后完成 Android 与 iOS 版本,全程未写也未读一行代码。
推荐理由:作者用 Codex 反编译 Android 游戏并移植到 iOS,展示了智能体开发中难易直觉失效的真实体验。
作者实测 OpenAI Codex CLI 新增的 Skills 支持,该功能目前藏在 feature flag 后,需用 codex --enable skills 开启。
推荐理由:作者实测 Codex 的 Skills 支持,对比 Claude Code 的加载方式,并给出目录结构与触发规则。
DeepSource(YC W20)团队发布 Autofix Bot,一个把静态分析与前沿 AI 智能体结合的代码审查智能体,面向 AI 编码工作流。其混合架构分三步:5000+ 确定性检查器建立高精度基线并由子智能体抑制误报,AI 审查以静态发现为锚点并调用 AST、数据流图、控制流、导入图等工具,最后由子智能体生成修复、静态校验后输出干净的 git patch。
OpenAI 在 Codex Cookbook 中给出用 Codex CLI 改造遗留代码库的完整流程,以 COBOL 投资组合系统为示例,围绕 ExecPlan 设计文档分五个阶段推进。
推荐理由:以 COBOL 投资组合系统为例,给出用 Codex CLI 分阶段改造遗留代码的可复用文档与验证流程。
作者 Jesse Vincent 用一下午把 Superpowers 和整套 SKILL.md 体系移植到 OpenAI Codex CLI,随 Superpowers 3.3.0 发布。
推荐理由:作者把 Claude 的 SKILL.md 体系移植到 Codex CLI,并给出工具映射与安装方式,可据此判断跨模型复用 Skill 的可行性。
Dagster Labs 分享了用 OpenAI Codex 加速技术文档写作、跨媒介内容转换和文档覆盖度评估的实践。他们重写了 CONTRIBUTING.md,明确文档层级、结构和最佳实践,让 Codex 能据此生成符合规范的文档;还借助 gh 命令让 Codex 解读 PR 的 diff 和描述,并让 Codex 把教程改写成 YouTube 视频脚本。
推荐理由:Dagster 团队把 Codex 用于文档写作、PR 解读和内容跨媒介转换,其中用文档生成代码来反向衡量文档覆盖度的做法可以迁移。
作者用 ChatGPT Atlas 的 Agent 模式自动清理 Facebook 信息流,通过一段提示词让智能体持续滚动页面、隐藏赞助帖并对含 Follow/Join 链接的帖子点“不感兴趣”,最终信息流只剩自己关注的人发布的真实帖子。作者对 AI 浏览器的提示注入风险仍持警惕,表示目前不会把银行或邮箱凭据交给这类浏览器。
OpenAI 第三届 DevDay 首次全程用 Codex 参与搭建,从舞台演示、社区大厅街机到产品本身都由它协助完成。Codex 自行实现 VISCA 协议控制网络摄像头,并搭建灯光 MCP server;Codex CLI 让 Romain Huet 一个下午就完成初版。
OpenAI Codex Cookbook 给出把 Codex CLI 接入 GitLab CI/CD 的完整做法,用于生成 CodeClimate JSON 代码质量报告、把 SAST 结果整理成 security_priority.md,并让 Codex 输出可 git apply 的补丁。
推荐理由:官方 Cookbook 给出把 Codex CLI 接入 GitLab CI 的完整配置,含提示词约束、JSON 标记提取与 diff 校验,可直接照搬。
Kilocode 作者认为 AGENTS.md 这类规则文件正让开发者更愿意写文档,因为写一次就能立刻让 AI 编程助手更懂项目。
Lance Martin 撰文把智能体的上下文工程归纳为四类策略:写入(用 scratchpad、记忆把信息存到上下文窗口之外)、选择(按需拉入记忆、工具描述和知识)。
推荐理由:文章把智能体上下文管理归纳为写入、选择、压缩、隔离四类策略,并给出各家产品的具体做法,便于对照现有工作流。
Martin Fowler 给 OpenAI Codex 布置了一个前端标签格式化的化妆类小任务,并完整公开了 Codex 的日志和生成的 PR。日志显示 Codex 主要靠 grep 反复文本搜索定位代码,中途因把 AGENTS.md 误写成 AGENT.md 来回折腾,还因删掉 .yarnrc 导致测试无法运行,最终 PR 里有两个回归测试失败。
推荐理由:作者完整记录 Codex 自主完成一次前端小任务的日志,并对比 6 次运行结果,展示后台编码智能体在环境配置和代码复用上的真实短板。