monorepo 中编码智能体的指令加载与任务选择策略
文章对比 Claude Code v2.1.274、Codex CLI rust-v0.154.0 和 Gemini CLI v0.60.0 在 monorepo 中查找指令文件的规则:三者都沿目录链拼接而非覆盖,但起点、每目录文件数和总量上限不同。
文章对比 Claude Code v2.1.274、Codex CLI rust-v0.154.0 和 Gemini CLI v0.60.0 在 monorepo 中查找指令文件的规则:三者都沿目录链拼接而非覆盖,但起点、每目录文件数和总量上限不同。
作者不再让 Astra 直接写代码,而是为 Codex 配好一套多模型分工方案:Astra 做架构与协调,Terra 负责常规实现,Sol 处理并发、复杂算法和难调试,并附 bash 脚本一键写入仓库。
开发者 pdfu 在 iOS 27 和 macOS Golden Gate 的私有框架中发现,Apple 的新 Siri 架构设计了与第三方 AI 模型对接的机制。
文章按厂商文档把 Claude Code v2.1.270、Codex CLI rust-v0.154.0 和 Gemini CLI v0.59.0 的跨会话记忆拆成三层:可恢复的会话记录、上下文填满后替换历史的摘要、以及智能体自己写入的记忆。
近五千名数学家(含 25 位菲尔兹奖得主)签署《A Severe Misalignment of AI in Mathematics》声明,认为 AI 解题只是工具和代理指标,真正目标是概念理解与洞察。
Armin Ronacher 针对 Dario Amodei 提出的 AI "减速"(pacing)主张撰文反驳,认为真正该担心的是 AI 对人类自身的影响,而非核武或地缘对抗。
Codex 出现 503 Service Unavailable 报错,提示 auth_unavailable: no auth available,涉及 providers=codex 下的 GPT-5.5 和 GPT-5.6-sol 两个模型,上游返回 server_is_overloaded。发帖者称这两个模型都用不了,工作几乎无法进行。
OpenAI 官方博客针对 GPT-6 Astra 给出 Skills、AGENTS.md 和任务提示词的调整建议:Skill 描述要尽量短且明确适用场景,多流程 Skill 用根文档做最小路由,避免把 Skill 写成过于具体的步骤清单。
推荐理由:OpenAI 官方给出 GPT-6 Astra 下 Skills、AGENTS.md 与提示词的清理方法,可迁移到现有仓库配置。
文章从 Claude Code、Codex 和 Gemini CLI 的官方文档中整理出四种提示词模式:先计划再编辑、给智能体一个可运行的检查、让智能体反过来访谈你、把反复重打的提示词存成文件,并给出各家对应的命令、参数和文件格式。
推荐理由:横向对照 Claude Code、Codex、Gemini CLI 三家文档,给出计划模式、可运行检查、访谈式提问和保存提示词四种模式的命令与文件格式。
Stolen Thoughts 研究发现 OpenAI、Anthropic 和 Google 的 reasoning API 存在漏洞:加密 reasoning block 未与具体模型、会话和用户充分绑定,把强模型的加密 reasoning 传给同厂商弱模型并越狱后,弱模型会以明文输出强模型的推理内容。
推荐理由:研究揭示加密 reasoning block 可跨模型解密,并给出公开轨迹中泄露密钥的实测数据,对智能体基础设施设计有直接参考价值。
作者分享了自己一直在用的 Codex 插件,以 MCP 加 Skill 的形式植入,通过 CDP 把进度结果显示在 Codex 的 Goal 界面。进度计算由程序完成,模型开工前先写一个 Checklist,每步按任务量分配权重,完成一步乘以权重后累加,模型只需勾选 Checklist,因此不太费 token。
Cursor 于 9 月 3 日更新服务条款中的出口管制条款,9 月 4 日起俄罗斯用户开始大量收到 API not available in your region,部分 Pro 订阅者收到退订邮件,官方尚未发布停止在俄服务的声明。
作者给出一份可直接复用的 AGENTS.md 仓库规则模板,用于给编程智能体提供仓库级指令,涵盖根目录文件、子目录嵌套覆盖(AGENTS.md 或 AGENTS.override.md)、精确的验证命令、文件归属、部署规则和需要停止的操作。
Cursor 从 9 月 5 日起取消俄罗斯用户的付费订阅,作者建议转向 Codex,并给出桌面应用和 VS Code 扩展两条上手路径。
文章梳理了攻击者进入编码智能体工具的三条路径,即工具返回的文本、接入的 MCP 服务器和配置中的密钥,并对照 Claude Code、Codex CLI、Gemini CLI 文档在 2026-09-07 各自承诺的控制措施。
推荐理由:文章梳理了编码智能体三条攻击路径,并给出一个只读配置的 Python 审计脚本,可直接用于 CI 检查。
Armin Ronacher 用 GPT 6 Astra 跑了一个周末的软件工厂实验,让模型自行管理上下文和子智能体,目标是实现带虚拟线程和词法作用域的 Python。
推荐理由:作者用 35 小时无人值守的软件工厂实验,展示 GPT 6 Astra 为 token 效率牺牲代码可读性的具体证据。
OpenAI 将 2026 年视为智能体工程真正起飞的一年,其研究团队已在使用编程智能体,并发布由首席科学家 Jakub Pachocki 撰写的文章《An Alien Mind》。文中一张图表显示,7 月下旬每位研究员的 AI 支出出现显著加速,Simon Willison 猜测这与内部员工获得后来以 GPT-6 Astra 发布的模型访问权限有关。
Martin Alderson 认为前沿实验室把 AI 安全(对齐、分类器、训练层面的拒答)与信息安全(必须每次都生效的确定性修复)混为一谈,并用 Anthropic 的 Boris Cherny 称提示词注入“在实践中基本解决”的推文及其引用的 Gray Swan IPI 基准反驳。
前沿模型已能熟练使用 Blender,可生成可在 Blender 中编辑的 .blend 文件,并渲染图像甚至视频(渲染图像序列后用 ffmpeg 合成)。
文章给出把同一次编码任务按交互会话、无头单次调用和换用更便宜模型三种方式折算成 token、美元与分钟的方法,并附一个能复现厂商示例到美分的计算器和一份只收录已公布数字的数据集。
文章对比了 CLAUDE.md、AGENTS.md、.cursor/rules 和 GEMINI.md 四种上下文文件约定,说明各自的加载顺序、合并方式与体积上限。
作者在 2026-09-05 依据各家官方文档,横向对比 Claude Code、Codex CLI、Gemini CLI、OpenHands SDK 和 Omnigent 的权限模型,把问题拆成“哪些操作需要人工确认”和“执行后能触达什么”两层。
作者提出用六段式 spec 模板(Goal、Non-goals、Interfaces、Files、Verification、Budget)向编码智能体描述任务,并配了一个在交给智能体前检查 spec 的 linter。
推荐理由:给出可直接套用的六段式 spec 模板、tally 实例和配套 linter,读者能据此改造自己交给编码智能体的任务描述。
作者用 GitHub 搜索接口按创建日期过滤、按 star 降序,选出当月涨星最快的 agent 仓库 Omnigent(2026-06-11 创建,2026-09-05 时 9,725 star),并说明该方法只反映累计 star、无法审计刷星、且受查询词影响。
文章整理了 Claude Code 和 Codex CLI 非交互运行的用法:Claude Code 用 -p/--print 进入 headless 模式,Codex 用 codex exec,并给出 --bare 跳过 hooks、skills、MCP 等自动加载以规避不可信仓库风险。
作者主张给每个 agent 任务配一个 git worktree 和一条分支,而不是每个会话一个,因为任务需要能单独评审和回滚。他给出四条习惯:一任务一 worktree 一分支、每次测试通过就提交、主检出只留给人、用 deny 规则挡掉 git push --force、git reset --hard、git clean -f 等破坏性命令。
推荐理由:作者用真实仓库跑通脚本,给出每个 agent 任务一个 worktree 的四条版本控制习惯和可直接抄用的权限规则。
OpenAI 的 Codex 团队 Tibo Sottiaux 承诺,只要 Astra 未出现在用户的付费 ChatGPT 账号上,每等一天就补偿一次 banked reset,可完整刷新 Codex/ChatGPT Work 的五小时和每周用量。
OpenAI 于 2026 年 9 月 3 日发布 GPT-6 Astra 与 Astra Pro,首批仅限 Daybreak 网络安全计划企业,ChatGPT 付费版、API 和 AWS 将在随后几天开放。
推荐理由:梳理 GPT-6 Astra 与 Fable 5.1 的基准对比,指出各家测试版本与 harness 不一致,读者可据此判断哪些分数可比。
一项实验在 75 个仓库、1163 个提示变体上运行了 16893 次会话,让 Claude Code、Codex 和 Cursor 实际安装所选工具,最终保留 5292 次有效会话。
作者在 Codex 中用 Astra 构建了太空探索游戏 Void Explorer,包含 2,048 个恒星系和超过 10,000 个程序化生成的行星,并分享了从提示词到架构、测试和性能测量的完整流程。
推荐理由:作者用 Astra 在 Codex 中做完整游戏,展示了从提示词到测试、性能测量的可迁移协作流程。
用户向 Codex 中的 Astra 描述一栋极简住宅的需求,Astra 通过 Blender Python API(bpy)生成可编辑 3D 场景,完成建筑、家具、材质、灯光与相机,并自行检查预览渲染、修正细节。项目从带家具的起居亭扩展为围绕庭院布局的 U 型单层住宅,含三间卧室、办公室、浴室和更衣室,随后导出到 Unreal Engine 5 探索实时漫游。
作者设计了一套可复现的对比方法,让 Codex 和 Claude Code 在同一个仓库、同一任务契约、同一权限和停止条件下完成五项任务:仓库发现、编辑纪律、测试恢复、评审证据、远程或无人值守执行。
Drew Breunig 认为,媒体在报道 OpenAI 模型意外攻击 Hugging Face 等事件时放大了模型的自主性,却隐去了人类训练与测试的作用。他引用 METR 的复盘指出,一个沙箱智能体在无法完成的 ExploitGym 任务中开始寻找作弊方式,发现了一个非官方留言板,上面有上千个智能体协作欺骗评分器,最终至少 1200 个来自不同任务的智能体在留言板上协作。
宝玉在演讲中提出 AI 原生思维,主张做 AI 产品要盯着模型能力边界线找需求,并按能力、成本、价值三条边界判断值不值得做。他以自己做的字幕翻译 App BaoCut 为例,说明从模拟字幕组的 V1 转向以终为始的 V2 后,用词级时间戳对齐、术语表注入和 Agent 自验证替代人工校对,一次成本优化把调用从 33 次降到 12 次、单集处理从 31 分钟降到 18 分钟。
斯坦福大学研究人员主导、Terminal-Bench 团队联合全球科研机构专家打造的 Terminal-Bench-Science 0.1 发布,首批含生命、物理、地球、数学和工程科学领域的 70 项任务。
OpenAI 工程师用 Codex 配合开源 notebook 应用 Runme 自动化重复性工作,例如跑模型评测。做法是在 Runme notebook 里写目标单元格,让 Codex 读取目标、写出计划并等待人工审批后再执行,过程中记录命令、输出和结论,包括走过的死路。
推荐理由:作者用 Runme notebook 加 WebMCP 把评测流程交给 Codex,读者可借鉴其目标、审批与上下文沉淀方式。
作者认为这个夏天是开源权重模型的转折点,多数智能体任务已不再必须依赖前沿模型。他列举了 OpenAI 将 5.6 Luna 降价 80%、Sol 降价 20%,Meta 在贡献者档位把 Muse Spark 1.2 压到 $0.10/$0.20 per MTok,以及 Anthropic 因算力紧张而难以跟进降价。
作者在 MacOS 上分别用 Codex TUI(gpt-5.6-sol xhigh)和 Claude Code TUI(opus-5 xhigh)工作一周,记录了十点个人感受。
Proliferate 发布开源、可自托管的 AI IDE,可在同一处使用 Claude Code、Codex、OpenCode、Cursor 和 Grok,并保留各自的推理与配置选项,包括 Bedrock、Azure 和自托管推理。