Codex 与 Claude Code 同任务实测:质量打平,Codex 成本低 2.4 倍
作者在 python-humanize 仓库上用四个任务(真实 issue 修 bug、按规格加功能、无行为变更重构、带 3 个植入 bug 的代码评审)各跑两遍,Claude Code 2.1.291(claude-opus-5-5)与 Codex CLI 0.160.0(gpt-6.1-sol)16 次运行全部通过检查,四个评审都找齐 3 个植入 bug 且无误报。
作者在 python-humanize 仓库上用四个任务(真实 issue 修 bug、按规格加功能、无行为变更重构、带 3 个植入 bug 的代码评审)各跑两遍,Claude Code 2.1.291(claude-opus-5-5)与 Codex CLI 0.160.0(gpt-6.1-sol)16 次运行全部通过检查,四个评审都找齐 3 个植入 bug 且无误报。
OpenAI 表示欧盟符合条件的 ChatGPT 和 Codex 文本将携带名为 textGrain 的隐藏水印,未来几周内面向所有套餐推出,目前仅限欧盟。该水印是词选择上的统计模式而非可见标签,OpenAI 称其不识别用户、账号或提示词,检测器不公开,仅获批研究人员可申请使用。
作者用自建的 mcpspan 对演示订票 MCP server 做埋点分析,总结出五类日志里看不到的智能体调用问题:智能体猜测不存在的工具名、参数不符合 schema 被 SDK 在 handler 前拒绝、工具描述措辞导致参数类型理解错误、同一参数反复重试的循环,以及响应体积过大挤占上下文窗口。
推荐理由:作者用自建 MCP 分析工具实测出五类日志里看不到的智能体调用失败模式,可迁移到自己的 MCP server 排查。
作者用 Codex 的 Sol 5.6 在 Blender 里搭出一个复杂怪物模型,项目当时只有几百 MB;随后 Astra 和 Sol 6/6.1 花数周修复颈部一块皮肤贴图,中间草稿和迭代文件让项目膨胀到近 3TB,问题仍未解决。
Codex CLI 自带的 /status 和 /usage 只能看到单个开发者的 token 用量,无法按团队归因花费或在预算耗尽时拦截请求。
作者用标准库 Python 写了一个约 100 行的 chain_check.py,用两条规则检测链式 Skill 审批劫持:单 Skill 规则标记同一文本中同时出现状态变更动作(upload、send、delete、transfer)和审批声明的 Skill,链式规则在已安装 Skill 间构建写读图,标记 A 写入含审批声明的文件、B 读取后执行状态变更动作的路径。
作者用 5 个 Python 任务、Haiku 4.5 和 Sonnet 5.5 各跑两遍共 40 次,对比俄语和英语提示词的 token 消耗与成本。俄语提示词平均每任务多 12 个 token,但单次运行平均读取约 22.2 万输入 token,其中 94% 是每轮从缓存重读的系统提示词、工具说明和项目文件,语言差异只占约 0.005%。
作者提出 SKILL.md 只有在 description 与用户提问匹配时才会被加载,正文决定加载后发生什么,因此值得信任的前提是先用真实输入跑一遍并读回结果。他建议把规则写成可校验的形式,并在一个更强和一个更弱的模型上分别测试,且测试要能失败。
query-inspector 是一个 Claude Code 插件,包含 tuning-report 和 inventory-report 两个 Skill,从 git 变更中提取 SQL/ORM 查询,诊断缺失索引、N+1 和反模式并生成报告。
作者认为提示词注入不该靠更聪明的模型解决,而应像 SQL 注入用参数化查询那样,把边界画在智能体执行动作的地方。
推荐理由:作者把提示词注入类比 SQL 注入,主张把边界从模型移到工具调用层,并给出可落地的策略层与读写分阶段方案。
作者所在公司想用 AI 自研工具替换一个每月 200 美元、支持 200 多个应用的同步类 SaaS,结果开发约 1 个月、支持与修 bug 又花 1 个月,同步 bug 还导致公司多数产品在批发网站上显示缺货数周,估计损失 1 万美元销售额。
一位有医学背景的作者用 Claude 写代码、ChatGPT 生成图片,花约一个工作日做出可交互的耳部穴位图谱,包含 15 个耳部穴位、可平滑切换的五层解剖结构、按是否有综述筛选、键盘导航和英文版卡片,第二页为颈后 9 个穴位。
作者用一块 599 卢比(约 6 美元)的 ESP32 冒充蓝牙耳机(hands-free profile,16 kHz),把通话音频经 USB 传回手机,再由手机上的应用推流给 Codex CLI 的实时语音,全程用 ChatGPT 套餐登录,不需要 API key、Twilio 或 SIP。
文章对比了 MCP 与自定义 REST 工具在安全上的差异,指出 MCP 只标准化通信,认证、授权、最小权限、输入校验和监控仍需应用与后端自行实现。文中介绍了当前定稿的 MCP 规范 2026-07-28 的关键变化,包括无状态协议设计、server/discover、Streamable HTTP、多轮往返请求和 Tasks 扩展,并说明本地仍常用 stdio。
Future AGI 1.47.0 发布,在运行分析中新增通话与语音指标卡片,并修复模拟通话结果与运行详情的对齐问题。评估对话时,错误语言回答、涉及其他产品的回答以及未获回复的请求现统一计为未处理请求;测试环境评估还修复了完整提示词和对话参与者标识的传递。聊天构建器页面支持折叠与调整宽度,宽度在窗口缩放后保留。
jev-browser-wingman 是一个 MCP 代理,把 AI 智能体的浏览器点击和输入交给 TypeSafe 的 Jev 决定操作哪个元素,不确定时把该步骤交还给智能体。
Pennyforge 对某公开 MCP 注册表 a–b 切片中 186 个端点里能响应 initialize 的 78 个服务器做了匿名健康探测,只有 40 个(51.3%)能走通 initialize→tools/list→一次安全 tools/call 的完整流程。
推荐理由:对 78 个注册表 MCP 服务器做匿名健康探测,给出分层鉴权与规范版本迁移的可复现数据。
作者提出智能体配置不应只有允许和禁止两档,而应增加 ask first 中间档,用于推送远端、非本地数据库的 schema 迁移、安装新依赖、修改 CI 或部署配置这类需要先停下说明命令的操作。
作者用 Claude Code 做了一个叫 orla 的主动学习智能体,每天早上推送当天到期的任务。
这篇教程讲如何把 Claude Code 的模型请求从 Anthropic 切到 DeepSeek API,保留 Claude Code 的 Agent 工作流。
一位系统工程师用 Claude Code 搭建了本地活动聚合站 elmiracorningevents.com,抓取纽约州 3 个县及宾州北部的 101 个日历源,每 6 小时由 cron 运行一次,冷启动全量抓取约 8.5 分钟。
Codex CLI 是 OpenAI 的终端编程智能体,可用 npm、Homebrew、安装脚本或 PowerShell 一条命令装好,再用 codex --version 确认。
query-inspector 是一个 Claude Code 插件,由 tuning-report 和 inventory-report 两个 Skill 组成,从 git 变更中提取 SQL/ORM 查询,诊断缺失索引、N+1 和反模式,并给出带 file:line 的 CREATE INDEX 建议。
Snaplii 于 10 月 5 日发布 Snaplii Cash,一个供 AI 智能体消费的独立预充值钱包,用户可设置消费上限(示例 $50),智能体不接触信用卡和银行信息,并支持 MCP 兼容的一次性预充值凭证。
Beads 为编码智能体提供一个直接放在代码仓库里的轻量 issue 追踪器,智能体可以创建、更新和关闭 beads(issue),并查询它们之间的依赖关系。
作者和朋友开源了 vibeconf,在 Claude Code 里输入 /join-call 加 Meet 链接,会话就会以独立画面和声音加入会议,并在共享白板上书写。
SemiAnalysis 实测 Anthropic、OpenAI 等九家 AI 订阅套餐后得出,同样 200 美元,Claude 订阅折算的 Token 用量约为 OpenAI 的 5 倍。
Anthropic Subscriptions Offer 5x+ More Value Than OpenAI Limit testing every AI subscription plan from Anthropic, OpenAI, Meta, SpaceXAI, MiniMax, Moonshot, Zdotai, Cursor, and Cognition https://newsletter.semianalysis.com/p/anthropic-subscriptions-offer-5x
据 The Information 10 月 5 日报道,Meta 和微软都在减少员工内部使用 Anthropic 的 Claude,转向自家模型和工具。
🚨BREAKING: Microsoft and META are aggressively cutting employee use of Claude ahead of Anthropic's IPO Microsoft has cut internal claude spend by more than 33%, nuked per-employee token budget from $100k/month to $10k/month, and forced Copilot to auto-route to cheaper models META used Claude code to build Muse, then cut active users from 60,000 to 30,000 (50% decline) after launch, and replaced it with Muse Code Palantir and Nvidia are also scaling back claude over soaring prices and data privacy fears it’s OVER…
作者认为 MCP 与 A2A 不是竞争关系,而是不同层次的两类协议:MCP 面向被调用的工具与数据服务,A2A 面向拥有目标、能自行规划并回报任务状态的同级智能体。判断标准是问对方是否拥有目标并自行决策,是能力就归 MCP,是自主工作者就归 A2A。两者可以组合成栈,A2A 负责智能体之间的委派,MCP 负责智能体内部调用工具,作者建议先用工具,只有存在真正可委派的目标时才升级为智能体。
mcpward 更新到 1.1 并上架 GitHub Actions Marketplace,它把 MCP 服务器 tools/list 返回的工具定义存进 lockfile,工具描述、必填参数或 readOnlyHint 发生变化时让 CI 失败。
Phaze 发布实验性 MCP server,并测试了一个 IT 支持智能体:用户求助后,Slackbot 让智能体远程连接并尝试修复电脑问题,遇到需要登录密码等环节时升级给 IT 支持人员。
作者做了一个 Claude Code 插件,在每次工具调用前后对项目做快照,用 /tm undo 把文件恢复,包括通过 Bash 改动的部分,弥补 /rewind 只覆盖文件工具编辑的缺口。
OpenAI 在 9 月 22 日至 10 月 1 日间连续发布 Codex CLI 0.156.0 到 0.160.0,官方称之为一次大更新,带来全屏终端界面、/agents 视图和并行任务管理。
作者因在 Windows 上同时开 4-5 个 Claude Code 会话、频繁切换终端而开发了原生应用 Polvo,每个窗口都是运行真实 claude CLI 的终端,不做包装或重写。
Rust 开发者 NikTimf 在 Habr 撰文说,自己仍然害怕用 AI 写代码,原因不是生成质量差,而是生成量太大、后续没人真正看懂。他列举了具体代价:多个智能体之间要反复传递上下文,答案冲突时还得自己判断谁对;公司只允许本地或自研模型时,用惯强模型的人很难退回;同事充当 meat proxy 转发 AI 答案,理解任务和推进实现的活仍落在自己身上。
一位没有编程基础的作者讲述自己从 Bolt、Claude 到 ChatGPT 的 Vibe Coding 经历,最终用 12 个阶段、171 小时编排运行时间搭出 Linux 原生个人智能体编排工具 B.O.T.S.。
作者发布 windvane,一个 MIT 许可、无依赖的 Claude Code 插件,用 Python 引擎在会话中自动看护上下文:recorder 根据任务列表、编辑、提交和上一条回复起草检查点,模型一次调用即可接受或改一个字段;插件监控上下文填充,在检查点落盘后于下一个回合边界压缩,并自行发一条提示让模型从检查点继续。
作者发布 VS Code 扩展 AI Pair Programmer,让编程智能体在编辑器里以可跟上的速度逐字输入并解释自己在做什么,用户可随时打断或接管。该扩展内置支持 Claude Code、Codex、OpenCode、Gemini CLI、Cursor 和 GitHub Copilot,任何支持 MCP 的智能体也可手动接入,作者称它更适合能力较强的模型,弱模型在这种工作方式下容易吃力。
Metagente 是一个用于构建 AI 智能体的小型语言,作者用 Rust 写成的单二进制解释器执行声明式 agent 文件,原生支持 MCP 和 A2A,可直接调用任意 MCP 工具并与其他智能体通信。
作者提出在调整智能体配置前先回答两个问题:冷启动时 harness 发送多少 prompt token,其中多少来自工具 schema,并用服务商 tokenizer 实测而非按字符估算。