Codex 与 Claude Code 同任务实测:质量打平,Codex 成本低 2.4 倍
作者在 python-humanize 仓库上用四个任务(真实 issue 修 bug、按规格加功能、无行为变更重构、带 3 个植入 bug 的代码评审)各跑两遍,Claude Code 2.1.291(claude-opus-5-5)与 Codex CLI 0.160.0(gpt-6.1-sol)16 次运行全部通过检查,四个评审都找齐 3 个植入 bug 且无误报。
作者在 python-humanize 仓库上用四个任务(真实 issue 修 bug、按规格加功能、无行为变更重构、带 3 个植入 bug 的代码评审)各跑两遍,Claude Code 2.1.291(claude-opus-5-5)与 Codex CLI 0.160.0(gpt-6.1-sol)16 次运行全部通过检查,四个评审都找齐 3 个植入 bug 且无误报。
作者用 Codex 的 Sol 5.6 在 Blender 里搭出一个复杂怪物模型,项目当时只有几百 MB;随后 Astra 和 Sol 6/6.1 花数周修复颈部一块皮肤贴图,中间草稿和迭代文件让项目膨胀到近 3TB,问题仍未解决。
Claude Code 文档建议按任务选 effort level:low 用于自己复核的快速改动如重命名,medium 用于范围明确的功能(现为 Opus 5.5 和 Sonnet 5.5 默认),high 用于边界情况关键的 bug 修复,max 只留给需要 Claude 独立攻克的难题,因为它容易过度思考。
Codex CLI 自带的 /status 和 /usage 只能看到单个开发者的 token 用量,无法按团队归因花费或在预算耗尽时拦截请求。
AI 智能体经济中路由层(IETF 本月发布的 AGTP-COMMERCE)与支付层(x402、AEON、CEX API)已解决,但结算层仍空白。Nevermined、x402、Apex Fusion 的 Vector(已跑 20,000+ 作业)和 Akash 各跳过核心问题:都无法证明工作正确完成。
Claude 的重置点数并非额外一个月额度,受每周限额约束,最多只能换来约一周的额外用量。最佳用法是在月度重置前的最后一周、周限额刚用尽时使用,重置后可获得约 5 天时间消耗新一周的 token,随后自然周重置到来,重置点数即作废。
作者用 5 个 Python 任务、Haiku 4.5 和 Sonnet 5.5 各跑两遍共 40 次,对比俄语和英语提示词的 token 消耗与成本。俄语提示词平均每任务多 12 个 token,但单次运行平均读取约 22.2 万输入 token,其中 94% 是每轮从缓存重读的系统提示词、工具说明和项目文件,语言差异只占约 0.005%。
作者所在公司想用 AI 自研工具替换一个每月 200 美元、支持 200 多个应用的同步类 SaaS,结果开发约 1 个月、支持与修 bug 又花 1 个月,同步 bug 还导致公司多数产品在批发网站上显示缺货数周,估计损失 1 万美元销售额。
一位零后端和 Cloudflare 经验的开发者,正靠 Claude Code 设计并实现一个词汇学习 Web 应用的多人游戏基础设施,需求包括基于 WebSocket 的实时房间(6 人 + 10 名观众)、随机房间码、断线重连、服务端权威状态、货币与每日登录防刷,以及 Firebase Authentication 与 Cloudflare 后端集成。
作者在单张 AMD MI300X 上用 vLLM ROCm 版跑 Qwen2.5 7B/32B/72B,按 $2.99/GPU-hr 计价,BF16 基线为 7B $0.227/M、32B $0.77/M、72B $1.67/M 输出 token。
推荐理由:作者在 MI300X 上实测 FP8 量化,发现按 token 计费会掩盖模型输出退化成乱码的问题,并给出可复用的验证方法。
作者通过 Langfuse 代理测得 Claude Code 默认系统提示词接近 50k token,于是关闭 artifact、workflows、bundled skills 和反馈草稿等用不到的功能,把初始系统提示词降到约 15k token。
有用户实测对比 Anthropic Max/Pro 100 与 OpenAI Codex 订阅后发现,用 Opus 5.5 在 Claude 中工作一整天就消耗了 10% 额度,而 Codex 的 Sol 6.1 能提供更高的使用性价比。
作者发现 Claude Code 支持 mod,并有一个收录近 100 个 mod 的目录。他推荐了几个:cost-meter 在提示词上方显示本次会话花费,guard-essentials 在 Claude 执行 rm -rf。
一位刚开始认真为 AI 工具付费的用户在 Reddit 提问:想保留 OpenAI 订阅以继续使用 Dot 和 Codex,同时考虑试用一个月 Claude Pro 跑 Claude Code,让两者在同一个本地 Git 仓库上交替工作——一个实现、另一个审查,并保持 Markdown 文档同步更新。他还在确认一个理解是否成立:API 每任务成本与订阅实际包含的用量衡量的是不同东西。
一名用户续订 OpenAI Codex 的 5x 套餐并被扣款 $100 后,打开 Codex 发现周用量仍显示 0%,额度并未因付费而重置。他意识到此前的额度重置已把周期推移,只能等 Tibo 再次手动重置或再等 4-5 天自然恢复;若想立刻用上算力,本应先取消再重新订阅。他称退款机器人判定其不符合退款条件,表示打算再用一个月 Computer use 后就不再关注 GPT。
SemiAnalysis 实测 Anthropic、OpenAI 等九家 AI 订阅套餐后得出,同样 200 美元,Claude 订阅折算的 Token 用量约为 OpenAI 的 5 倍。
Anthropic Subscriptions Offer 5x+ More Value Than OpenAI Limit testing every AI subscription plan from Anthropic, OpenAI, Meta, SpaceXAI, MiniMax, Moonshot, Zdotai, Cursor, and Cognition https://newsletter.semianalysis.com/p/anthropic-subscriptions-offer-5x
据 The Information 10 月 5 日报道,Meta 和微软都在减少员工内部使用 Anthropic 的 Claude,转向自家模型和工具。
🚨BREAKING: Microsoft and META are aggressively cutting employee use of Claude ahead of Anthropic's IPO Microsoft has cut internal claude spend by more than 33%, nuked per-employee token budget from $100k/month to $10k/month, and forced Copilot to auto-route to cheaper models META used Claude code to build Muse, then cut active users from 60,000 to 30,000 (50% decline) after launch, and replaced it with Muse Code Palantir and Nvidia are also scaling back claude over soaring prices and data privacy fears it’s OVER…
一位研究者正用 HPC 超算生成 Python 代码工作流,目前用 Luna(medium)尚可,但换用 SOL 和 Astra 后消耗过大。他询问是否应改用 Claude Code 或 Codex,目标是把自己的想法转成代码、跑完实验并拿到结果与日志。
有用户反映 Claude Pro 免费试用周期间 Opus 5.5 在 medium 和 high 档位下用量充裕,5 小时窗口几乎用不完;付费后同样使用 Opus 5.5 high,约一小时就消耗了 5 小时窗口的 90% 和每周用量的约 16%,质疑免费周后限制被下调。
作者开源了 claudemanager,一个本地守护进程,让 Claude Code 通过 ANTHROPIC_BASE_URL 指向它,只改动请求的 Authorization 头,就能把会话路由到 5 小时、每周和单模型窗口余量最多的 Max 账号,并在窗口填满前按自定义阈值切换。
推荐理由:作者开源了一个本地代理,把多个 Claude Code Max 账号按额度余量自动分流,并顺带记录了请求日志。
一位同时订阅 OpenAI 和 Claude 的用户称,当前 100 美元 Claude 订阅可用一周最强模型,Sonnet 5.5 和 Opus 5.5 在 90% 场景下胜过 Astra,Astra 仅靠图像生成和 harness 功能取胜;而 100 美元 OpenAI 只够用 2-3 天,模型已跟不上 Opus 和 Sonnet。
一名付费 20x 的 Claude 用户反映,自 Sonnet 和 Opus 5.5 发布后,几乎每个任务都会消耗约 1% 用量,2 小时设计工作就用掉 30% 额度。该用户称已为 Claude 累计投入近 2400 美元,如今不得不每周四到周日改用 Codex 的 plus 计划,并认为 Claude 在用量上难以胜过 Codex,但在设计与输出质量上仍占优。
一位开发者每周工作日晚上编程 3–4 小时(约 15–20 小时),主要用 Cursor 和 Zed,预算严格控制在每月 20 美元以内,需要快速自动补全和智能对话调试。
Flash-Agents 是一个 Claude Code 插件,把实现切片、移植测试、审查 diff、梳理代码库这类有边界的编码工作交给 DeepSeek V4.1 Flash worker,Claude 保留架构、验收标准和最终审查。
推荐理由:作者把 Claude Code 的编码任务外包给 DeepSeek Flash worker,并给出沙箱、补丁与实测数据,可据此判断成本与安全边界。
Claude Code 包含在所有付费方案中,Free 方案不含,且与 Claude 聊天共用同一用量额度。
一位开发者为自己业务开发办公组合管理应用,让智能体每天工作 12+ 小时,目前用 Astra 做规划、Codex 里的 GPT-6 Sol High 主力编码。
一名 OpenAI Pro 20x 订阅用户反驳近期对 OpenAI 的批评,称 Sol 6.1(多用 xhigh)智能可靠、不易跑偏,三天仅消耗 10% 用量,虽实测约 16 tok/sec 偏慢但产出稳定。他通过优化工作流将 token 消耗减半,并提到 Astra 消耗较大,以及 tibo 宣布 Sol 和 Astra 提速 50%。
OpenAI 在 28 天更新的第 1 天宣布,通过 ChatGPT 订阅使用 GPT-6 Astra 和 GPT-6.1 Sol 时默认速度提升约 50%,用户无需改设置,两小时内生效。
Day 1/ We have optimized the default speed to be ~50% faster across GPT-6 Astra and GPT-6.1 Sol through the subscription across all our products and partners using Sign in With ChatGPT (including OpenCode, Pi, Amp, Devin, ...). No changes needed on your end and this should be felt within the next two hours.
作者发布 Claude Code 插件 quota-audit(v1.3.0),读取 ~/.claude/projects/*/*.jsonl 中的逐条 token 用量,按项目、Skill 和 5h/24h/7d 窗口拆解成本,并列出限流命中的具体时间和被阻塞的仓库,数据只在本机处理。
作者因 Claude Code 的 /usage 只给账号级百分比、无法看出哪个项目吃掉额度,写了名为 quota-audit 的 Skill,读取本机 ~/.claude/projects/*/*.jsonl 中的 token 用量,按项目、按 Skill 归因,并列出 5h、24h、7d 各窗口的估算花费、超过 150k context 的 session 和撞限记录。
作者提出在调整智能体配置前先回答两个问题:冷启动时 harness 发送多少 prompt token,其中多少来自工具 schema,并用服务商 tokenizer 实测而非按字符估算。
在会话内输入 /usage 可查看 Claude Code 的 5 小时会话、当周及单模型周额度,输入 /status 可查看 Codex 的剩余额度,Grok Build 的 /usage 则显示周或月额度。
文本进入语言模型前会被 tokenizer 切成 token 并映射为词表编号,token 不等于单词或固定字符数,例如 BERT 的 tokenizer 会把 "I have a new GPU!
用户在 Claude Code 中以 API 认证方式使用 Opus 5.5(开启 1 小时 TTL 缓存和 ultracode 模式)跑了两轮会话,最终花费近 39 美元。但 /usage 显示 Haiku 承担了主要推理,包括 4.1m 输入和 204 次网页搜索,用户质疑为何付费使用 Opus 却由 Haiku 完成核心工作。
一位 Claude 用户为改善 token 用量,改用 Opus 做规划、按任务难度分配不同模型,结果收到提示:82% 的用量来自 subagent 密集的会话,因为每个 subagent 都会发起自己的请求。他感觉 subagent 比主对话更耗 token,但因使用更便宜的模型而认为影响不大,于是发帖询问自己的做法是否正确。
作者因近期 Anthropic 大量封号且申诉难、订阅费不退,在支持 Claude 的地区自建 VPS,用 Docker 跑 CLIProxyAPI 保存 OAuth 登录并暴露兼容 API,再通过 SSH 隧道让 Claude Desktop 和 Claude Code 走这个网关。
Scout Packs 将其 x402 线索查询 API 从每次 $0.10 下调至 $0.01,原因是 AI 智能体运营钱包普遍将单次调用上限设为 $0.005,$0.10 相当于默认上限的 20 倍,钱包会直接拒绝支付。
有用户反映在 OpenAI 模型选择器中选中 GPT-6 Astra Extra High,实际却被路由到 GPT 5.6 Luna LOW,两条提示词消耗 7000 credits(280 美元)。该用户称从未在 Claude 上遇到此类问题,并质疑为何不提供模型路由提醒。
有用户对比 OpenAI 与 Anthropic 的高层执行力,认为 OpenAI 在模型命名、Codex 模式与 chat 模式割裂、发布节奏与用量限制上问题频出,最新 6.1 Sol 被认为落后 Opus 5.5 一个层级。
作者分享自己把 Claude Code 接到免费 LLM API 上的做法,通过设置 ANTHROPIC_BASE_URL 和 ANTHROPIC_AUTH_TOKEN 两个环境变量,把请求路由到 Google AI Studio 的 Gemini 2.5 Flash 或 Groq,Cursor 和 Codex CLI 也有对应的 base URL 配置方式。