Codex 与 Claude Code 同任务实测:质量打平,Codex 成本低 2.4 倍
作者在 python-humanize 仓库上用四个任务(真实 issue 修 bug、按规格加功能、无行为变更重构、带 3 个植入 bug 的代码评审)各跑两遍,Claude Code 2.1.291(claude-opus-5-5)与 Codex CLI 0.160.0(gpt-6.1-sol)16 次运行全部通过检查,四个评审都找齐 3 个植入 bug 且无误报。
作者在 python-humanize 仓库上用四个任务(真实 issue 修 bug、按规格加功能、无行为变更重构、带 3 个植入 bug 的代码评审)各跑两遍,Claude Code 2.1.291(claude-opus-5-5)与 Codex CLI 0.160.0(gpt-6.1-sol)16 次运行全部通过检查,四个评审都找齐 3 个植入 bug 且无误报。
作者用 Codex 的 Sol 5.6 在 Blender 里搭出一个复杂怪物模型,项目当时只有几百 MB;随后 Astra 和 Sol 6/6.1 花数周修复颈部一块皮肤贴图,中间草稿和迭代文件让项目膨胀到近 3TB,问题仍未解决。
作者用 5 个 Python 任务、Haiku 4.5 和 Sonnet 5.5 各跑两遍共 40 次,对比俄语和英语提示词的 token 消耗与成本。俄语提示词平均每任务多 12 个 token,但单次运行平均读取约 22.2 万输入 token,其中 94% 是每轮从缓存重读的系统提示词、工具说明和项目文件,语言差异只占约 0.005%。
GitHub 和 Microsoft 于 2026 年 10 月 5 日开放研究预览版 ReviewBench,用于评测 AI 代码评审智能体。该基准包含来自 187 个公开仓库、19 种语言的 219 个 pull request,语言和仓库规模分布基于对 GitHub 上 1.039 亿个 pull request 的分析,并刻意提高了实质性改动的占比。
jev-browser-wingman 是一个 MCP 代理,把 AI 智能体的浏览器点击和输入交给 TypeSafe 的 Jev 决定操作哪个元素,不确定时把该步骤交还给智能体。
作者在单张 AMD MI300X 上用 vLLM ROCm 版跑 Qwen2.5 7B/32B/72B,按 $2.99/GPU-hr 计价,BF16 基线为 7B $0.227/M、32B $0.77/M、72B $1.67/M 输出 token。
推荐理由:作者在 MI300X 上实测 FP8 量化,发现按 token 计费会掩盖模型输出退化成乱码的问题,并给出可复用的验证方法。
GitHub 发布代码评审离线基准 ReviewBench,基于 1.039 亿个 GitHub PR 的分布特征,构建了覆盖 19 种语言、219 个公开 PR 的评测集,并公开数据集、评分规则与 LLM 评审模型配置。
推荐理由:GitHub 公开了 AI 代码评审基准的数据集、评分规则与评测入口,读者可据此对比不同评审智能体。
作者用 npm 发布时间戳统计 2026 年 Q3 的发布次数:Claude Code 发布 79 个版本、Codex CLI 38 个、Gemini CLI 15 个,中位发布间隔分别为 0.96 天、1.64 天和 6.09 天。
社区对内发布《Agent Harness 技术蓝皮书》,全书 8 篇 33 章共 139 页,将 Agent Harness 定义为围绕大语言模型构建的确定性运行时。同期基于 arxiv API 检索 2026-08-01 至 10-05 的 66 天数据,去重后新增 930 篇 RAG 相关论文,约 14 篇/天,研究重心已从检索 pipeline 搭建转向系统层、质量层与形态层。
作者用同一份需求(SaaS 落地页加带鉴权的仪表盘)在 Lovable Pro、Bolt Pro、v0 Plus 上各跑一遍并做 10 轮修改,Lovable 首稿质量 8.5 分、34 分钟出可用应用,Bolt 26 分钟最快但首稿 7.8 分、需 9 次修改,v0 首稿 8.2 分、41 分钟最慢但代码最易维护。
Linux Foundation 与 Agentic AI Foundation 于 9 月 14 日推出首个厂商中立的 MCP 认证 MCPA,考试为线上监考多选题,费用 US$250,有效期两年,含一次免费重考,对齐 2026-07-28 版 MCP 规范。
作者用同一需求在两个新账号上实测 v0 Plus 与 Bolt.new Pro,v0 的 UI 代码质量得分 8.8、Bolt 为 7.6,但 Bolt 约 90 秒就能跑起含认证、数据库和部署地址的全栈应用,v0 约 4 分钟出界面且后端只覆盖部分。
作者晚安code 梳理谷歌 9 月 30 日发布的 Gemini 4 Argon,指出其单次输出上限从上一代 6.4 万 token 提到 100 万,但上下文窗口、参数量和架构官方均未公布,不少报道把 100 万输出 token 误写成 100 万上下文。
GPT-5.5 于 2026 年 4 月 23 日发布,是 OpenAI 自 GPT-4.5 以来首个完全重训练的基座模型,在 Terminal-Bench 2.0 上得分 82.7%,相同 Codex 任务下比 GPT-5.4 少用 40% token,但输入输出价格翻倍至每百万 token 5 美元和 30 美元。
作者在同一个中型 TypeScript 仓库上用相同提示词跑了五个任务(竞态条件排查、跨 8 文件重构、补测试到约 90% 覆盖率、按 300 字规格做 CRUD 应用、审查 400 行 diff 中的 6 个植入问题),对比 ChatGPT Plus 的 Codex 与 Claude Pro 的 Claude Code。
9 月 15 日发布的 System One 决策模型 Jev 一周内 GitHub 相关项目超两千个、star 破四万,一批论文随之涌现。
作者上手体验了 OpenAI DevDay 发布的 Dots、Decisions API、开源 Codex Harness 更新和 ChatGPT Space 四项能力。
OpenAI 上线 GPT-6.1 Sol,作者实测后认为它在软件工程测试 DeepSWE v1.1 上已追到 Astra 水平,价格比 Astra 便宜 80%,每百万 token 输入 2 美元、输出 10 美元,命中缓存输入 0.1 美元。
2026年9月共发布43款大模型,国产约占八成,1M上下文与全模态成标配,Intern-Decision、NeoHorse-1等"决策模型"与"自进化后训练"新品类首次进入开源清单。
谷歌发布旗舰模型 Gemini 4 Argon,官方公布的 18 项测试中独占第一 12 项,DeepSWE v1.1 以 77.9% 位列全球第一,AutomationBench-AA 以 77.5% 领先 Claude Sonnet 5.5 的 71.3%。
文章以终端编程智能体 Pi 及其分支 Oh My Pi 为例,讨论模型与代码之间那层 harness 该由谁做决定。
作者导出自己 49 个 Claude Code 会话、138 小时活跃工作的日志,统计出每小时平均消耗 1530 万缓存读取、86 万缓存写入、5.1 万输出和 560 普通输入 token,再按这套固定用量给 TeamoRouter、LiteAI、RouterAI、Polza AI、ProxyAPI 五家 API 网关算每小时花费。
作者提出用一个小功能规格来评测 AI 编程助手:在临时目录建两个 Python 文件,让助手给 notes_cli.py 加 --since YYYY-MM-DD 过滤选项,要求非法日期以状态码 2 退出并只向 stderr 输出一行、补充边界日和非法日期测试、只改这两个文件、运行 python3 -m unittest -v 并展示完整输出。
作者用 629 条 AgentDojo 注入攻击(每条埋在真实工具输出中)和 97 条正常样本,实测 10 个开源提示词注入检测器。
推荐理由:作者用 629 条真实注入攻击实测 10 个开源检测器,给出默认阈值与校准后的完整对比数据。
作者依据三家厂商 2026 年 9 月 24 日的文档,对比 GitHub Copilot code review、Anthropic 的 Claude Code Review 和 Gemini Code Assist on GitHub 在触发方式、读取的规则文件、能否拦截合并和单次成本上的差异。
俄罗斯团队 Маракуйя ИИ 的智能体框架首次参加 Terminal-Bench 4 和 OSWorld 2 两项基准测试,取得亮眼成绩。
一项实证研究用固定执行循环的轻量编码 harness,在 SWE-Bench Verified 和 Terminal-Bench 2.1 上对四个模型评测 176 组匹配设置,变量为规划、动作空间和上下文管理。
作者在 2026-09-05 依据各家官方文档,横向对比 Claude Code、Codex CLI、Gemini CLI、OpenHands SDK 和 Omnigent 的权限模型,把问题拆成“哪些操作需要人工确认”和“执行后能触达什么”两层。
作者提出一套测量 coding agent 从提交提示词到首次通过检查(time-to-green)的方法,包含十个已定义的小任务、可脚本校验的 green 条件、一个计时 runner 和一份 CSV 数据集。
SWE-agent 论文(arXiv:2405.15793)提出 agent-computer interface(ACI),主张为语言模型智能体设计专用接口,在 SWE-bench 和 HumanEvalFix 上分别取得 12.5% 和 87.7% 的 pass@1。
SWE-bench 的百分比是智能体编程领域被引用最多的数字,但它比通常被引用的方式要窄得多。文章拆解了一次评测如何产出这个数字:提交是 JSONL 格式的补丁,在 Docker 容器中应用到 base_commit 并运行仓库测试,FAIL_TO_PASS 全部通过且 PASS_TO_PASS 不回归才算 resolved,默认是 pass@1。
OpenAI 的 Codex 团队 Tibo Sottiaux 承诺,只要 Astra 未出现在用户的付费 ChatGPT 账号上,每等一天就补偿一次 banked reset,可完整刷新 Codex/ChatGPT Work 的五小时和每周用量。
OpenAI 于 2026 年 9 月 3 日发布 GPT-6 Astra 与 Astra Pro,首批仅限 Daybreak 网络安全计划企业,ChatGPT 付费版、API 和 AWS 将在随后几天开放。
推荐理由:梳理 GPT-6 Astra 与 Fable 5.1 的基准对比,指出各家测试版本与 harness 不一致,读者可据此判断哪些分数可比。
作者梳理 Anthropic Fable 5.1 系统卡(212 页)中与 SWE 任务相关的细节,指出推理档位并非越高越好:在 FrontierCode Main 子集上。
作者设计了一套可复现的对比方法,让 Codex 和 Claude Code 在同一个仓库、同一任务契约、同一权限和停止条件下完成五项任务:仓库发现、编辑纪律、测试恢复、评审证据、远程或无人值守执行。
Terminal-Bench 发布 4.0 版本,校准任务的时间、CPU 和内存资源,修复 19 个任务并移除 8 个饱和或存在质量问题的任务,所有任务统一设为 8 小时 agent 超时。
斯坦福大学研究人员主导、Terminal-Bench 团队联合全球科研机构专家打造的 Terminal-Bench-Science 0.1 发布,首批含生命、物理、地球、数学和工程科学领域的 70 项任务。
Cline 让八个模型在自家 harness 里做 IMO 2026 六道题,证明由 GPT-5.5 和 Claude Opus 5 双盲按 0–7 分制评分、Gemini 3.1 Pro 仲裁,金牌线为 29 分。
推荐理由:Cline 用同一套 harness 盲评八个模型做 IMO 2026,给出分数与单次成本对照,可看开源权重模型的实际性价比。