一周多用 Codex 少用 Claude 后的十点对比感受
作者在 MacOS 上分别用 Codex TUI(gpt-5.6-sol xhigh)和 Claude Code TUI(opus-5 xhigh)工作一周,记录了十点个人感受。
作者在 MacOS 上分别用 Codex TUI(gpt-5.6-sol xhigh)和 Claude Code TUI(opus-5 xhigh)工作一周,记录了十点个人感受。
Simon Willison 让运行在 Claude Code for web 中的 Claude Fable 5 评测 smolmachines 的 smolvm 1.8.3,目标是安全执行不可信的 Python 和 JavaScript 数据转换代码,限制 RAM 和 CPU 时间、禁止网络访问、只允许访问指定文件。
Cline 开源其开放权重模型的评测方法,并附上价值超过一千美元的爬坡分数与 trace 供下载分析。文章给出 Hill Climber's Checklist 五条启发式:设定北极星指标、量化噪声、按任务/模型/供应商拆解失败模式、不要默认更多思考更好、保留私有评测集。
推荐理由:Cline 公开评测方法与上千美元 trace,给出五条可迁移的爬坡启发式,适合自建 harness 的团队参考。
Simon Willison 实测阿里 Qwen 实验室发布的 Apache 2 许可 27B 视觉模型 Qwen 3.8 27B,认为模型本身出色,但默认的 xhigh 推理档位会严重过度思考,建议先用 low 或关闭推理。
Martin Fowler 用 Sonnet 4.6 生成、Opus 4.8 盲评的方式,对小型、中型和较大型三类业务逻辑任务分别跑 TDD 与非 TDD 方案,结论是两者质量没有明显差异,非 TDD 方案在设计和测试质量上还多次略高,变异分数也没有实质差别。
推荐理由:作者用同一批任务对比 TDD 与非 TDD 智能体实现,给出 token 成本与设计质量差异,并反思哪些 TDD 收益在智能体循环里失效。
作者深度体验几天 DeepSeek V4 Flash 0731 正式版后总结:便宜到跑批处理、Agent 循环和几十轮对话账单基本无感,速度快到配合 Agent 工具循环每步几秒内完成,1M 上下文可容纳整个仓库和完整对话历史、无需频繁 compact,结合 Cache 打折长上下文成本还能再降。
Terminal-Bench 团队发布 Terminal-Bench 3.0,首个版本包含 7 个领域共 74 个任务,最强模型通过率约 34%。该版本在 Terminal-Bench 2.1 基础上扩展任务多样性,并引入 CI/CD、语义化版本和结果迁移来持续改进基准。
推荐理由:Terminal-Bench 3.0 用 74 个任务和 CI/CD 版本化机制重建基准,读者可了解新基准如何拉开模型差距。
Terminal-Bench 团队发布一批 Harbor 新功能,让数据集可以按版本发布、排行榜可迁移到新版本,做法是复用、重评或重跑 trial。任务采用语义化版本:补丁级改动直接复用旧结果,验证器改动只需重评已保存产物,只有显著改变智能体环境的重大改动才需要重跑;数据集版本跟随任务中最大的版本号,排行榜通过 diff 只重跑重大改动任务。
推荐理由:Terminal-Bench 团队把基准当软件来维护,给出任务语义化版本与排行榜升级的具体机制,可迁移到自建评测流程。
Cline 用一条提示词启动 17 小时连续运行的编码智能体,以 GPT-5.6-Sol 为 leader 模型,把 Kimi K3 在 Terminal-Bench 2.1 上的成绩从基线 69/89(77.5%,$79)提升到确认运行 79/89(88.8%,$49.8),超过 Moonshot 自报的 88.3%。
推荐理由:Cline 用一条提示词让智能体自主完成 17 小时爬山,把 Terminal-Bench 2.1 从 77.5% 提到 88.8%,可看具体修了哪些 harness 问题。
JetBrains 用 Claude Code 跑 SkillsBench 的 86 个真实编程任务,对比安装与不安装 Caveman 的效果,发现输出 Token 只从约 59.2 万降到 54.2 万,节省 8.5%,远低于项目宣传的 65%。
Terminal-Bench 发布 Challenges,一种长周期、高 token 消耗的单任务基准,要求智能体在无时间与资源限制下自主完成整个项目,首批开放三个挑战。
推荐理由:Terminal-Bench 官方推出长周期单任务基准,并公开三个挑战的实测失败模式,可供评估智能体长时自主能力时参考。
作者认为把 AI 预算押在选当前跑分领先的模型上是错误下注,因为模型每半年就换一轮领先者,真正能积累的是公司独有的内部上下文。
一篇论文评估仓库级上下文文件(如 AGENTS.md、CLAUDE.md)对编程智能体的作用,在 SWE-bench Lite 和自建基准 AGENTBENCH(12 个仓库的 138 个 Python 任务)上对比无上下文文件、LLM 生成和开发者手写三种条件。
作者用同一条口播视频和同一套提示词,分别让 Claude Code 驱动 Remotion 和 Hyperframes 做特效,实测两者的调试流程与 token 成本。
作者指出 AI 工具在个体层面带来 21% 任务完成量和 98% PR 合并量提升,但组织交付指标持平、稳定性略降,METR 随机对照实验中 16 名开发者在 246 个真实 issue 上实测反而慢 19%。
Augment Code 在 AGENTS.md 中前置约 2.5k 字符的 Karpathy 风格编码规则,用 Auggie、Claude Code、Codex 跑 OpenClaw 的 40 个 PR 做对照。
推荐理由:同一批 PR 上三种编码智能体的对照实测,说明提示词约束主要省成本而非提质量,并给出各 harness 差异。
Lovable 在早期访问中测试 GPT-5.5,其内部基准显示最难任务通过率从 GPT-5.4 的 36.9% 升至 41.6%,每次请求工具调用减少 23.1%,用户卡住的消息占比下降 9.9%。GPT-5.5 每请求输出 token 减少 33%,日常任务成本效率提升约 15%,将很快向 Lovable 构建者开放。
Augment Code 从自家 monorepo 抽取数十个 AGENTS.md,用内部评测集 AuggieBench 对比同一任务在有、无该文件时的表现,发现最好的文件带来的质量提升相当于从 Haiku 升级到 Opus,最差的则让输出比完全没有 AGENTS.md 更糟。
推荐理由:Augment Code 用内部评测量化了 AGENTS.md 各写法的效果差异,读者可据此调整自己仓库的文档结构。
作者用同一提示词对比 Claude Code 新隐藏功能 Ultra Plan 与普通计划模式,Ultra Plan 把计划发到云端由多个跑 Opus 4.6 的智能体并行处理,规划几乎瞬间完成、执行 3 分 20 秒,普通模式规划 4 分 40 秒、执行 7 分 31 秒。
作者对比了 AI 设计工具的三个层次:代码优先的设计 Skill(Anthropic frontend-design、Impeccable 及社区分支)、Figma AI 插件(Banani、UX Pilot、Uizard)和 prompt-to-app 构建器(Lovable)。
作者在同一个代码库上分别用 GSD 和 Compound Engineering 各跑一周后,把 Claude Code 的默认工作流换成了 Every 的 Compound Engineering 插件。
Terminal-Bench 发布任务设计指南,提出好的基准任务应具备对抗性、难度和可读性:指令像给资深工程师那样清晰直接,测试只验证结果而非实现细节,允许替代解法并防止 reward hacking。难度应来自问题本身,而非苛刻的输出格式或隐藏假设。作者建议亲自运行任务、检查容器、执行 oracle 并观察真实智能体轨迹,失败运行尤其能揭示任务是否真正困难。
作者指出纯稠密检索会漏掉约 25% 的相关文档,在错误码、法规条款编号、罕见实体等精确匹配场景下 BM25 仍占优,而稠密检索擅长改写、对话式查询和跨语言检索。
ETH Zurich 团队构建 AGENTbench,用 138 个来自小众仓库的真实 Python 任务,测试 Claude 3.5 Sonnet、Codex GPT-5.2、GPT-5.1 mini 和 Qwen Code 在无上下文文件、LLM 生成文件、人工编写文件三种场景下的表现。
Terminal-Bench 团队宣布正在开发 Terminal-Bench-Science(TB-Science),面向生命科学、物理科学、地球科学及数学与计算科学等自然科学领域,目标构建 100+ 个可执行基准任务,在容器化环境中以确定性程序化验证评估 AI 智能体。
Terminal-Bench 3.0 已进入开发阶段,目标收录 100 个多样化任务,发布时最强模型的解决率不超过 30%。任务需为可通过命令行完成并程序化验证的真实计算机工作,覆盖更长周期、多微服务/文件系统/数据库等更丰富环境及专家级知识,合并窗口开放至 5 月底。贡献者提交一个被接受的任务即可在最终版本中获得署名。
作者提出多模态 RAG 不必一上来就用 CLIP,而是把图片、音频、视频、表格先转成文本,复用已有的文本 RAG 流程,并给出三种模式:全部转文本、CLIP 等跨模态嵌入、多向量混合检索。
作者用 Claude Code 搭配 Opus 4.6,在全新上下文窗口中用同一提示词让智能体在 19 个 Web 框架上构建一个带 SQLite 存储的博客应用,统计工具调用次数、token 消耗和耗时。
Qodo 研究团队发布 AI 代码审查基准 1.0,向真实已合并 PR 注入缺陷,用 100 个 PR、580 个问题同时评测代码正确性与最佳实践合规性。在对比 Qodo 模型与 7 家主流 AI 代码审查平台的评测中,Qodo 以 60.1% 的 F1 分数领先,基准及评测结果已在 GitHub 公开。
作者结合自己搭建多个 RAG 系统的经验,把 RAG 拆成检索与生成两步,指出检索质量决定答案质量,提示词工程无法弥补糟糕的上下文。文中给出具体取舍:分块 300-500 token 并保留 20-30% 重叠,纯向量检索只能找到约 75% 的相关文档,混合检索可提升到 87%,重排能带来 20-35% 的准确率提升但增加 200-500ms 延迟。
作者用 RosettaCode 数据集中 19 种语言都有的编程任务,配合 Hugging Face 上 Xenova/gpt-4 分词器,比较各语言的 token 效率。
作者 Martin Alderson 认为当前模型进步是一次更微妙的 GPT-4 时刻,但现有基准测不出来。他指出 Gemini 3 Pro Preview 在设计网页和落地页上明显强于其他模型,并给出流程:上传产品 CSS 让模型提取设计系统,再结合产品截图生成 HTML 原型。
Terminal-Bench 发布 2.0 版本和 Harbor 包,前者是经过更严格验证、难度更高的智能体评测基准,后者用于评估和优化智能体。Harbor 重写了 Terminal-Bench 的测试框架,支持云端部署容器、面向 RL 和 SFT 的 rollout 接口,并兼容任何可装入容器的智能体。
推荐理由:Terminal-Bench 2.0 与 Harbor 同时发布,读者可了解智能体评测基准的验证方式与云端扩展思路。
Martin Fowler 试用 Kiro、spec-kit 和 Tessl 三款自称实现 spec-driven development(SDD)的工具,把 SDD 归纳为 spec-first、spec-anchored、spec-as-source 三个层次,并指出目前所有方案都停留在 spec-first。
推荐理由:作者亲手试用 Kiro、spec-kit 和 Tessl 三款 SDD 工具,给出 spec-first、spec-anchored、spec-as-source 三层划分,并指出小任务被过度规格化的问题。
OpenBlock Labs 的智能体 OB-1 在按正确超时限制重新提交成绩后,重新成为 Terminal-Bench 排行榜得分最高的智能体。此前该提交将数据集中每个任务的超时统一改为固定 30 分钟,而多数任务原本限时 5 分钟,导致 75 个任务超时被放宽、2 个不变、3 个被缩短。
Terminal-Bench 发布数据集注册表,让智能体开发者通过 Terminal-Bench 框架统一评测多个智能体基准,基准开发者也能借此分发自己的基准。
Warp 在 Terminal-bench-core v0.1 上解决 52% 的任务,比此前最好成绩提升 9%,首次登顶该基准。此前 Anthropic 的 Opus 4 以 43% 的任务解决率创下纪录。
Terminal-Bench 新增 parallelize-graph 和 feal-linear-cryptanalysis 两个高难度任务,分别要求智能体用 Unified Parallel C 实现基因组组装的并行 de Bruijn 图构建,以及对 FEAL 类分组密码实施已知明文线性密码分析攻击。
Anthropic 将 Terminal-Bench 列为 Claude 4 模型卡七项基准之一,Claude 4 Opus 在 Terminal-Bench-Core 上取得 43.2% 的 SOTA 成绩。Dario Amodei 在 Code with Claude 主题演讲中也提及该基准。Terminal-Bench 团队表示将在未来几天验证 Claude 4 的表现并更新官方排行榜。
Terminal-Bench 团队发布研究预览版智能体 Terminus,用于在终端中一致地评估语言模型驱动自主智能体的能力,发布时其性能在 Terminal-Bench 上仅次于 Claude Code。Terminus 采用单工具设计,仅通过 tmux 会话发送标准按键操作,并借助 LiteLLM 支持几乎所有 API 或本地托管模型,且完全自主运行、不请求用户输入。