一周多用 Codex 少用 Claude 后的十点对比感受
作者在 MacOS 上分别用 Codex TUI(gpt-5.6-sol xhigh)和 Claude Code TUI(opus-5 xhigh)工作一周,记录了十点个人感受。
Ожидает перевода
作者在 MacOS 上分别用 Codex TUI(gpt-5.6-sol xhigh)和 Claude Code TUI(opus-5 xhigh)工作一周,记录了十点个人感受。
Ожидает перевода
Simon Willison 让运行在 Claude Code for web 中的 Claude Fable 5 评测 smolmachines 的 smolvm 1.8.3,目标是安全执行不可信的 Python 和 JavaScript 数据转换代码,限制 RAM 和 CPU 时间、禁止网络访问、只允许访问指定文件。
Ожидает перевода
Cline открывает методику оценки своих открытых моделей и выкладывает для скачивания и анализа трассировки и результаты «восхождения», стоившие больше тысячи долларов. В статье приводится Hill Climber's Checklist — пять эвристик: задать метрику-«Полярную звезду», измерить шум, разложить режимы отказа по задачам, моделям и поставщикам, не считать по умолчанию, что чем больше рассуждений, тем лучше, и сохранять закрытый оценочный набор.
Почему это важно: Cline публикует методику оценки и трассировки на тысячи долларов и даёт пять переносимых эвристик «восхождения», полезных командам, которые собирают собственный harness.
Simon Willison 实测阿里 Qwen 实验室发布的 Apache 2 许可 27B 视觉模型 Qwen 3.8 27B,认为模型本身出色,但默认的 xhigh 推理档位会严重过度思考,建议先用 low 或关闭推理。
Ожидает перевода
Martin Fowler 用 Sonnet 4.6 生成、Opus 4.8 盲评的方式,对小型、中型和较大型三类业务逻辑任务分别跑 TDD 与非 TDD 方案,结论是两者质量没有明显差异,非 TDD 方案在设计和测试质量上还多次略高,变异分数也没有实质差别。
Ожидает перевода
Почему это важно: 作者用同一批任务对比 TDD 与非 TDD 智能体实现,给出 token 成本与设计质量差异,并反思哪些 TDD 收益在智能体循环里失效。
作者深度体验几天 DeepSeek V4 Flash 0731 正式版后总结:便宜到跑批处理、Agent 循环和几十轮对话账单基本无感,速度快到配合 Agent 工具循环每步几秒内完成,1M 上下文可容纳整个仓库和完整对话历史、无需频繁 compact,结合 Cache 打折长上下文成本还能再降。
Ожидает перевода
Команда Terminal-Bench выпустила Terminal-Bench 3.0 — первая версия включает 74 задач в 7 областях, у сильнейших моделей проходимость около 34%. По сравнению с Terminal-Bench 2.1 здесь больше разнообразия задач, а для постоянного улучшения бенчмарка добавили CI/CD, семантическое версионирование и перенос результатов.
Почему это важно: Terminal-Bench 3.0 пересобирает бенчмарк на 74 задачах и версионировании через CI/CD — читатель увидит, как новый бенчмарк разводит модели по результатам.
Команда Terminal-Bench выпустила набор новых возможностей Harbor: датасеты теперь можно публиковать по версиям, а таблицу лидеров — переносить на новую версию, для чего нужно либо переиспользовать, либо переоценить, либо перезапустить trial. Задачи версионируются семантически: при изменениях уровня патча старые результаты просто переиспользуются, при изменениях валидатора достаточно переоценить уже сохранённые артефакты, и только существенные изменения, заметно меняющие среду ИИ-агента, требуют перезапуска. Версия датасета соответствует максимальной версии среди задач, а таблица лидеров через diff перезапускает только задачи с существенными изменениями.
Почему это важно: Команда Terminal-Bench относится к бенчмарку как к программному обеспечению и описывает конкретный механизм семантического версионирования задач и обновления таблицы лидеров, который можно перенести в собственный процесс оценки.
Cline 用一条提示词启动 17 小时连续运行的编码智能体,以 GPT-5.6-Sol 为 leader 模型,把 Kimi K3 在 Terminal-Bench 2.1 上的成绩从基线 69/89(77.5%,$79)提升到确认运行 79/89(88.8%,$49.8),超过 Moonshot 自报的 88.3%。
Ожидает перевода
Почему это важно: Cline 用一条提示词让智能体自主完成 17 小时爬山,把 Terminal-Bench 2.1 从 77.5% 提到 88.8%,可看具体修了哪些 harness 问题。
JetBrains 用 Claude Code 跑 SkillsBench 的 86 个真实编程任务,对比安装与不安装 Caveman 的效果,发现输出 Token 只从约 59.2 万降到 54.2 万,节省 8.5%,远低于项目宣传的 65%。
Ожидает перевода
Terminal-Bench 发布 Challenges,一种长周期、高 token 消耗的单任务基准,要求智能体在无时间与资源限制下自主完成整个项目,首批开放三个挑战。
Ожидает перевода
Почему это важно: Terminal-Bench 官方推出长周期单任务基准,并公开三个挑战的实测失败模式,可供评估智能体长时自主能力时参考。
作者认为把 AI 预算押在选当前跑分领先的模型上是错误下注,因为模型每半年就换一轮领先者,真正能积累的是公司独有的内部上下文。
Ожидает перевода
一篇论文评估仓库级上下文文件(如 AGENTS.md、CLAUDE.md)对编程智能体的作用,在 SWE-bench Lite 和自建基准 AGENTBENCH(12 个仓库的 138 个 Python 任务)上对比无上下文文件、LLM 生成和开发者手写三种条件。
Ожидает перевода
作者用同一条口播视频和同一套提示词,分别让 Claude Code 驱动 Remotion 和 Hyperframes 做特效,实测两者的调试流程与 token 成本。
Ожидает перевода
作者指出 AI 工具在个体层面带来 21% 任务完成量和 98% PR 合并量提升,但组织交付指标持平、稳定性略降,METR 随机对照实验中 16 名开发者在 246 个真实 issue 上实测反而慢 19%。
Ожидает перевода
Augment Code добавила в начало AGENTS.md около 2.5 тыс. символов правил кодирования в стиле Карпати и сравнила, как Auggie, Claude Code и Codex справляются с 40 пул-реквестами OpenClaw.
Почему это важно: Сравнительный тест трёх ИИ-агентов для разработки на одной и той же партии пул-реквестов показывает: ограничения в промпте в основном экономят деньги, а не повышают качество, и при этом каждый харнесс работает по-своему.
Lovable 在早期访问中测试 GPT-5.5,其内部基准显示最难任务通过率从 GPT-5.4 的 36.9% 升至 41.6%,每次请求工具调用减少 23.1%,用户卡住的消息占比下降 9.9%。GPT-5.5 每请求输出 token 减少 33%,日常任务成本效率提升约 15%,将很快向 Lovable 构建者开放。
Ожидает перевода
Augment Code вытащила из своего монорепозитория несколько десятков AGENTS.md и на внутреннем наборе тестов AuggieBench сравнила, как один и тот же агент справляется с задачей при наличии этих файлов и без них. Лучшие файлы дают такой же прирост качества, как переход с Haiku на Opus, а худшие — ухудшают результат по сравнению с полным отсутствием AGENTS.md.
Почему это важно: Augment Code с помощью внутренних метрик измерила, насколько различается эффект от разных вариантов написания AGENTS.md; читатели могут использовать это, чтобы перестроить документацию в своём репозитории.
作者用同一提示词对比 Claude Code 新隐藏功能 Ultra Plan 与普通计划模式,Ultra Plan 把计划发到云端由多个跑 Opus 4.6 的智能体并行处理,规划几乎瞬间完成、执行 3 分 20 秒,普通模式规划 4 分 40 秒、执行 7 分 31 秒。
Ожидает перевода
作者对比了 AI 设计工具的三个层次:代码优先的设计 Skill(Anthropic frontend-design、Impeccable 及社区分支)、Figma AI 插件(Banani、UX Pilot、Uizard)和 prompt-to-app 构建器(Lovable)。
Ожидает перевода
作者在同一个代码库上分别用 GSD 和 Compound Engineering 各跑一周后,把 Claude Code 的默认工作流换成了 Every 的 Compound Engineering 插件。
Ожидает перевода
Terminal-Bench 发布任务设计指南,提出好的基准任务应具备对抗性、难度和可读性:指令像给资深工程师那样清晰直接,测试只验证结果而非实现细节,允许替代解法并防止 reward hacking。难度应来自问题本身,而非苛刻的输出格式或隐藏假设。作者建议亲自运行任务、检查容器、执行 oracle 并观察真实智能体轨迹,失败运行尤其能揭示任务是否真正困难。
Ожидает перевода
作者指出纯稠密检索会漏掉约 25% 的相关文档,在错误码、法规条款编号、罕见实体等精确匹配场景下 BM25 仍占优,而稠密检索擅长改写、对话式查询和跨语言检索。
Ожидает перевода
ETH Zurich 团队构建 AGENTbench,用 138 个来自小众仓库的真实 Python 任务,测试 Claude 3.5 Sonnet、Codex GPT-5.2、GPT-5.1 mini 和 Qwen Code 在无上下文文件、LLM 生成文件、人工编写文件三种场景下的表现。
Ожидает перевода
Terminal-Bench 团队宣布正在开发 Terminal-Bench-Science(TB-Science),面向生命科学、物理科学、地球科学及数学与计算科学等自然科学领域,目标构建 100+ 个可执行基准任务,在容器化环境中以确定性程序化验证评估 AI 智能体。
Ожидает перевода
Terminal-Bench 3.0 已进入开发阶段,目标收录 100 个多样化任务,发布时最强模型的解决率不超过 30%。任务需为可通过命令行完成并程序化验证的真实计算机工作,覆盖更长周期、多微服务/文件系统/数据库等更丰富环境及专家级知识,合并窗口开放至 5 月底。贡献者提交一个被接受的任务即可在最终版本中获得署名。
Ожидает перевода
作者提出多模态 RAG 不必一上来就用 CLIP,而是把图片、音频、视频、表格先转成文本,复用已有的文本 RAG 流程,并给出三种模式:全部转文本、CLIP 等跨模态嵌入、多向量混合检索。
Ожидает перевода
作者用 Claude Code 搭配 Opus 4.6,在全新上下文窗口中用同一提示词让智能体在 19 个 Web 框架上构建一个带 SQLite 存储的博客应用,统计工具调用次数、token 消耗和耗时。
Ожидает перевода
Qodo 研究团队发布 AI 代码审查基准 1.0,向真实已合并 PR 注入缺陷,用 100 个 PR、580 个问题同时评测代码正确性与最佳实践合规性。在对比 Qodo 模型与 7 家主流 AI 代码审查平台的评测中,Qodo 以 60.1% 的 F1 分数领先,基准及评测结果已在 GitHub 公开。
Ожидает перевода
作者结合自己搭建多个 RAG 系统的经验,把 RAG 拆成检索与生成两步,指出检索质量决定答案质量,提示词工程无法弥补糟糕的上下文。文中给出具体取舍:分块 300-500 token 并保留 20-30% 重叠,纯向量检索只能找到约 75% 的相关文档,混合检索可提升到 87%,重排能带来 20-35% 的准确率提升但增加 200-500ms 延迟。
Ожидает перевода
作者用 RosettaCode 数据集中 19 种语言都有的编程任务,配合 Hugging Face 上 Xenova/gpt-4 分词器,比较各语言的 token 效率。
Ожидает перевода
作者 Martin Alderson 认为当前模型进步是一次更微妙的 GPT-4 时刻,但现有基准测不出来。他指出 Gemini 3 Pro Preview 在设计网页和落地页上明显强于其他模型,并给出流程:上传产品 CSS 让模型提取设计系统,再结合产品截图生成 HTML 原型。
Ожидает перевода
Terminal-Bench выпустил версию 2.0 и пакет Harbor: первый — это более строго проверенный и сложный бенчмарк для оценки агентов, второй — для их оценки и оптимизации. Harbor переписал тестовый фреймворк Terminal-Bench: теперь можно разворачивать контейнеры в облаке, есть интерфейсы rollout для RL и SFT, а также совместимость с любыми агентами, которые упаковываются в контейнер.
Почему это важно: Вместе с Terminal-Bench 2.0 вышел Harbor — читатели узнают, как проверяются бенчмарки для агентов и как масштабировать их в облаке.
Martin Fowler 试用 Kiro、spec-kit 和 Tessl 三款自称实现 spec-driven development(SDD)的工具,把 SDD 归纳为 spec-first、spec-anchored、spec-as-source 三个层次,并指出目前所有方案都停留在 spec-first。
Ожидает перевода
Почему это важно: 作者亲手试用 Kiro、spec-kit 和 Tessl 三款 SDD 工具,给出 spec-first、spec-anchored、spec-as-source 三层划分,并指出小任务被过度规格化的问题。
OpenBlock Labs 的智能体 OB-1 在按正确超时限制重新提交成绩后,重新成为 Terminal-Bench 排行榜得分最高的智能体。此前该提交将数据集中每个任务的超时统一改为固定 30 分钟,而多数任务原本限时 5 分钟,导致 75 个任务超时被放宽、2 个不变、3 个被缩短。
Ожидает перевода
Terminal-Bench 发布数据集注册表,让智能体开发者通过 Terminal-Bench 框架统一评测多个智能体基准,基准开发者也能借此分发自己的基准。
Ожидает перевода
Warp 在 Terminal-bench-core v0.1 上解决 52% 的任务,比此前最好成绩提升 9%,首次登顶该基准。此前 Anthropic 的 Opus 4 以 43% 的任务解决率创下纪录。
Ожидает перевода
Terminal-Bench 新增 parallelize-graph 和 feal-linear-cryptanalysis 两个高难度任务,分别要求智能体用 Unified Parallel C 实现基因组组装的并行 de Bruijn 图构建,以及对 FEAL 类分组密码实施已知明文线性密码分析攻击。
Ожидает перевода
Anthropic 将 Terminal-Bench 列为 Claude 4 模型卡七项基准之一,Claude 4 Opus 在 Terminal-Bench-Core 上取得 43.2% 的 SOTA 成绩。Dario Amodei 在 Code with Claude 主题演讲中也提及该基准。Terminal-Bench 团队表示将在未来几天验证 Claude 4 的表现并更新官方排行榜。
Ожидает перевода
Terminal-Bench 团队发布研究预览版智能体 Terminus,用于在终端中一致地评估语言模型驱动自主智能体的能力,发布时其性能在 Terminal-Bench 上仅次于 Claude Code。Terminus 采用单工具设计,仅通过 tmux 会话发送标准按键操作,并借助 LiteLLM 支持几乎所有 API 或本地托管模型,且完全自主运行、不请求用户输入。
Ожидает перевода