跳到正文

评测与对比

编程模型和工具的评测结果、同一任务下的对比实测。

最新精选

第 1–16 条 · 共 16 条
今天10/6周二
  1. GitHub Blog · Copilot66

    GitHub 发布 AI 代码评审开放基准 ReviewBench

    GitHub 发布代码评审离线基准 ReviewBench,基于 1.039 亿个 GitHub PR 的分布特征,构建了覆盖 19 种语言、219 个公开 PR 的评测集,并公开数据集、评分规则与 LLM 评审模型配置。

    推荐理由:GitHub 公开了 AI 代码评审基准的数据集、评分规则与评测入口,读者可据此对比不同评审智能体。

9/24周四
9/4周五
8/27周四
8/19周三
  1. Cline · Blog71

    Cline 开源开放权重模型的评测方法与 trace

    Cline 开源其开放权重模型的评测方法,并附上价值超过一千美元的爬坡分数与 trace 供下载分析。文章给出 Hill Climber's Checklist 五条启发式:设定北极星指标、量化噪声、按任务/模型/供应商拆解失败模式、不要默认更多思考更好、保留私有评测集。

    推荐理由:Cline 公开评测方法与上千美元 trace,给出五条可迁移的爬坡启发式,适合自建 harness 的团队参考。

8/10周一
  1. Martin Fowler · Exploring Generative AI74

    智能体循环里的 TDD 是形式还是真价值?Martin Fowler 的对比实验

    Martin Fowler 用 Sonnet 4.6 生成、Opus 4.8 盲评的方式,对小型、中型和较大型三类业务逻辑任务分别跑 TDD 与非 TDD 方案,结论是两者质量没有明显差异,非 TDD 方案在设计和测试质量上还多次略高,变异分数也没有实质差别。

    推荐理由:作者用同一批任务对比 TDD 与非 TDD 智能体实现,给出 token 成本与设计质量差异,并反思哪些 TDD 收益在智能体循环里失效。

7/30周四
  1. Terminal-Bench · News60

    Terminal-Bench 3.0 发布:74 个任务、7 个领域,最强模型通过率约 34%

    Terminal-Bench 团队发布 Terminal-Bench 3.0,首个版本包含 7 个领域共 74 个任务,最强模型通过率约 34%。该版本在 Terminal-Bench 2.1 基础上扩展任务多样性,并引入 CI/CD、语义化版本和结果迁移来持续改进基准。

    推荐理由:Terminal-Bench 3.0 用 74 个任务和 CI/CD 版本化机制重建基准,读者可了解新基准如何拉开模型差距。

  2. Terminal-Bench · News62

    Terminal-Bench 发布 Harbor 新功能,把基准做成可持续更新的版本化资产

    Terminal-Bench 团队发布一批 Harbor 新功能,让数据集可以按版本发布、排行榜可迁移到新版本,做法是复用、重评或重跑 trial。任务采用语义化版本:补丁级改动直接复用旧结果,验证器改动只需重评已保存产物,只有显著改变智能体环境的重大改动才需要重跑;数据集版本跟随任务中最大的版本号,排行榜通过 diff 只重跑重大改动任务。

    推荐理由:Terminal-Bench 团队把基准当软件来维护,给出任务语义化版本与排行榜升级的具体机制,可迁移到自建评测流程。

7/25周六
  1. Cline · Blog79

    Cline 用递归自我改进让智能体自主把 Kimi K3 在 Terminal-Bench 2.1 提到 88.8%

    Cline 用一条提示词启动 17 小时连续运行的编码智能体,以 GPT-5.6-Sol 为 leader 模型,把 Kimi K3 在 Terminal-Bench 2.1 上的成绩从基线 69/89(77.5%,$79)提升到确认运行 79/89(88.8%,$49.8),超过 Moonshot 自报的 88.3%。

    推荐理由:Cline 用一条提示词让智能体自主完成 17 小时爬山,把 Terminal-Bench 2.1 从 77.5% 提到 88.8%,可看具体修了哪些 harness 问题。

6/18周四
  1. Terminal-Bench · News60

    Terminal-Bench 发布 Challenges 长周期智能体基准

    Terminal-Bench 发布 Challenges,一种长周期、高 token 消耗的单任务基准,要求智能体在无时间与资源限制下自主完成整个项目,首批开放三个挑战。

    推荐理由:Terminal-Bench 官方推出长周期单任务基准,并公开三个挑战的实测失败模式,可供评估智能体长时自主能力时参考。

4/30周四
4/22周三
  1. Augment Code · Blog88

    Augment Code 实测 AGENTS.md:好文件相当于模型升级,坏文件不如不写

    Augment Code 从自家 monorepo 抽取数十个 AGENTS.md,用内部评测集 AuggieBench 对比同一任务在有、无该文件时的表现,发现最好的文件带来的质量提升相当于从 Haiku 升级到 Opus,最差的则让输出比完全没有 AGENTS.md 更糟。

    推荐理由:Augment Code 用内部评测量化了 AGENTS.md 各写法的效果差异,读者可据此调整自己仓库的文档结构。

11/7周五
  1. Terminal-Bench · News62

    Terminal-Bench 发布 2.0 版本与 Harbor 评测优化包

    Terminal-Bench 发布 2.0 版本和 Harbor 包,前者是经过更严格验证、难度更高的智能体评测基准,后者用于评估和优化智能体。Harbor 重写了 Terminal-Bench 的测试框架,支持云端部署容器、面向 RL 和 SFT 的 rollout 接口,并兼容任何可装入容器的智能体。

    推荐理由:Terminal-Bench 2.0 与 Harbor 同时发布,读者可了解智能体评测基准的验证方式与云端扩展思路。

10/15周三
  1. Martin Fowler · Exploring Generative AI74

    拆解 Spec-Driven Development:Kiro、spec-kit 与 Tessl 三种工具实测

    Martin Fowler 试用 Kiro、spec-kit 和 Tessl 三款自称实现 spec-driven development(SDD)的工具,把 SDD 归纳为 spec-first、spec-anchored、spec-as-source 三个层次,并指出目前所有方案都停留在 spec-first。

    推荐理由:作者亲手试用 Kiro、spec-kit 和 Tessl 三款 SDD 工具,给出 spec-first、spec-anchored、spec-as-source 三层划分,并指出小任务被过度规格化的问题。

5/19周一
  1. Terminal-Bench · News62

    Terminal-Bench 发布首个终端智能体评测基准

    Terminal-Bench 发布首个版本,用于量化 AI 智能体在终端中执行复杂任务的能力,首发数据集 Terminal-Bench-Core-v0 包含 80 个手工编写并人工验证的任务,每个任务配有独立 Docker 环境、人工验证的解法与测试用例。

    推荐理由:Terminal-Bench 给出 80 个带 Docker 环境和测试用例的终端任务,可用来横向比较不同智能体在命令行中的实际表现。