跳到正文

#评测/基准

今日 0 条
10/6周二
  1. Tproger · Программирование58

    GitHub 与 Microsoft 开放 ReviewBench 评测 AI 代码评审

    GitHub 和 Microsoft 于 2026 年 10 月 5 日开放研究预览版 ReviewBench,用于评测 AI 代码评审智能体。该基准包含来自 187 个公开仓库、19 种语言的 219 个 pull request,语言和仓库规模分布基于对 GitHub 上 1.039 亿个 pull request 的分析,并刻意提高了实质性改动的占比。

  2. GitHub Blog · Copilot66

    GitHub 发布 AI 代码评审开放基准 ReviewBench

    GitHub 发布代码评审离线基准 ReviewBench,基于 1.039 亿个 GitHub PR 的分布特征,构建了覆盖 19 种语言、219 个公开 PR 的评测集,并公开数据集、评分规则与 LLM 评审模型配置。

    推荐理由:GitHub 公开了 AI 代码评审基准的数据集、评分规则与评测入口,读者可据此对比不同评审智能体。

10/5周一
10/4周日
10/3周六
10/1周四
9/22周二
9/4周五
8/28周五
8/27周四
7/30周四
  1. Terminal-Bench · News60

    Terminal-Bench 3.0 发布:74 个任务、7 个领域,最强模型通过率约 34%

    Terminal-Bench 团队发布 Terminal-Bench 3.0,首个版本包含 7 个领域共 74 个任务,最强模型通过率约 34%。该版本在 Terminal-Bench 2.1 基础上扩展任务多样性,并引入 CI/CD、语义化版本和结果迁移来持续改进基准。

    推荐理由:Terminal-Bench 3.0 用 74 个任务和 CI/CD 版本化机制重建基准,读者可了解新基准如何拉开模型差距。

  2. Terminal-Bench · News62

    Terminal-Bench 发布 Harbor 新功能,把基准做成可持续更新的版本化资产

    Terminal-Bench 团队发布一批 Harbor 新功能,让数据集可以按版本发布、排行榜可迁移到新版本,做法是复用、重评或重跑 trial。任务采用语义化版本:补丁级改动直接复用旧结果,验证器改动只需重评已保存产物,只有显著改变智能体环境的重大改动才需要重跑;数据集版本跟随任务中最大的版本号,排行榜通过 diff 只重跑重大改动任务。

    推荐理由:Terminal-Bench 团队把基准当软件来维护,给出任务语义化版本与排行榜升级的具体机制,可迁移到自建评测流程。

6/18周四
  1. Terminal-Bench · News60

    Terminal-Bench 发布 Challenges 长周期智能体基准

    Terminal-Bench 发布 Challenges,一种长周期、高 token 消耗的单任务基准,要求智能体在无时间与资源限制下自主完成整个项目,首批开放三个挑战。

    推荐理由:Terminal-Bench 官方推出长周期单任务基准,并公开三个挑战的实测失败模式,可供评估智能体长时自主能力时参考。

4/24周五
3/8周日
3/5周四
  1. Terminal-Bench · News30

    Terminal-Bench 3.0 公开征集任务贡献

    Terminal-Bench 3.0 已进入开发阶段,目标收录 100 个多样化任务,发布时最强模型的解决率不超过 30%。任务需为可通过命令行完成并程序化验证的真实计算机工作,覆盖更长周期、多微服务/文件系统/数据库等更丰富环境及专家级知识,合并窗口开放至 5 月底。贡献者提交一个被接受的任务即可在最终版本中获得署名。

2/5周四
11/7周五
  1. Terminal-Bench · News62

    Terminal-Bench 发布 2.0 版本与 Harbor 评测优化包

    Terminal-Bench 发布 2.0 版本和 Harbor 包,前者是经过更严格验证、难度更高的智能体评测基准,后者用于评估和优化智能体。Harbor 重写了 Terminal-Bench 的测试框架,支持云端部署容器、面向 RL 和 SFT 的 rollout 接口,并兼容任何可装入容器的智能体。

    推荐理由:Terminal-Bench 2.0 与 Harbor 同时发布,读者可了解智能体评测基准的验证方式与云端扩展思路。

7/15周二
6/25周三
6/20周五
5/23周五
5/19周一
  1. Terminal-Bench · News62

    Terminal-Bench 发布首个终端智能体评测基准

    Terminal-Bench 发布首个版本,用于量化 AI 智能体在终端中执行复杂任务的能力,首发数据集 Terminal-Bench-Core-v0 包含 80 个手工编写并人工验证的任务,每个任务配有独立 Docker 环境、人工验证的解法与测试用例。

    推荐理由:Terminal-Bench 给出 80 个带 Docker 环境和测试用例的终端任务,可用来横向比较不同智能体在命令行中的实际表现。