跳到正文

#评测/基准

今日 7 条
今天10/6周二
  1. Habr · Claude Code64

    用英文给编码智能体写提示词更省 token 吗?40 次实测只差 12 个 token

    作者用 5 个 Python 任务、Haiku 4.5 和 Sonnet 5.5 各跑两遍共 40 次,对比俄语和英语提示词的 token 消耗与成本。俄语提示词平均每任务多 12 个 token,但单次运行平均读取约 22.2 万输入 token,其中 94% 是每轮从缓存重读的系统提示词、工具说明和项目文件,语言差异只占约 0.005%。

  2. Tproger · Программирование58

    GitHub 与 Microsoft 开放 ReviewBench 评测 AI 代码评审

    GitHub 和 Microsoft 于 2026 年 10 月 5 日开放研究预览版 ReviewBench,用于评测 AI 代码评审智能体。该基准包含来自 187 个公开仓库、19 种语言的 219 个 pull request,语言和仓库规模分布基于对 GitHub 上 1.039 亿个 pull request 的分析,并刻意提高了实质性改动的占比。

  3. GitHub Blog · Copilot66

    GitHub 发布 AI 代码评审开放基准 ReviewBench

    GitHub 发布代码评审离线基准 ReviewBench,基于 1.039 亿个 GitHub PR 的分布特征,构建了覆盖 19 种语言、219 个公开 PR 的评测集,并公开数据集、评分规则与 LLM 评审模型配置。

    推荐理由:GitHub 公开了 AI 代码评审基准的数据集、评分规则与评测入口,读者可据此对比不同评审智能体。

10/5周一
  1. 老刘说NLP22

    《Agent Harness 技术蓝皮书》对内发布,并定量定性分析 RAG 当前研究趋势

    社区对内发布《Agent Harness 技术蓝皮书》,全书 8 篇 33 章共 139 页,将 Agent Harness 定义为围绕大语言模型构建的确定性运行时。同期基于 arxiv API 检索 2026-08-01 至 10-05 的 66 天数据,去重后新增 930 篇 RAG 相关论文,约 14 篇/天,研究重心已从检索 pipeline 搭建转向系统层、质量层与形态层。

10/4周日
10/3周六
10/1周四
9/29周二
9/28周一
9/25周五
9/24周四
9/22周二
9/18周五
9/15周二
9/5周六
  1. Vibe Code Textbook · Articles66

    SWE-bench 分数到底测了什么:resolve rate 的生成过程与五篇论文的补充发现

    SWE-bench 的百分比是智能体编程领域被引用最多的数字,但它比通常被引用的方式要窄得多。文章拆解了一次评测如何产出这个数字:提交是 JSONL 格式的补丁,在 Docker 容器中应用到 base_commit 并运行仓库测试,FAIL_TO_PASS 全部通过且 PASS_TO_PASS 不回归才算 resolved,默认是 pass@1。

9/4周五
9/2周三
9/1周二
8/28周五
8/27周四