跳到正文

#论文/研究

今日 0 条
10/6周二
  1. Tproger · Программирование58

    GitHub 与 Microsoft 开放 ReviewBench 评测 AI 代码评审

    GitHub 和 Microsoft 于 2026 年 10 月 5 日开放研究预览版 ReviewBench,用于评测 AI 代码评审智能体。该基准包含来自 187 个公开仓库、19 种语言的 219 个 pull request,语言和仓库规模分布基于对 GitHub 上 1.039 亿个 pull request 的分析,并刻意提高了实质性改动的占比。

  2. DEV Community · MCP78

    对 78 个注册表 MCP 服务器的匿名健康探测:51.3% 能走通完整调用

    Pennyforge 对某公开 MCP 注册表 a–b 切片中 186 个端点里能响应 initialize 的 78 个服务器做了匿名健康探测,只有 40 个(51.3%)能走通 initialize→tools/list→一次安全 tools/call 的完整流程。

    推荐理由:对 78 个注册表 MCP 服务器做匿名健康探测,给出分层鉴权与规范版本迁移的可复现数据。

  3. GitHub Blog · Copilot66

    GitHub 发布 AI 代码评审开放基准 ReviewBench

    GitHub 发布代码评审离线基准 ReviewBench,基于 1.039 亿个 GitHub PR 的分布特征,构建了覆盖 19 种语言、219 个公开 PR 的评测集,并公开数据集、评分规则与 LLM 评审模型配置。

    推荐理由:GitHub 公开了 AI 代码评审基准的数据集、评分规则与评测入口,读者可据此对比不同评审智能体。

10/5周一
10/3周六
  1. 宝玉62

    剑桥大学 AI 科学与政策项目(CASP)9 月发布一篇论文,Hinton、Bengio 等 20 多位研究者联名讨论 AI 研发被自动化后是否会引发智能爆炸,Hinton 在 X 上推荐了该论文。

    引用Geoffrey Hinton@geoffreyhinton

    The idea of an intelligence explosion caused by recursive self improvement has been around for a long time but until very recently it did not seem imminent. Now many leading researchers think it may happen quite soon. You can read our paper about it here: https://casp.ac/reports/intelligence-explosion

9/18周五
9/10周四
  1. AI Coder · Telegram88

    Stolen Thoughts 研究:加密 reasoning block 可被跨模型解密,泄露 API key 与密码

    Stolen Thoughts 研究发现 OpenAI、Anthropic 和 Google 的 reasoning API 存在漏洞:加密 reasoning block 未与具体模型、会话和用户充分绑定,把强模型的加密 reasoning 传给同厂商弱模型并越狱后,弱模型会以明文输出强模型的推理内容。

    推荐理由:研究揭示加密 reasoning block 可跨模型解密,并给出公开轨迹中泄露密钥的实测数据,对智能体基础设施设计有直接参考价值。

9/5周六
  1. Vibe Code Textbook · Articles66

    SWE-bench 分数到底测了什么:resolve rate 的生成过程与五篇论文的补充发现

    SWE-bench 的百分比是智能体编程领域被引用最多的数字,但它比通常被引用的方式要窄得多。文章拆解了一次评测如何产出这个数字:提交是 JSONL 格式的补丁,在 Docker 容器中应用到 base_commit 并运行仓库测试,FAIL_TO_PASS 全部通过且 PASS_TO_PASS 不回归才算 resolved,默认是 pass@1。

9/4周五
8/29周六
8/28周五
8/27周四
8/14周五
6/30周二
6/22周一
6/8周一
5/12周二
  1. Augment Code · Blog60

    Augment Code 调研 219 位工程负责人:AI 原生开发中的信任与角色落差

    Augment Code 调研了 219 位工程负责人,发现其团队约 48% 的代码由 AI 生成,55% 担心团队对代码库失去共同理解,63% 表示工程师向管理者提出了技能相关性方面的担忧,在 201-1000 人规模的团队中这一比例升至 89%。

    推荐理由:219 位工程负责人的调研数据揭示了 AI 原生开发中代码评审、技能焦虑与角色定义之间的落差。

4/4周六
  1. Hacker News · Prompt Injection52

    PIGuard:通过 MOF 策略缓解提示词注入防护的过度防御

    圣路易斯华盛顿大学与威斯康星大学麦迪逊分校的研究者提出 PIGuard,一个用于检测提示词注入的轻量防护模型,并配套发布 NotInject 评测数据集。NotInject 包含 339 条带触发词的良性样本,用于衡量防护模型的过度防御问题,结果显示现有 SOTA 模型准确率降至接近随机猜测的 60%。

3/24周二
3/8周日
2/16周一
  1. Hacker News · AGENTS.md62

    评估 AGENTS.md 对编程智能体是否有帮助

    一项研究评估了 AGENTS.md 这类上下文文件对编程智能体完成任务的帮助,发现提供上下文文件通常不会提升任务成功率,反而让推理成本平均增加超过 20%。该结论在不同大语言模型、编程智能体以及 LLM 生成和开发者提交的上下文文件上都成立。研究还发现智能体能较好遵循上下文文件中的指令,但被模型厂商推荐的仓库概览类内容并无帮助,作者建议任何试图提升性能的改动都应先经过严格评估再部署。

2/11周三