Перейти к содержимому

#Статьи/исследования

Сегодня 0 материалов
06.10вт
  1. Tproger · Программирование58

    GitHub 与 Microsoft 开放 ReviewBench 评测 AI 代码评审

    GitHub 和 Microsoft 于 2026 年 10 月 5 日开放研究预览版 ReviewBench,用于评测 AI 代码评审智能体。该基准包含来自 187 个公开仓库、19 种语言的 219 个 pull request,语言和仓库规模分布基于对 GitHub 上 1.039 亿个 pull request 的分析,并刻意提高了实质性改动的占比。

    Ожидает перевода

  2. DEV Community · MCP78

    Анонимная проверка работоспособности 78 MCP-серверов из реестра: полный цикл вызовов проходят 51.3%

    Pennyforge провёл анонимную проверку работоспособности 78 серверов, отвечающих на initialize, из 186 эндпоинтов в публичном срезе реестра MCP с диапазоном a–b. Полный цикл initialize → tools/list → один безопасный tools/call прошли только 40 из них (51.3%).

    Почему это важно: Анонимная проверка работоспособности 78 MCP-серверов из реестра с воспроизводимыми данными по многоуровневой аутентификации и миграции версий спецификации.

  3. GitHub Blog · Copilot66

    GitHub 发布 AI 代码评审开放基准 ReviewBench

    GitHub 发布代码评审离线基准 ReviewBench,基于 1.039 亿个 GitHub PR 的分布特征,构建了覆盖 19 种语言、219 个公开 PR 的评测集,并公开数据集、评分规则与 LLM 评审模型配置。

    Ожидает перевода

    Почему это важно: GitHub 公开了 AI 代码评审基准的数据集、评分规则与评测入口,读者可据此对比不同评审智能体。

05.10пн
03.10сб
  1. 宝玉62

    剑桥大学 AI 科学与政策项目(CASP)9 月发布一篇论文,Hinton、Bengio 等 20 多位研究者联名讨论 AI 研发被自动化后是否会引发智能爆炸,Hinton 在 X 上推荐了该论文。

    Ожидает перевода

    ЦитатаGeoffrey Hinton@geoffreyhinton

    The idea of an intelligence explosion caused by recursive self improvement has been around for a long time but until very recently it did not seem imminent. Now many leading researchers think it may happen quite soon. You can read our paper about it here: https://casp.ac/reports/intelligence-explosion

18.09пт
10.09чт
  1. AI Coder · Telegram88

    Stolen Thoughts 研究:加密 reasoning block 可被跨模型解密,泄露 API key 与密码

    Stolen Thoughts 研究发现 OpenAI、Anthropic 和 Google 的 reasoning API 存在漏洞:加密 reasoning block 未与具体模型、会话和用户充分绑定,把强模型的加密 reasoning 传给同厂商弱模型并越狱后,弱模型会以明文输出强模型的推理内容。

    Ожидает перевода

    Почему это важно: 研究揭示加密 reasoning block 可跨模型解密,并给出公开轨迹中泄露密钥的实测数据,对智能体基础设施设计有直接参考价值。

05.09сб
  1. Vibe Code Textbook · Articles66

    SWE-bench 分数到底测了什么:resolve rate 的生成过程与五篇论文的补充发现

    SWE-bench 的百分比是智能体编程领域被引用最多的数字,但它比通常被引用的方式要窄得多。文章拆解了一次评测如何产出这个数字:提交是 JSONL 格式的补丁,在 Docker 容器中应用到 base_commit 并运行仓库测试,FAIL_TO_PASS 全部通过且 PASS_TO_PASS 不回归才算 resolved,默认是 pass@1。

    Ожидает перевода

04.09пт
  1. Hacker News · Coding Agent 讨论71

    实测对比 grep 与 LSP:编码智能体为何弃用更精确的检索工具

    作者用三款 Claude 模型在多个 Python 和 TypeScript 仓库上对比 grep 词法检索与 LSP 语义导航,发现简单代码定位任务中模型只有 0% 到 6% 会选择语义工具,强制走语义路径反而让成功率从 100% 降到 89%。

    Ожидает перевода

29.08сб
28.08пт
  1. Hacker News · AGENTS.md69

    ETH Zurich 测试发现 AGENTS.md 对编码智能体基本没用,还让推理成本涨两成

    ETH Zurich 团队用带与不带 AGENTS.md 的测试项目跑编码智能体,发现提供上下文文件通常不提升任务成功率,推理成本平均增加超过 20%,该结论在不同 LLM、编码智能体和 LLM 生成与开发者提交的上下文文件上都成立。

    Ожидает перевода

27.08чт
14.08пт
30.06вт
22.06пн
08.06пн
12.05вт
  1. Augment Code · Blog60

    Augment Code 调研 219 位工程负责人:AI 原生开发中的信任与角色落差

    Augment Code 调研了 219 位工程负责人,发现其团队约 48% 的代码由 AI 生成,55% 担心团队对代码库失去共同理解,63% 表示工程师向管理者提出了技能相关性方面的担忧,在 201-1000 人规模的团队中这一比例升至 89%。

    Ожидает перевода

    Почему это важно: 219 位工程负责人的调研数据揭示了 AI 原生开发中代码评审、技能焦虑与角色定义之间的落差。

04.04сб
  1. Hacker News · Prompt Injection52

    PIGuard:通过 MOF 策略缓解提示词注入防护的过度防御

    圣路易斯华盛顿大学与威斯康星大学麦迪逊分校的研究者提出 PIGuard,一个用于检测提示词注入的轻量防护模型,并配套发布 NotInject 评测数据集。NotInject 包含 339 条带触发词的良性样本,用于衡量防护模型的过度防御问题,结果显示现有 SOTA 模型准确率降至接近随机猜测的 60%。

    Ожидает перевода

24.03вт
  1. Kondasamy Jayaraman · Engineering Blog71

    UC San Diego 研究 112 名专业开发者:资深开发者不 vibe coding,而是控制 AI 智能体

    UC San Diego 研究团队通过 13 场实地观察和 99 名资深开发者的问卷(共 112 人,中位经验 10 年,使用 Claude Code、Cursor、GitHub Copilot、Windsurf)发现,专业开发者并不 vibe coding,而是通过规划和监督严格控制智能体。

    Ожидает перевода

08.03вс
16.02пн
  1. Hacker News · AGENTS.md62

    评估 AGENTS.md 对编程智能体是否有帮助

    一项研究评估了 AGENTS.md 这类上下文文件对编程智能体完成任务的帮助,发现提供上下文文件通常不会提升任务成功率,反而让推理成本平均增加超过 20%。该结论在不同大语言模型、编程智能体以及 LLM 生成和开发者提交的上下文文件上都成立。研究还发现智能体能较好遵循上下文文件中的指令,但被模型厂商推荐的仓库概览类内容并无帮助,作者建议任何试图提升性能的改动都应先经过严格评估再部署。

    Ожидает перевода

11.02ср