Перейти к содержимому

#Обзоры/бенчмарки

Сегодня 7 материалов
Сегодня06.10вт
  1. DEV Community · Codex74

    Codex 与 Claude Code 同任务实测:质量打平,Codex 成本低 2.4 倍

    作者在 python-humanize 仓库上用四个任务(真实 issue 修 bug、按规格加功能、无行为变更重构、带 3 个植入 bug 的代码评审)各跑两遍,Claude Code 2.1.291(claude-opus-5-5)与 Codex CLI 0.160.0(gpt-6.1-sol)16 次运行全部通过检查,四个评审都找齐 3 个植入 bug 且无误报。

    Ожидает перевода

  2. Reddit · ClaudeCode / Codex / VibeCoding59

    用 Claude Code 修复 Codex 遗留的 Blender 怪物模型颈部贴图

    作者用 Codex 的 Sol 5.6 在 Blender 里搭出一个复杂怪物模型,项目当时只有几百 MB;随后 Astra 和 Sol 6/6.1 花数周修复颈部一块皮肤贴图,中间草稿和迭代文件让项目膨胀到近 3TB,问题仍未解决。

    Ожидает перевода

  3. Habr · Claude Code64

    用英文给编码智能体写提示词更省 token 吗?40 次实测只差 12 个 token

    作者用 5 个 Python 任务、Haiku 4.5 和 Sonnet 5.5 各跑两遍共 40 次,对比俄语和英语提示词的 token 消耗与成本。俄语提示词平均每任务多 12 个 token,但单次运行平均读取约 22.2 万输入 token,其中 94% 是每轮从缓存重读的系统提示词、工具说明和项目文件,语言差异只占约 0.005%。

    Ожидает перевода

  4. Tproger · Программирование58

    GitHub 与 Microsoft 开放 ReviewBench 评测 AI 代码评审

    GitHub 和 Microsoft 于 2026 年 10 月 5 日开放研究预览版 ReviewBench,用于评测 AI 代码评审智能体。该基准包含来自 187 个公开仓库、19 种语言的 219 个 pull request,语言和仓库规模分布基于对 GitHub 上 1.039 亿个 pull request 的分析,并刻意提高了实质性改动的占比。

    Ожидает перевода

  5. DEV Community · MCP78

    Ловушка FP8: счёт за GPU упал на 47%, а модель выдаёт «!!!!!!»

    Автор запустил Qwen2.5 7B/32B/72B на одной AMD MI300X через vLLM для ROCm по цене $2.99 за GPU-час; базовый уровень BF16 — $0.227 за миллион выходных токенов для 7B, $0.77 для 32B и $1.67 для 72B.

    Почему это важно: Автор протестировал FP8-квантизацию на MI300X и обнаружил, что оплата по токенам маскирует деградацию вывода в бессмыслицу, и предложил воспроизводимый способ проверки.

  6. GitHub Blog · Copilot66

    GitHub 发布 AI 代码评审开放基准 ReviewBench

    GitHub 发布代码评审离线基准 ReviewBench,基于 1.039 亿个 GitHub PR 的分布特征,构建了覆盖 19 种语言、219 个公开 PR 的评测集,并公开数据集、评分规则与 LLM 评审模型配置。

    Ожидает перевода

    Почему это важно: GitHub 公开了 AI 代码评审基准的数据集、评分规则与评测入口,读者可据此对比不同评审智能体。

05.10пн
  1. 老刘说NLP22

    《Agent Harness 技术蓝皮书》对内发布,并定量定性分析 RAG 当前研究趋势

    社区对内发布《Agent Harness 技术蓝皮书》,全书 8 篇 33 章共 139 页,将 Agent Harness 定义为围绕大语言模型构建的确定性运行时。同期基于 arxiv API 检索 2026-08-01 至 10-05 的 66 天数据,去重后新增 930 篇 RAG 相关论文,约 14 篇/天,研究重心已从检索 pipeline 搭建转向系统层、质量层与形态层。

    Ожидает перевода

  2. DEV Community · AI Coding58

    Lovable、Bolt、v0 实测对比:哪个 AI 建站工具真能交付

    作者用同一份需求(SaaS 落地页加带鉴权的仪表盘)在 Lovable Pro、Bolt Pro、v0 Plus 上各跑一遍并做 10 轮修改,Lovable 首稿质量 8.5 分、34 分钟出可用应用,Bolt 26 分钟最快但首稿 7.8 分、需 9 次修改,v0 首稿 8.2 分、41 分钟最慢但代码最易维护。

    Ожидает перевода

04.10вс
  1. DEV Community · Codex75

    GPT-5.5 и Codex: что реально изменилось и какой ценой — за шумихой

    GPT-5.5 вышла 23 апреля 2026 года. Это первая полностью переобученная базовая модель OpenAI со времён GPT-4.5. На Terminal-Bench 2.0 она набирает 82.7%, а на тех же задачах Codex расходует на 40% меньше токенов, чем GPT-5.4. Но цена ввода и вывода выросла вдвое — до 5 долларов за миллион входных токенов и 30 долларов за миллион выходных.

  2. DEV Community · AI Coding60

    ChatGPT 与 Claude 编程实测对比:谁写出的代码更靠谱

    作者在同一个中型 TypeScript 仓库上用相同提示词跑了五个任务(竞态条件排查、跨 8 文件重构、补测试到约 90% 覆盖率、按 300 字规格做 CRUD 应用、审查 400 行 diff 中的 6 个植入问题),对比 ChatGPT Plus 的 Codex 与 Claude Pro 的 Claude Code。

    Ожидает перевода

03.10сб
  1. Steve Yegge22

    使用 Opus 5.5 两周后,作者认为它是出色的模型,在解释和教学方面远优于 Fable。其评测显示,Opus 5.5 的精度在所有任务上与 Fable 5.1 相当,但召回不如后者:具体任务上两者持平,任务越开放,Fable 越能发现并处理重要问题,视角更好。作者仍将 Opus 5.5 用于大部分工作。

    Ожидает перевода

01.10чт
29.09вт
28.09пн
  1. Habr · Claude Code62

    按每小时 token 消耗给五家 API 网关排成本:Claude Opus 5.5 与 GPT-6 Sol 对比

    作者导出自己 49 个 Claude Code 会话、138 小时活跃工作的日志,统计出每小时平均消耗 1530 万缓存读取、86 万缓存写入、5.1 万输出和 560 普通输入 token,再按这套固定用量给 TeamoRouter、LiteAI、RouterAI、Polza AI、ProxyAPI 五家 API 网关算每小时花费。

    Ожидает перевода

25.09пт
  1. Vibe Built · Blog62

    用一个功能规格和六项评分表自行评测 AI 编程助手

    作者提出用一个小功能规格来评测 AI 编程助手:在临时目录建两个 Python 文件,让助手给 notes_cli.py 加 --since YYYY-MM-DD 过滤选项,要求非法日期以状态码 2 退出并只向 stderr 输出一行、补充边界日和非法日期测试、只改这两个文件、运行 python3 -m unittest -v 并展示完整输出。

    Ожидает перевода

24.09чт
  1. Hacker News · Prompt Injection78

    Способен ли открытый детектор инъекций промптов отразить атаки на реальных ИИ-агентов: практический тест на 629 атаках AgentDojo

    Автор протестировал 10 открытых детекторов инъекций промптов на 629 атаках AgentDojo (каждая внедрена в вывод реального инструмента) и 97 обычных образцах.

    Почему это важно: Автор протестировал 10 открытых детекторов на 629 реальных инъекционных атаках и привёл полные сравнительные данные — как при стандартных порогах, так и после калибровки.

  2. Vibe Code Textbook · Articles71

    对比 Copilot、Claude Code Review 与 Gemini Code Assist 的代码评审:触发、规则文件、拦截与成本

    作者依据三家厂商 2026 年 9 月 24 日的文档,对比 GitHub Copilot code review、Anthropic 的 Claude Code Review 和 Gemini Code Assist on GitHub 在触发方式、读取的规则文件、能否拦截合并和单次成本上的差异。

    Ожидает перевода

22.09вт
18.09пт
15.09вт
  1. Sebastian Raschka36

    Sebastian Raschka 用 Paint UI 复刻同一张图,对比 GPT-5.6 Astra 与 Qwen3.8 Max 的计算机使用(视觉)能力:Astra 默认用几何图形分层绘制,Qwen 则逐像素还原,后者结果天然更接近原图、得分会更高。但他认为不能据此断定 Qwen 的计算机使用或视觉理解更强,这恰恰说明只看最终结果的 benchmark 有多不可靠。

    Ожидает перевода

05.09сб
  1. Vibe Code Textbook · Articles66

    SWE-bench 分数到底测了什么:resolve rate 的生成过程与五篇论文的补充发现

    SWE-bench 的百分比是智能体编程领域被引用最多的数字,但它比通常被引用的方式要窄得多。文章拆解了一次评测如何产出这个数字:提交是 JSONL 格式的补丁,在 Docker 容器中应用到 base_commit 并运行仓库测试,FAIL_TO_PASS 全部通过且 PASS_TO_PASS 不回归才算 resolved,默认是 pass@1。

    Ожидает перевода

04.09пт
  1. DevAgentStack · Field Notes82

    Бенчмарки GPT-6 Astra против Fable 5.1: какие результаты сравнимы, а какие нет

    OpenAI выпустила GPT-6 Astra и Astra Pro 3 сентября 2026 года. Первая партия доступна только компаниям — участникам программы по кибербезопасности Daybreak; платный ChatGPT, API и AWS откроют в ближайшие дни.

    Почему это важно: Разбираем сравнение GPT-6 Astra и Fable 5.1 по бенчмаркам: у всех разные тестовые версии и harness, поэтому читатель может понять, какие результаты вообще можно сопоставлять.

02.09ср
01.09вт
  1. Vibe Built · Blog60

    Codex vs Claude Code 工作流实测:用同一仓库五项任务做对比

    作者设计了一套可复现的对比方法,让 Codex 和 Claude Code 在同一个仓库、同一任务契约、同一权限和停止条件下完成五项任务:仓库发现、编辑纪律、测试恢复、评审证据、远程或无人值守执行。

    Ожидает перевода

28.08пт
27.08чт
  1. Cline · Blog71

    Cline протестировал восемь моделей на задачах IMO 2026: DeepSeek V4 Flash взял золотую планку всего за 0.12 доллара

    Cline прогнал восемь моделей через собственный harness на шести задачах IMO 2026. Решения оценивали вслепую по 0–7-балльной шкале два эксперта — GPT-5.5 и Claude Opus 5, а спорные случаи разбирал Gemini 3.1 Pro. Порог золотой медали — 29 баллов.

    Почему это важно: Cline провёл слепую оценку восьми моделей на задачах IMO 2026 в одном и том же harness и свёл результаты с ценой за попытку — так видно реальную отдачу от моделей с открытыми весами.