Перейти к содержимому

Тесты и сравнения

Результаты оценки моделей и инструментов для программирования и практические сравнения на одинаковых задачах.

Новые избранные материалы

Материалы 1–16 · Всего 16
06.10вт
  1. DEV Community · MCP78

    Ловушка FP8: счёт за GPU упал на 47%, а модель выдаёт «!!!!!!»

    Автор запустил Qwen2.5 7B/32B/72B на одной AMD MI300X через vLLM для ROCm по цене $2.99 за GPU-час; базовый уровень BF16 — $0.227 за миллион выходных токенов для 7B, $0.77 для 32B и $1.67 для 72B.

    Почему это важно: Автор протестировал FP8-квантизацию на MI300X и обнаружил, что оплата по токенам маскирует деградацию вывода в бессмыслицу, и предложил воспроизводимый способ проверки.

  2. GitHub Blog · Copilot66

    GitHub 发布 AI 代码评审开放基准 ReviewBench

    GitHub 发布代码评审离线基准 ReviewBench,基于 1.039 亿个 GitHub PR 的分布特征,构建了覆盖 19 种语言、219 个公开 PR 的评测集,并公开数据集、评分规则与 LLM 评审模型配置。

    Ожидает перевода

    Почему это важно: GitHub 公开了 AI 代码评审基准的数据集、评分规则与评测入口,读者可据此对比不同评审智能体。

24.09чт
  1. Hacker News · Prompt Injection78

    Способен ли открытый детектор инъекций промптов отразить атаки на реальных ИИ-агентов: практический тест на 629 атаках AgentDojo

    Автор протестировал 10 открытых детекторов инъекций промптов на 629 атаках AgentDojo (каждая внедрена в вывод реального инструмента) и 97 обычных образцах.

    Почему это важно: Автор протестировал 10 открытых детекторов на 629 реальных инъекционных атаках и привёл полные сравнительные данные — как при стандартных порогах, так и после калибровки.

04.09пт
  1. DevAgentStack · Field Notes82

    Бенчмарки GPT-6 Astra против Fable 5.1: какие результаты сравнимы, а какие нет

    OpenAI выпустила GPT-6 Astra и Astra Pro 3 сентября 2026 года. Первая партия доступна только компаниям — участникам программы по кибербезопасности Daybreak; платный ChatGPT, API и AWS откроют в ближайшие дни.

    Почему это важно: Разбираем сравнение GPT-6 Astra и Fable 5.1 по бенчмаркам: у всех разные тестовые версии и harness, поэтому читатель может понять, какие результаты вообще можно сопоставлять.

27.08чт
  1. Cline · Blog71

    Cline протестировал восемь моделей на задачах IMO 2026: DeepSeek V4 Flash взял золотую планку всего за 0.12 доллара

    Cline прогнал восемь моделей через собственный harness на шести задачах IMO 2026. Решения оценивали вслепую по 0–7-балльной шкале два эксперта — GPT-5.5 и Claude Opus 5, а спорные случаи разбирал Gemini 3.1 Pro. Порог золотой медали — 29 баллов.

    Почему это важно: Cline провёл слепую оценку восьми моделей на задачах IMO 2026 в одном и том же harness и свёл результаты с ценой за попытку — так видно реальную отдачу от моделей с открытыми весами.

19.08ср
  1. Cline · Blog71

    Методика оценки и трассировка открытых моделей Cline

    Cline открывает методику оценки своих открытых моделей и выкладывает для скачивания и анализа трассировки и результаты «восхождения», стоившие больше тысячи долларов. В статье приводится Hill Climber's Checklist — пять эвристик: задать метрику-«Полярную звезду», измерить шум, разложить режимы отказа по задачам, моделям и поставщикам, не считать по умолчанию, что чем больше рассуждений, тем лучше, и сохранять закрытый оценочный набор.

    Почему это важно: Cline публикует методику оценки и трассировки на тысячи долларов и даёт пять переносимых эвристик «восхождения», полезных командам, которые собирают собственный harness.

10.08пн
  1. Martin Fowler · Exploring Generative AI74

    智能体循环里的 TDD 是形式还是真价值?Martin Fowler 的对比实验

    Martin Fowler 用 Sonnet 4.6 生成、Opus 4.8 盲评的方式,对小型、中型和较大型三类业务逻辑任务分别跑 TDD 与非 TDD 方案,结论是两者质量没有明显差异,非 TDD 方案在设计和测试质量上还多次略高,变异分数也没有实质差别。

    Ожидает перевода

    Почему это важно: 作者用同一批任务对比 TDD 与非 TDD 智能体实现,给出 token 成本与设计质量差异,并反思哪些 TDD 收益在智能体循环里失效。

30.07чт
  1. Terminal-Bench · News60

    Вышел Terminal-Bench 3.0: 74 задачи, 7 областей, у сильнейших моделей проходимость около 34%

    Команда Terminal-Bench выпустила Terminal-Bench 3.0 — первая версия включает 74 задач в 7 областях, у сильнейших моделей проходимость около 34%. По сравнению с Terminal-Bench 2.1 здесь больше разнообразия задач, а для постоянного улучшения бенчмарка добавили CI/CD, семантическое версионирование и перенос результатов.

    Почему это важно: Terminal-Bench 3.0 пересобирает бенчмарк на 74 задачах и версионировании через CI/CD — читатель увидит, как новый бенчмарк разводит модели по результатам.

  2. Terminal-Bench · News62

    Terminal-Bench выпустил новые возможности Harbor: теперь бенчмарк можно обновлять как версионируемый актив

    Команда Terminal-Bench выпустила набор новых возможностей Harbor: датасеты теперь можно публиковать по версиям, а таблицу лидеров — переносить на новую версию, для чего нужно либо переиспользовать, либо переоценить, либо перезапустить trial. Задачи версионируются семантически: при изменениях уровня патча старые результаты просто переиспользуются, при изменениях валидатора достаточно переоценить уже сохранённые артефакты, и только существенные изменения, заметно меняющие среду ИИ-агента, требуют перезапуска. Версия датасета соответствует максимальной версии среди задач, а таблица лидеров через diff перезапускает только задачи с существенными изменениями.

    Почему это важно: Команда Terminal-Bench относится к бенчмарку как к программному обеспечению и описывает конкретный механизм семантического версионирования задач и обновления таблицы лидеров, который можно перенести в собственный процесс оценки.

25.07сб
  1. Cline · Blog79

    Cline 用递归自我改进让智能体自主把 Kimi K3 在 Terminal-Bench 2.1 提到 88.8%

    Cline 用一条提示词启动 17 小时连续运行的编码智能体,以 GPT-5.6-Sol 为 leader 模型,把 Kimi K3 在 Terminal-Bench 2.1 上的成绩从基线 69/89(77.5%,$79)提升到确认运行 79/89(88.8%,$49.8),超过 Moonshot 自报的 88.3%。

    Ожидает перевода

    Почему это важно: Cline 用一条提示词让智能体自主完成 17 小时爬山,把 Terminal-Bench 2.1 从 77.5% 提到 88.8%,可看具体修了哪些 harness 问题。

18.06чт
  1. Terminal-Bench · News60

    Terminal-Bench 发布 Challenges 长周期智能体基准

    Terminal-Bench 发布 Challenges,一种长周期、高 token 消耗的单任务基准,要求智能体在无时间与资源限制下自主完成整个项目,首批开放三个挑战。

    Ожидает перевода

    Почему это важно: Terminal-Bench 官方推出长周期单任务基准,并公开三个挑战的实测失败模式,可供评估智能体长时自主能力时参考。

30.04чт
  1. Augment Code · Blog71

    Augment Code проверила на практике правила в стиле Карпати: ИИ-агент для разработки не написал код лучше, но сделал это быстрее и дешевле

    Augment Code добавила в начало AGENTS.md около 2.5 тыс. символов правил кодирования в стиле Карпати и сравнила, как Auggie, Claude Code и Codex справляются с 40 пул-реквестами OpenClaw.

    Почему это важно: Сравнительный тест трёх ИИ-агентов для разработки на одной и той же партии пул-реквестов показывает: ограничения в промпте в основном экономят деньги, а не повышают качество, и при этом каждый харнесс работает по-своему.

22.04ср
  1. Augment Code · Blog88

    Augment Code протестировала AGENTS.md на практике: хороший файл сравним с апгрейдом модели, а плохой лучше не писать

    Augment Code вытащила из своего монорепозитория несколько десятков AGENTS.md и на внутреннем наборе тестов AuggieBench сравнила, как один и тот же агент справляется с задачей при наличии этих файлов и без них. Лучшие файлы дают такой же прирост качества, как переход с Haiku на Opus, а худшие — ухудшают результат по сравнению с полным отсутствием AGENTS.md.

    Почему это важно: Augment Code с помощью внутренних метрик измерила, насколько различается эффект от разных вариантов написания AGENTS.md; читатели могут использовать это, чтобы перестроить документацию в своём репозитории.

07.11пт
  1. Terminal-Bench · News62

    Terminal-Bench выпустил версию 2.0 и пакет оптимизаций для оценки в Harbor

    Terminal-Bench выпустил версию 2.0 и пакет Harbor: первый — это более строго проверенный и сложный бенчмарк для оценки агентов, второй — для их оценки и оптимизации. Harbor переписал тестовый фреймворк Terminal-Bench: теперь можно разворачивать контейнеры в облаке, есть интерфейсы rollout для RL и SFT, а также совместимость с любыми агентами, которые упаковываются в контейнер.

    Почему это важно: Вместе с Terminal-Bench 2.0 вышел Harbor — читатели узнают, как проверяются бенчмарки для агентов и как масштабировать их в облаке.

15.10ср
  1. Martin Fowler · Exploring Generative AI74

    拆解 Spec-Driven Development:Kiro、spec-kit 与 Tessl 三种工具实测

    Martin Fowler 试用 Kiro、spec-kit 和 Tessl 三款自称实现 spec-driven development(SDD)的工具,把 SDD 归纳为 spec-first、spec-anchored、spec-as-source 三个层次,并指出目前所有方案都停留在 spec-first。

    Ожидает перевода

    Почему это важно: 作者亲手试用 Kiro、spec-kit 和 Tessl 三款 SDD 工具,给出 spec-first、spec-anchored、spec-as-source 三层划分,并指出小任务被过度规格化的问题。

19.05пн
  1. Terminal-Bench · News62

    Terminal-Bench 发布首个终端智能体评测基准

    Terminal-Bench 发布首个版本,用于量化 AI 智能体在终端中执行复杂任务的能力,首发数据集 Terminal-Bench-Core-v0 包含 80 个手工编写并人工验证的任务,每个任务配有独立 Docker 环境、人工验证的解法与测试用例。

    Ожидает перевода

    Почему это важно: Terminal-Bench 给出 80 个带 Docker 环境和测试用例的终端任务,可用来横向比较不同智能体在命令行中的实际表现。