Автор запустил Qwen2.5 7B/32B/72B на одной AMD MI300X через vLLM для ROCm по цене $2.99 за GPU-час; базовый уровень BF16 — $0.227 за миллион выходных токенов для 7B, $0.77 для 32B и $1.67 для 72B.
Почему это важно: Автор протестировал FP8-квантизацию на MI300X и обнаружил, что оплата по токенам маскирует деградацию вывода в бессмыслицу, и предложил воспроизводимый способ проверки.
GitHub Blog · CopilotИзбранное редакциейОценка ИИ6666
Автор протестировал 10 открытых детекторов инъекций промптов на 629 атаках AgentDojo (каждая внедрена в вывод реального инструмента) и 97 обычных образцах.
Почему это важно: Автор протестировал 10 открытых детекторов на 629 реальных инъекционных атаках и привёл полные сравнительные данные — как при стандартных порогах, так и после калибровки.
04.09пт
пятница
DevAgentStack · Field NotesИзбранное редакциейОценка ИИ8282
OpenAI выпустила GPT-6 Astra и Astra Pro 3 сентября 2026 года. Первая партия доступна только компаниям — участникам программы по кибербезопасности Daybreak; платный ChatGPT, API и AWS откроют в ближайшие дни.
Почему это важно: Разбираем сравнение GPT-6 Astra и Fable 5.1 по бенчмаркам: у всех разные тестовые версии и harness, поэтому читатель может понять, какие результаты вообще можно сопоставлять.
Cline прогнал восемь моделей через собственный harness на шести задачах IMO 2026. Решения оценивали вслепую по 0–7-балльной шкале два эксперта — GPT-5.5 и Claude Opus 5, а спорные случаи разбирал Gemini 3.1 Pro. Порог золотой медали — 29 баллов.
Почему это важно: Cline провёл слепую оценку восьми моделей на задачах IMO 2026 в одном и том же harness и свёл результаты с ценой за попытку — так видно реальную отдачу от моделей с открытыми весами.
Cline открывает методику оценки своих открытых моделей и выкладывает для скачивания и анализа трассировки и результаты «восхождения», стоившие больше тысячи долларов. В статье приводится Hill Climber's Checklist — пять эвристик: задать метрику-«Полярную звезду», измерить шум, разложить режимы отказа по задачам, моделям и поставщикам, не считать по умолчанию, что чем больше рассуждений, тем лучше, и сохранять закрытый оценочный набор.
Почему это важно: Cline публикует методику оценки и трассировки на тысячи долларов и даёт пять переносимых эвристик «восхождения», полезных командам, которые собирают собственный harness.
10.08пн
понедельник
Martin Fowler · Exploring Generative AIИзбранное редакциейОценка ИИ7474
Команда Terminal-Bench выпустила Terminal-Bench 3.0 — первая версия включает 74 задач в 7 областях, у сильнейших моделей проходимость около 34%. По сравнению с Terminal-Bench 2.1 здесь больше разнообразия задач, а для постоянного улучшения бенчмарка добавили CI/CD, семантическое версионирование и перенос результатов.
Почему это важно: Terminal-Bench 3.0 пересобирает бенчмарк на 74 задачах и версионировании через CI/CD — читатель увидит, как новый бенчмарк разводит модели по результатам.
Команда Terminal-Bench выпустила набор новых возможностей Harbor: датасеты теперь можно публиковать по версиям, а таблицу лидеров — переносить на новую версию, для чего нужно либо переиспользовать, либо переоценить, либо перезапустить trial. Задачи версионируются семантически: при изменениях уровня патча старые результаты просто переиспользуются, при изменениях валидатора достаточно переоценить уже сохранённые артефакты, и только существенные изменения, заметно меняющие среду ИИ-агента, требуют перезапуска. Версия датасета соответствует максимальной версии среди задач, а таблица лидеров через diff перезапускает только задачи с существенными изменениями.
Почему это важно: Команда Terminal-Bench относится к бенчмарку как к программному обеспечению и описывает конкретный механизм семантического версионирования задач и обновления таблицы лидеров, который можно перенести в собственный процесс оценки.
Augment Code добавила в начало AGENTS.md около 2.5 тыс. символов правил кодирования в стиле Карпати и сравнила, как Auggie, Claude Code и Codex справляются с 40 пул-реквестами OpenClaw.
Почему это важно: Сравнительный тест трёх ИИ-агентов для разработки на одной и той же партии пул-реквестов показывает: ограничения в промпте в основном экономят деньги, а не повышают качество, и при этом каждый харнесс работает по-своему.
Augment Code вытащила из своего монорепозитория несколько десятков AGENTS.md и на внутреннем наборе тестов AuggieBench сравнила, как один и тот же агент справляется с задачей при наличии этих файлов и без них. Лучшие файлы дают такой же прирост качества, как переход с Haiku на Opus, а худшие — ухудшают результат по сравнению с полным отсутствием AGENTS.md.
Почему это важно: Augment Code с помощью внутренних метрик измерила, насколько различается эффект от разных вариантов написания AGENTS.md; читатели могут использовать это, чтобы перестроить документацию в своём репозитории.
Terminal-Bench выпустил версию 2.0 и пакет Harbor: первый — это более строго проверенный и сложный бенчмарк для оценки агентов, второй — для их оценки и оптимизации. Harbor переписал тестовый фреймворк Terminal-Bench: теперь можно разворачивать контейнеры в облаке, есть интерфейсы rollout для RL и SFT, а также совместимость с любыми агентами, которые упаковываются в контейнер.