Cline открывает методику оценки своих открытых моделей и выкладывает для скачивания и анализа трассировки и результаты «восхождения», стоившие больше тысячи долларов. В статье приводится Hill Climber's Checklist — пять эвристик: задать метрику-«Полярную звезду», измерить шум, разложить режимы отказа по задачам, моделям и поставщикам, не считать по умолчанию, что чем больше рассуждений, тем лучше, и сохранять закрытый оценочный набор.
Почему это важно: Cline публикует методику оценки и трассировки на тысячи долларов и даёт пять переносимых эвристик «восхождения», полезных командам, которые собирают собственный harness.
Почему это важно: Новая открытая модель NVIDIA бесплатно доступна в Cline; читатели могут оценить, стоит ли переходить на неё при частых вызовах ИИ-агентов.
Paper Compute · Engineering BlogИзбранное редакциейОценка ИИ8080
Cloudflare построил на базе открытого ИИ-агента для разработки OpenCode систему ИИ-ревью кода, встроенную в CI: координирующий агент управляет до 7 специализированных агентов-ревьюеров, отвечающих за безопасность, производительность, качество кода, документацию, релиз и внутренние стандарты, а после дедупликации публикуется только один структурированный комментарий с ревью.
Почему это важно: Cloudflare раскрыл архитектуру плагинов для многоагентного ревью кода в CI, градацию рисков и данные о затратах — всё это можно перенести в собственный пайплайн ревью.
Augment Code добавила в начало AGENTS.md около 2.5 тыс. символов правил кодирования в стиле Карпати и сравнила, как Auggie, Claude Code и Codex справляются с 40 пул-реквестами OpenClaw.
Почему это важно: Сравнительный тест трёх ИИ-агентов для разработки на одной и той же партии пул-реквестов показывает: ограничения в промпте в основном экономят деньги, а не повышают качество, и при этом каждый харнесс работает по-своему.
Баоюй разбирает механизм кэширования промптов в Claude Code, объясняет, почему лимит так быстро расходуется, и даёт правила экономии токенов. Он отмечает, что кэш работает только для префикса: у основного агента окно кэша — 1 час, у дочерних агентов — 5 минут, а чтение из кэша стоит примерно в десять раз дешевле пересчёта. Поэтому частые /clear, наоборот, запускают полную перестройку контекста по полной цене. Критерий такой: если кэш ещё горячий и задача не сменилась — продолжайте диалог; новый сеанс открывайте только когда кэш истёк, задача сменилась или в контексте слишком много шума.
Почему это важно: Разберём, как расходуется квота Claude Code, отталкиваясь от механизма кэширования промптов: покажем, когда стоит продолжить сессию, а когда начать заново, и дадим готовые конфиги, которые можно скопировать.