Автор запустил Qwen2.5 7B/32B/72B на одной AMD MI300X через vLLM для ROCm по цене $2.99 за GPU-час; базовый уровень BF16 — $0.227 за миллион выходных токенов для 7B, $0.77 для 32B и $1.67 для 72B.
Почему это важно: Автор протестировал FP8-квантизацию на MI300X и обнаружил, что оплата по токенам маскирует деградацию вывода в бессмыслицу, и предложил воспроизводимый способ проверки.
04.10вс
воскресенье
DEV Community · CursorИзбранное редакциейОценка ИИ7676
Разработчик Fynn 20 марта 2026 года отлаживал OpenAI-совместимый интерфейс Cursor и увидел в ответе ID модели accounts/anysphere/models/kimi-k2p5-rl-0317-s515-fast. Это значит, что Composer 2 дообучали методом RL на базе Kimi K2.5 от Moonshot AI. За сутки твит набрал 44.4 тысячи просмотров.
Почему это важно: Одна отладочная строка API вытянула наружу и нераскрытую базу Kimi у Cursor, и спор о лицензировании, и расклад затрат на модели между Китаем и США — всё это показывает, как в отрасли принято раскрывать информацию.
Cline выпустил раннюю версию открытого настольного приложения Cline Desktop: фреймворк для запуска ИИ-агентов, который раньше жил в расширении для VS Code и в CLI, переехал в отдельное рабочее пространство. Поддерживаются параллельные сессии, задачи по расписанию и Marketplace для расширения инструментов и интеграций.
Почему это важно: В официальной документации описаны границы возможностей настольной версии и открытые точки входа — по ним можно оценить, подходит ли она для параллельных задач с участием нескольких ИИ-агентов.
Cline перенесла расширение VS Code с монолитного ядра примерно на 76,000 строк на Cline SDK и построила собственный механизм постепенного выката: в одном установочном пакете лежат loader и две версии расширения — legacy и next, — а функциональный флаг PostHog по проценту решает, какую активировать; при падении происходит автоматический откат к legacy, а флаг в любой момент можно опустить до 0% как kill switch.
Почему это важно: Официальный разбор того, как Cline перевела расширение VS Code для 1100 тысяч пользователей на новый harness, с механизмом постепенного выката и сравнением метрик до и после.
Cline прогнал восемь моделей через собственный harness на шести задачах IMO 2026. Решения оценивали вслепую по 0–7-балльной шкале два эксперта — GPT-5.5 и Claude Opus 5, а спорные случаи разбирал Gemini 3.1 Pro. Порог золотой медали — 29 баллов.
Почему это важно: Cline провёл слепую оценку восьми моделей на задачах IMO 2026 в одном и том же harness и свёл результаты с ценой за попытку — так видно реальную отдачу от моделей с открытыми весами.
Cline открывает методику оценки своих открытых моделей и выкладывает для скачивания и анализа трассировки и результаты «восхождения», стоившие больше тысячи долларов. В статье приводится Hill Climber's Checklist — пять эвристик: задать метрику-«Полярную звезду», измерить шум, разложить режимы отказа по задачам, моделям и поставщикам, не считать по умолчанию, что чем больше рассуждений, тем лучше, и сохранять закрытый оценочный набор.
Почему это важно: Cline публикует методику оценки и трассировки на тысячи долларов и даёт пять переносимых эвристик «восхождения», полезных командам, которые собирают собственный harness.
Почему это важно: Новая открытая модель NVIDIA бесплатно доступна в Cline; читатели могут оценить, стоит ли переходить на неё при частых вызовах ИИ-агентов.
08.07ср
среда
Martin Fowler · Exploring Generative AIИзбранное редакциейОценка ИИ7171
Автор прогнал PDF через OCR с помощью открытых мультимодальных моделей серии Qwen 3.5: сначала экспортировал каждую страницу в изображение с разрешением 100 dpi через PyMuPDF, а затем отдал его модели на распознавание. По результатам тестов Qwen3.5-9B — это баланс между качеством и скоростью, а модели поменьше, от 0.8B до 2B, на сложных документах часто сбиваются и начинают пересказывать содержимое.
Почему это важно: Автор протестировал модели Qwen 3.5 разных размеров на OCR для PDF и описал два воспроизводимых пути — локальный и через OpenRouter — вместе с данными о затратах.