Перейти к содержимому

Открытые и локальные модели

Программирование с моделями с открытыми весами и локальными моделями: подключение, сравнение результатов и опыт развёртывания.

10 избранных материаловСвязанные темыDeepSeekQwen / Qwen CodeСтоимость и лимиты

Новые избранные материалы

Материалы 1–10 · Всего 10
Сегодня06.10вт
  1. DEV Community · MCP78

    Ловушка FP8: счёт за GPU упал на 47%, а модель выдаёт «!!!!!!»

    Автор запустил Qwen2.5 7B/32B/72B на одной AMD MI300X через vLLM для ROCm по цене $2.99 за GPU-час; базовый уровень BF16 — $0.227 за миллион выходных токенов для 7B, $0.77 для 32B и $1.67 для 72B.

    Почему это важно: Автор протестировал FP8-квантизацию на MI300X и обнаружил, что оплата по токенам маскирует деградацию вывода в бессмыслицу, и предложил воспроизводимый способ проверки.

04.10вс
  1. DEV Community · Cursor76

    Cursor выпустил Composer 2, не раскрыв, что в основе лежит Kimi K2.5: правда всплыла в ответе API

    Разработчик Fynn 20 марта 2026 года отлаживал OpenAI-совместимый интерфейс Cursor и увидел в ответе ID модели accounts/anysphere/models/kimi-k2p5-rl-0317-s515-fast. Это значит, что Composer 2 дообучали методом RL на базе Kimi K2.5 от Moonshot AI. За сутки твит набрал 44.4 тысячи просмотров.

    Почему это важно: Одна отладочная строка API вытянула наружу и нераскрытую базу Kimi у Cursor, и спор о лицензировании, и расклад затрат на модели между Китаем и США — всё это показывает, как в отрасли принято раскрывать информацию.

15.09вт
  1. Cline · Blog62

    Cline выпускает открытое настольное приложение Cline Desktop для моделей с открытыми весами

    Cline выпустил раннюю версию открытого настольного приложения Cline Desktop: фреймворк для запуска ИИ-агентов, который раньше жил в расширении для VS Code и в CLI, переехал в отдельное рабочее пространство. Поддерживаются параллельные сессии, задачи по расписанию и Marketplace для расширения инструментов и интеграций.

    Почему это важно: В официальной документации описаны границы возможностей настольной версии и открытые точки входа — по ним можно оценить, подходит ли она для параллельных задач с участием нескольких ИИ-агентов.

03.09чт
  1. Cline · Blog74

    Как Cline перевела 1100 тысяч пользователей на крупнейшее обновление harness

    Cline перенесла расширение VS Code с монолитного ядра примерно на 76,000 строк на Cline SDK и построила собственный механизм постепенного выката: в одном установочном пакете лежат loader и две версии расширения — legacy и next, — а функциональный флаг PostHog по проценту решает, какую активировать; при падении происходит автоматический откат к legacy, а флаг в любой момент можно опустить до 0% как kill switch.

    Почему это важно: Официальный разбор того, как Cline перевела расширение VS Code для 1100 тысяч пользователей на новый harness, с механизмом постепенного выката и сравнением метрик до и после.

27.08чт
  1. Cline · Blog71

    Cline протестировал восемь моделей на задачах IMO 2026: DeepSeek V4 Flash взял золотую планку всего за 0.12 доллара

    Cline прогнал восемь моделей через собственный harness на шести задачах IMO 2026. Решения оценивали вслепую по 0–7-балльной шкале два эксперта — GPT-5.5 и Claude Opus 5, а спорные случаи разбирал Gemini 3.1 Pro. Порог золотой медали — 29 баллов.

    Почему это важно: Cline провёл слепую оценку восьми моделей на задачах IMO 2026 в одном и том же harness и свёл результаты с ценой за попытку — так видно реальную отдачу от моделей с открытыми весами.

19.08ср
  1. Cline · Blog71

    Методика оценки и трассировка открытых моделей Cline

    Cline открывает методику оценки своих открытых моделей и выкладывает для скачивания и анализа трассировки и результаты «восхождения», стоившие больше тысячи долларов. В статье приводится Hill Climber's Checklist — пять эвристик: задать метрику-«Полярную звезду», измерить шум, разложить режимы отказа по задачам, моделям и поставщикам, не считать по умолчанию, что чем больше рассуждений, тем лучше, и сохранять закрытый оценочный набор.

    Почему это важно: Cline публикует методику оценки и трассировки на тысячи долларов и даёт пять переносимых эвристик «восхождения», полезных командам, которые собирают собственный harness.

11.08вт
  1. Cline · Blog60

    NVIDIA Nemotron 3.5 Lightning появился в Cline и доступен бесплатно

    NVIDIA выпустила Nemotron 3.5 Lightning — настраиваемую открытую модель для постоянно работающих ИИ-агентов, которая уже бесплатно доступна в Cline.

    Почему это важно: Новая открытая модель NVIDIA бесплатно доступна в Cline; читатели могут оценить, стоит ли переходить на неё при частых вызовах ИИ-агентов.

08.07ср
  1. Martin Fowler · Exploring Generative AI71

    在本地小模型上做智能体编码的实测体验

    Martin Fowler 在 M3 Max 48GB 和 M5 Pro 64GB 上实测 Qwen3.6 35B MoE、Gemma 4 31B/26B、Qwen Coder Next 80B 等本地小模型的智能体编码能力,按内存、速度、工具调用、代码正确性、上下文、任务复杂度、代码质量逐层筛选。

    Ожидает перевода

    Почему это важно: 作者用两个具体任务对比多款本地小模型的智能体编码表现,并给出可复用的任务选择标准。

07.05чт
  1. Permission Protocol · AI Agent Incident Tracker80

    仿冒 OpenAI 仓库在 Hugging Face 登顶热门榜并获 24.4 万次下载后投递窃密木马

    Hugging Face 上一个仿冒 OpenAI Privacy Filter 的仓库登上热门榜第一、获得 244,000 次下载,随后在安装该模型的 Windows 机器上执行窃取凭据的 infostealer。

    Ожидает перевода

    Почему это важно: 复盘 Hugging Face 上仿冒 OpenAI 仓库的投毒链条,展示热门榜如何被当作信任信号利用。

13.03пт
  1. Martin Alderson78

    Как распознавать документы через OCR с помощью моделей серии Qwen 3.5

    Автор прогнал PDF через OCR с помощью открытых мультимодальных моделей серии Qwen 3.5: сначала экспортировал каждую страницу в изображение с разрешением 100 dpi через PyMuPDF, а затем отдал его модели на распознавание. По результатам тестов Qwen3.5-9B — это баланс между качеством и скоростью, а модели поменьше, от 0.8B до 2B, на сложных документах часто сбиваются и начинают пересказывать содержимое.

    Почему это важно: Автор протестировал модели Qwen 3.5 разных размеров на OCR для PDF и описал два воспроизводимых пути — локальный и через OpenRouter — вместе с данными о затратах.