Автор запустил Qwen2.5 7B/32B/72B на одной AMD MI300X через vLLM для ROCm по цене $2.99 за GPU-час; базовый уровень BF16 — $0.227 за миллион выходных токенов для 7B, $0.77 для 32B и $1.67 для 72B.
Почему это важно: Автор протестировал FP8-квантизацию на MI300X и обнаружил, что оплата по токенам маскирует деградацию вывода в бессмыслицу, и предложил воспроизводимый способ проверки.
Автор выложил в открытый доступ claudemanager — локальный демон, который позволяет Claude Code через ANTHROPIC_BASE_URL направить запросы к нему: достаточно изменить только заголовок Authorization, и сессии уйдут на аккаунт Max с наибольшим остатком в окнах 5 часов, недели и отдельной модели, а при приближении к заполнению окна произойдёт переключение по заданным порогам.
Почему это важно: Автор выложил в открытый доступ локального агента, который автоматически распределяет запросы между несколькими аккаунтами Claude Code Max в зависимости от остатка квоты и попутно ведёт журнал запросов.
Flash-Agents — это плагин для Claude Code, который передаёт ограниченные по объёму задачи кодирования — реализацию отдельных фрагментов, перенос тестов, ревью diff, разбор кодовой базы — воркеру DeepSeek V4.1 Flash, а Claude оставляет за собой архитектуру, критерии приёмки и финальное ревью.
Почему это важно: Автор отдаёт задачи кодирования из Claude Code на аутсорс воркеру DeepSeek Flash и приводит песочницу, патчи и данные реальных замеров, по которым можно оценить затраты и границы безопасности.
05.10пн
понедельник
DEV Community · CodexИзбранное редакциейОценка ИИ7878
Автор заметил, что две задачи по автоматизации браузера с помощью Codex потратили 170,123 и 110,180 токенов соответственно, и начал контролировать расход через выбор модели, конфигурационные файлы и разбиение задач.
Почему это важно: На основе собственных замеров — две браузерные задачи сожгли больше ста тысяч токенов — автор показывает, как экономить лимит, переключая модели и настройки под сложность задачи.
Автор поручил GPT (gpt-6.1-sol, уровень рассуждений high) в Codex отвечать за планирование, ключевые решения и приёмку, а через официальный Harness DeepSeek вызывал DeepSeek-V4.1-Flash для написания кода, проведения экспериментов и исправления ошибок — так был создан локальный PDF-инструментарий с пятью работающими функциями.
Почему это важно: Автор запустил PDF-инструментарий, разделив задачи между GPT (планирование) и DeepSeek (выполнение), и привёл три промпта и данные о расходе кэша, что можно перенести на длительные задачи для снижения затрат.
Сооснователь российской e-commerce-платформы Flawwow Артём Гамбицкий рассказал о внутренней продуктовой песочнице компании: она позволяет сотрудникам без инженерного бэкграунда публиковать приложения, написанные ИИ-агентами, сразу в продакшен. За четыре месяца 150 человек отправили 262 проектов и сделали около 5000 деплоев — при этом ни один программист не читал этот код.
Почему это важно: Автор раскрыл детали четырёхуровневой защиты, которая позволяет коллегам без инженерного бэкграунда писать код с помощью ИИ-агентов и безопасно выводить его в прод, а также поделился граблями с ресурсами; этот подход можно перенести на собственную внутреннюю песочницу.
OpenAI выпустила GPT-6.1 Sol для программирования, работы с документами и автоматизации задач. По словам компании, в部分 тестах модель почти догнала GPT-6 Astra. В тесте DeepSWE 1.1 на задачах с реальными кодовыми базами она сравнялась с Astra, а стоимость выполнения оказалась примерно в пять раз ниже. В тесте OSWorld 2.0 на управлении приложениями при максимальном уровне рассуждений модель обошла GPT-6 Sol на 7 процентных пунктов.
Почему это важно: GPT-6.1 Sol сравнялась с Astra на DeepSWE 1.1, а стоимость — примерно в пять раз ниже; по этим данным можно судить, как изменилось соотношение цены и качества для задач программирования.
29 сентября на DevDay в Сан-Франциско OpenAI представила GPT-6.1 Sol; API называется gpt-6.1-sol, цена — 2 доллара за миллион входных токенов и 10 долларов за миллион выходных, кэшированный ввод — 0.10 доллара. Это пятая часть стандартной цены GPT-6 Astra.
Почему это важно: На DevDay OpenAI выпустила GPT-6.1 Sol, снизив цену до пятой части от Astra, а заодно обновила Codex, Agents API и систему плагинов — по этим изменениям можно оценить затраты и эволюцию инструментария.
22 сентября Anthropic выпустила флагманскую модель Claude Opus 5.5 — для разработчиков и команд, которые поручают ИИ-агентам многошаговые задачи вроде программирования и анализа данных. По заявлению компании, по сравнению с Opus 5 модель работает быстрее и стоит дешевле.
Почему это важно: Опубликованные Anthropic цены и снижение стоимости при типовой нагрузке помогут разработчикам оценить затраты на переход к длительным задачам ИИ-агентов.
21.09пн
понедельник
The Agentic Engineer · BlogИзбранное редакциейОценка ИИ8080
Почему это важно: На примере примерно двадцати строк shell автор показывает, как отвязать harness Claude Code от конкретной модели, и подробно разбирает маршрутизацию по четырём слотам моделей и подводные камни.
07.09пн
понедельник
AI Coder · TelegramИзбранное редакциейОценка ИИ8484
Армин Ронахер провёл выходные за экспериментом с «фабрикой софта» на GPT‑6 Astra: модель сама управляла контекстом и подагентами, а целью была реализация Python с виртуальными потоками и лексической областью видимости.
Почему это важно: Автор показывает, что дал эксперимент с «фабрикой софта» без присмотра на 35 часов: на конкретных примерах видно, как GPT‑6 Astra жертвует читаемостью кода ради экономии токенов.
05.09сб
суббота
GitHub Blog · CopilotИзбранное редакциейОценка ИИ7171
GitHub выпустил Project HydraFusion в Copilot CLI в статусе исследовательского превью: оркестрация на уровне рантайма выбирает, какая модель из нескольких провайдеров будет выполнять задачу. Пользователь выбирает HydraFusion так же, как обычную модель, а оплата идёт по стандартным тарифам каждой модели.
Почему это важно: GitHub приводит сравнение трёх режимов оркестрации HydraFusion и трёх базовых вариантов по стоимости и качеству — по нему можно судить, что даёт многомодельная оркестрация на реальных задачах программирования.
03.09чт
четверг
GitHub Blog · CopilotИзбранное редакциейОценка ИИ7272
На своём опыте — когда автор разом запустил 13 подагентов для раскадровки — он объясняет, как работает функция subagents, которая есть и в Claude Code, и в Codex: подагенты трудятся в отдельных окнах и возвращают в основной диалог только результат
Почему это важно: На примере того же запуска 13 подагентов для раскадровки автор показывает, как подагенты оставляют процесс за пределами основного диалога и присылают обратно только выводы
Anthropic выпустила руководство по устройству ИИ-агентов для электронной коммерции. Опираясь на опыт развёртывания у ритейлеров, на платформах электронной коммерции, а также в командах туризма, развлечений и телекоммуникаций, компания предлагает архитектуру с одним агентом: Claude работает в стандартном цикле агента, навыки закрывают потребности длинного хвоста, а инструменты вызывают существующие системы. По результатам сравнительных тестов эта архитектура превзошла по качеству дизайн с подагентами и подход, при котором всё складывают в один промпт.
Почему это важно: Опираясь на опыт корпоративного развёртывания ИИ-агентов для электронной коммерции, Anthropic описывает полный набор инженерных практик: архитектуру с одним агентом и навыками, оптимизацию задержек и затрат, а также оценку памяти и безопасности.
Машины, артефакты сборки и секреты остаются на вашей инфраструктуре, а вызовы инструментов агент обрабатывает локально. My Machines подключает отдельный ноутбук к личному рабочему процессу, а Team Pool — это именованные воркеры для команды или компании: ёмкость растёт по запросу и уменьшается при отключении воркера, а пул не привязан к репозиторию и возобновляет работу после спящего режима в течение окна переподключения.
Почему это важно: В статье описаны пуловое планирование и подключение песочниц для self-hosted машин — по этому описанию можно понять, останется ли выполнение инструментов внутри вашей сети.
Paper Compute · Engineering BlogИзбранное редакциейОценка ИИ7676
Автор предлагает измерять downstream-эффект одного инженерного решения, то есть его зону воздействия, по записям сессий ИИ-агента и проверяет подход на одном архитектурном решении из собственного проекта tapes: сессия с проектированием обошлась в 57.05 доллара, а последующая работа — в 4704.74 доллара, распределённых между 70 сессиями, 3 инженерами, 8 репозиториями и 27 днями; ещё 404 сессий автоматизированной оценки стоили 431.54 доллара.
Почему это важно: На примере 474 записей сессий, связанных с одним архитектурным решением, автор показывает, как превратить downstream-затраты этого решения в переиспользуемые метрики.
Cline прогнал восемь моделей через собственный harness на шести задачах IMO 2026. Решения оценивали вслепую по 0–7-балльной шкале два эксперта — GPT-5.5 и Claude Opus 5, а спорные случаи разбирал Gemini 3.1 Pro. Порог золотой медали — 29 баллов.
Почему это важно: Cline провёл слепую оценку восьми моделей на задачах IMO 2026 в одном и том же harness и свёл результаты с ценой за попытку — так видно реальную отдачу от моделей с открытыми весами.