Перейти к содержимому

Стоимость и лимиты

На что уходят токены, как дольше работать в пределах лимитов и как разобраться с ростом расходов.

Новые избранные материалы

Материалы 1–20 · Всего 33
Сегодня06.10вт
  1. DEV Community · MCP78

    Ловушка FP8: счёт за GPU упал на 47%, а модель выдаёт «!!!!!!»

    Автор запустил Qwen2.5 7B/32B/72B на одной AMD MI300X через vLLM для ROCm по цене $2.99 за GPU-час; базовый уровень BF16 — $0.227 за миллион выходных токенов для 7B, $0.77 для 32B и $1.67 для 72B.

    Почему это важно: Автор протестировал FP8-квантизацию на MI300X и обнаружил, что оплата по токенам маскирует деградацию вывода в бессмыслицу, и предложил воспроизводимый способ проверки.

  2. Reddit · ClaudeCode / Codex / VibeCoding76

    Локальный агент распределяет запросы Claude Code между несколькими аккаунтами Max и переключается до того, как закончится лимит.

    Автор выложил в открытый доступ claudemanager — локальный демон, который позволяет Claude Code через ANTHROPIC_BASE_URL направить запросы к нему: достаточно изменить только заголовок Authorization, и сессии уйдут на аккаунт Max с наибольшим остатком в окнах 5 часов, недели и отдельной модели, а при приближении к заполнению окна произойдёт переключение по заданным порогам.

    Почему это важно: Автор выложил в открытый доступ локального агента, который автоматически распределяет запросы между несколькими аккаунтами Claude Code Max в зависимости от остатка квоты и попутно ведёт журнал запросов.

  3. Hacker News · MCP78

    Flash-Agents: MCP-плагин, который отдаёт задачи кодирования из Claude Code воркеру DeepSeek Flash

    Flash-Agents — это плагин для Claude Code, который передаёт ограниченные по объёму задачи кодирования — реализацию отдельных фрагментов, перенос тестов, ревью diff, разбор кодовой базы — воркеру DeepSeek V4.1 Flash, а Claude оставляет за собой архитектуру, критерии приёмки и финальное ревью.

    Почему это важно: Автор отдаёт задачи кодирования из Claude Code на аутсорс воркеру DeepSeek Flash и приводит песочницу, патчи и данные реальных замеров, по которым можно оценить затраты и границы безопасности.

05.10пн
  1. DEV Community · Codex78

    Как я не даю быстро выжечь лимит Codex

    Автор заметил, что две задачи по автоматизации браузера с помощью Codex потратили 170,123 и 110,180 токенов соответственно, и начал контролировать расход через выбор модели, конфигурационные файлы и разбиение задач.

    Почему это важно: На основе собственных замеров — две браузерные задачи сожгли больше ста тысяч токенов — автор показывает, как экономить лимит, переключая модели и настройки под сложность задачи.

04.10вс
  1. 佬刘AI78

    Планируем с GPT, выполняем с DeepSeek: экономичная схема совместной работы двух моделей

    Автор поручил GPT (gpt-6.1-sol, уровень рассуждений high) в Codex отвечать за планирование, ключевые решения и приёмку, а через официальный Harness DeepSeek вызывал DeepSeek-V4.1-Flash для написания кода, проведения экспериментов и исправления ошибок — так был создан локальный PDF-инструментарий с пятью работающими функциями.

    Почему это важно: Автор запустил PDF-инструментарий, разделив задачи между GPT (планирование) и DeepSeek (выполнение), и привёл три промпта и данные о расходе кэша, что можно перенести на длительные задачи для снижения затрат.

30.09ср
  1. Habr · Вайбкодинг80

    Как Flawwow с помощью продуктовой песочницы дала 150 сотрудникам без инженерного бэкграунда вывести в прод 262 проекта, сгенерированных ИИ

    Сооснователь российской e-commerce-платформы Flawwow Артём Гамбицкий рассказал о внутренней продуктовой песочнице компании: она позволяет сотрудникам без инженерного бэкграунда публиковать приложения, написанные ИИ-агентами, сразу в продакшен. За четыре месяца 150 человек отправили 262 проектов и сделали около 5000 деплоев — при этом ни один программист не читал этот код.

    Почему это важно: Автор раскрыл детали четырёхуровневой защиты, которая позволяет коллегам без инженерного бэкграунда писать код с помощью ИИ-агентов и безопасно выводить его в прод, а также поделился граблями с ресурсами; этот подход можно перенести на собственную внутреннюю песочницу.

  2. Habr · Codex76

    OpenAI выпустила GPT-6.1 Sol — цена API примерно в пять раз ниже, чем у Astra

    OpenAI выпустила GPT-6.1 Sol для программирования, работы с документами и автоматизации задач. По словам компании, в部分 тестах модель почти догнала GPT-6 Astra. В тесте DeepSWE 1.1 на задачах с реальными кодовыми базами она сравнялась с Astra, а стоимость выполнения оказалась примерно в пять раз ниже. В тесте OSWorld 2.0 на управлении приложениями при максимальном уровне рассуждений модель обошла GPT-6 Sol на 7 процентных пунктов.

    Почему это важно: GPT-6.1 Sol сравнялась с Astra на DeepSWE 1.1, а стоимость — примерно в пять раз ниже; по этим данным можно судить, как изменилось соотношение цены и качества для задач программирования.

29.09вт
  1. Tproger · Программирование88

    OpenAI выпустила GPT-6.1 Sol на DevDay — цена всего пятая часть от Astra

    29 сентября на DevDay в Сан-Франциско OpenAI представила GPT-6.1 Sol; API называется gpt-6.1-sol, цена — 2 доллара за миллион входных токенов и 10 долларов за миллион выходных, кэшированный ввод — 0.10 доллара. Это пятая часть стандартной цены GPT-6 Astra.

    Почему это важно: На DevDay OpenAI выпустила GPT-6.1 Sol, снизив цену до пятой части от Astra, а заодно обновила Codex, Agents API и систему плагинов — по этим изменениям можно оценить затраты и эволюцию инструментария.

23.09ср
  1. Tproger · Программирование80

    Anthropic выпустила флагманскую модель Claude Opus 5.5

    22 сентября Anthropic выпустила флагманскую модель Claude Opus 5.5 — для разработчиков и команд, которые поручают ИИ-агентам многошаговые задачи вроде программирования и анализа данных. По заявлению компании, по сравнению с Opus 5 модель работает быстрее и стоит дешевле.

    Почему это важно: Опубликованные Anthropic цены и снижение стоимости при типовой нагрузке помогут разработчикам оценить затраты на переход к длительным задачам ИИ-агентов.

21.09пн
  1. The Agentic Engineer · Blog80

    Как запустить Claude Code с любой моделью через OpenRouter

    Автор рассказывает, как подключить Claude Code к любой модели через OpenRouter: достаточно положить OPENROUTER_API_KEY в ~/.config/openrouter.env.

    Почему это важно: На примере примерно двадцати строк shell автор показывает, как отвязать harness Claude Code от конкретной модели, и подробно разбирает маршрутизацию по четырём слотам моделей и подводные камни.

07.09пн
  1. AI Coder · Telegram84

    Spotify 用 shunt 插件把 Claude Code 的 token 消耗降低约 90%

    Spotify 开源插件 shunt,通过 Claude Code 的 PreToolUse hooks 拦截超过 350 行的整文件读取,把 Read 以及 cat。

    Ожидает перевода

    Почему это важно: Spotify 用 PreToolUse Hook 把大文件读取和样板代码生成转给廉价模型,给出可迁移的成本拆分思路。

  2. Armin Ronacher78

    Армин Ронахер: почему GPT‑6 Astra вызывает у меня недоверие, когда пишет код

    Армин Ронахер провёл выходные за экспериментом с «фабрикой софта» на GPT‑6 Astra: модель сама управляла контекстом и подагентами, а целью была реализация Python с виртуальными потоками и лексической областью видимости.

    Почему это важно: Автор показывает, что дал эксперимент с «фабрикой софта» без присмотра на 35 часов: на конкретных примерах видно, как GPT‑6 Astra жертвует читаемостью кода ради экономии токенов.

05.09сб
  1. GitHub Blog · Copilot71

    GitHub Copilot представил Project HydraFusion — многомодельную оркестрацию на уровне рантайма для повышения качества кода

    GitHub выпустил Project HydraFusion в Copilot CLI в статусе исследовательского превью: оркестрация на уровне рантайма выбирает, какая модель из нескольких провайдеров будет выполнять задачу. Пользователь выбирает HydraFusion так же, как обычную модель, а оплата идёт по стандартным тарифам каждой модели.

    Почему это важно: GitHub приводит сравнение трёх режимов оркестрации HydraFusion и трёх базовых вариантов по стоимости и качеству — по нему можно судить, что даёт многомодельная оркестрация на реальных задачах программирования.

03.09чт
  1. GitHub Blog · Copilot72

    GitHub Copilot 如何在不牺牲任务质量的前提下降低 AI 编码成本

    GitHub Copilot 团队复盘了四项降低 AI 编码成本的改动,核心原则是按完整任务而非单次工具调用衡量效率。

    Ожидает перевода

    Почему это важно: GitHub Copilot 团队复盘四项降本改动,并给出可迁移的评估方法:按完整任务而非单次工具调用衡量成本。

02.09ср
  1. 陈与小金 · AI Coding 博客78

    Как использовать подагентов в Claude Code: запускаем за раз 13 ИИ-агентов, а в основном диалоге получаем только 3 вывода

    На своём опыте — когда автор разом запустил 13 подагентов для раскадровки — он объясняет, как работает функция subagents, которая есть и в Claude Code, и в Codex: подагенты трудятся в отдельных окнах и возвращают в основной диалог только результат

    Почему это важно: На примере того же запуска 13 подагентов для раскадровки автор показывает, как подагенты оставляют процесс за пределами основного диалога и присылают обратно только выводы

  2. 宝玉78

    Руководство Anthropic по инженерии ИИ-агентов для электронной коммерции: архитектура, оптимизация задержек и затрат, производственные практики

    Anthropic выпустила руководство по устройству ИИ-агентов для электронной коммерции. Опираясь на опыт развёртывания у ритейлеров, на платформах электронной коммерции, а также в командах туризма, развлечений и телекоммуникаций, компания предлагает архитектуру с одним агентом: Claude работает в стандартном цикле агента, навыки закрывают потребности длинного хвоста, а инструменты вызывают существующие системы. По результатам сравнительных тестов эта архитектура превзошла по качеству дизайн с подагентами и подход, при котором всё складывают в один промпт.

    Почему это важно: Опираясь на опыт корпоративного развёртывания ИИ-агентов для электронной коммерции, Anthropic описывает полный набор инженерных практик: архитектуру с одним агентом и навыками, оптимизацию задержек и затрат, а также оценку памяти и безопасности.

  3. Cursor · Changelog66

    Cursor выпускает self-hosted машины: выполнение инструментов остаётся внутри вашей сети

    Машины, артефакты сборки и секреты остаются на вашей инфраструктуре, а вызовы инструментов агент обрабатывает локально. My Machines подключает отдельный ноутбук к личному рабочему процессу, а Team Pool — это именованные воркеры для команды или компании: ёмкость растёт по запросу и уменьшается при отключении воркера, а пул не привязан к репозиторию и возобновляет работу после спящего режима в течение окна переподключения.

    Почему это важно: В статье описаны пуловое планирование и подключение песочниц для self-hosted машин — по этому описанию можно понять, останется ли выполнение инструментов внутри вашей сети.

  4. Paper Compute · Engineering Blog76

    Не измеряйте только код — измеряйте инженерные решения: как по записям сессий посчитать, что одно архитектурное решение даёт эффект в 65 раз больше

    Автор предлагает измерять downstream-эффект одного инженерного решения, то есть его зону воздействия, по записям сессий ИИ-агента и проверяет подход на одном архитектурном решении из собственного проекта tapes: сессия с проектированием обошлась в 57.05 доллара, а последующая работа — в 4704.74 доллара, распределённых между 70 сессиями, 3 инженерами, 8 репозиториями и 27 днями; ещё 404 сессий автоматизированной оценки стоили 431.54 доллара.

    Почему это важно: На примере 474 записей сессий, связанных с одним архитектурным решением, автор показывает, как превратить downstream-затраты этого решения в переиспользуемые метрики.

27.08чт
  1. Addy Osmani · Blog71

    如何审计你的 Agent 配置文件:CLAUDE.md、Skills 与 Hooks 的定期清理

    Addy Osmani 建议每隔几周运行一次 Claude Code 的 /doctor,单独用 /memory 检查记忆,并让每条指令重新证明自己的价值,因为模型、harness 和代码库都在变,旧配置会留下。

    Ожидает перевода

    Почему это важно: 作者结合自身配置审计经验与近期研究,说明 Agent 配置文件为何会腐化,以及如何按节奏清理。

  2. Cline · Blog71

    Cline протестировал восемь моделей на задачах IMO 2026: DeepSeek V4 Flash взял золотую планку всего за 0.12 доллара

    Cline прогнал восемь моделей через собственный harness на шести задачах IMO 2026. Решения оценивали вслепую по 0–7-балльной шкале два эксперта — GPT-5.5 и Claude Opus 5, а спорные случаи разбирал Gemini 3.1 Pro. Порог золотой медали — 29 баллов.

    Почему это важно: Cline провёл слепую оценку восьми моделей на задачах IMO 2026 в одном и том же harness и свёл результаты с ценой за попытку — так видно реальную отдачу от моделей с открытыми весами.