Перейти к содержимому

Стоимость и лимиты

На что уходят токены, как дольше работать в пределах лимитов и как разобраться с ростом расходов.

Новые избранные материалы

Материалы 21–33 · Всего 33
19.08ср
  1. Cline · Blog71

    Методика оценки и трассировка открытых моделей Cline

    Cline открывает методику оценки своих открытых моделей и выкладывает для скачивания и анализа трассировки и результаты «восхождения», стоившие больше тысячи долларов. В статье приводится Hill Climber's Checklist — пять эвристик: задать метрику-«Полярную звезду», измерить шум, разложить режимы отказа по задачам, моделям и поставщикам, не считать по умолчанию, что чем больше рассуждений, тем лучше, и сохранять закрытый оценочный набор.

    Почему это важно: Cline публикует методику оценки и трассировки на тысячи долларов и даёт пять переносимых эвристик «восхождения», полезных командам, которые собирают собственный harness.

11.08вт
  1. Cline · Blog60

    NVIDIA Nemotron 3.5 Lightning появился в Cline и доступен бесплатно

    NVIDIA выпустила Nemotron 3.5 Lightning — настраиваемую открытую модель для постоянно работающих ИИ-агентов, которая уже бесплатно доступна в Cline.

    Почему это важно: Новая открытая модель NVIDIA бесплатно доступна в Cline; читатели могут оценить, стоит ли переходить на неё при частых вызовах ИИ-агентов.

  2. Paper Compute · Engineering Blog80

    如何降低 AI Agent 成本:审计 500 个 Claude Code 会话后的三类成本泄漏

    作者用 tapes 记录并导出团队最近 500 个 Claude Code 会话,按工具名和参数做指纹统计,发现同一会话内完全重复的工具调用只占 3.6%(932/25587),真正的开销在别处。

    Ожидает перевода

    Почему это важно: 作者审计 500 个 Claude Code 会话,把成本拆成会话内、会话间与会话周边三类,给出可复用的排查方法。

30.07чт
  1. Martin Fowler · Exploring Generative AI78

    重构的经济收益:一次用 Claude Code 量化 token 节省的实验

    Martin Fowler 用一个约 15 万行、几乎全由 Claude Code 和 Cursor 写成的 Rust 应用做实验,把 17,155 行的数据访问层按严格重构步骤拆分,每步后用全新子智能体执行同一个代表性改动并记录 token 消耗。

    Ожидает перевода

    Почему это важно: 作者用同一改动反复跑重构前后对比,量化出重构对智能体 token 消耗的实际影响,并指出节省来自文件切分而非代码总量下降。

25.07сб
  1. Cline · Blog79

    Cline 用递归自我改进让智能体自主把 Kimi K3 在 Terminal-Bench 2.1 提到 88.8%

    Cline 用一条提示词启动 17 小时连续运行的编码智能体,以 GPT-5.6-Sol 为 leader 模型,把 Kimi K3 在 Terminal-Bench 2.1 上的成绩从基线 69/89(77.5%,$79)提升到确认运行 79/89(88.8%,$49.8),超过 Moonshot 自报的 88.3%。

    Ожидает перевода

    Почему это важно: Cline 用一条提示词让智能体自主完成 17 小时爬山,把 Terminal-Bench 2.1 从 77.5% 提到 88.8%,可看具体修了哪些 harness 问题。

03.07пт
  1. Lovable · Blog88

    花掉 8.5 万美元 token 后,我在 Lovable 扩展智能体编程的经验

    Lovable 一名工程师从今年 1 月到 6 月把个人 token 花费从每月约 600 美元推到 5 月的约 2.5 万美元、累计约 8.5 万美元,同时把每周合并 PR 数从 20-30 个提升到 150 个以上。

    Ожидает перевода

    Почему это важно: 作者公开了自己每月约 2.5 万美元 token 的智能体开发配置,包括风险分级、多智能体评审和上下文管理,可迁移到其他团队。

20.06сб
  1. Kondasamy Jayaraman · Engineering Blog83

    Headroom:在智能体与账单之间做上下文压缩的本地代理

    Headroom 是一个开源、本地优先的代理,拦截 LLM API 调用并在请求到达服务商前重写 messages 数组,应用代码和模型都不用改。

    Ожидает перевода

    Почему это важно: Headroom 把上下文压缩放到代理层,读者可据此判断长会话智能体的 token 成本能否降下来。

18.06чт
  1. Terminal-Bench · News60

    Terminal-Bench 发布 Challenges 长周期智能体基准

    Terminal-Bench 发布 Challenges,一种长周期、高 token 消耗的单任务基准,要求智能体在无时间与资源限制下自主完成整个项目,首批开放三个挑战。

    Ожидает перевода

    Почему это важно: Terminal-Bench 官方推出长周期单任务基准,并公开三个挑战的实测失败模式,可供评估智能体长时自主能力时参考。

15.06пн
  1. Jesse Vincent78

    Superpowers 6 发布:构建提速最高 50%、token 花费降低最高 60%

    Superpowers 6 发布,作者称在 Anthropic 评测基准上构建耗时降低 50%、token 花费降低 60%,主要来自合并规范符合性与代码质量两个评审 agent、预先生成评审用的 diff 包让评审者少跑 git,以及调整编排器对任务所需 agent 类型的指引。

    Ожидает перевода

    Почему это важно: 作者用自建评测套件量化了 Superpowers 6 在构建耗时和 token 花费上的改进,并公开了实验记录与失败结论。

26.05вт
  1. Hacker News · AI Code Review 讨论88

    Как Cloudflare с помощью OpenCode организует масштабное ИИ-ревью кода

    Cloudflare построил на базе открытого ИИ-агента для разработки OpenCode систему ИИ-ревью кода, встроенную в CI: координирующий агент управляет до 7 специализированных агентов-ревьюеров, отвечающих за безопасность, производительность, качество кода, документацию, релиз и внутренние стандарты, а после дедупликации публикуется только один структурированный комментарий с ревью.

    Почему это важно: Cloudflare раскрыл архитектуру плагинов для многоагентного ревью кода в CI, градацию рисков и данные о затратах — всё это можно перенести в собственный пайплайн ревью.

30.04чт
  1. Augment Code · Blog71

    Augment Code проверила на практике правила в стиле Карпати: ИИ-агент для разработки не написал код лучше, но сделал это быстрее и дешевле

    Augment Code добавила в начало AGENTS.md около 2.5 тыс. символов правил кодирования в стиле Карпати и сравнила, как Auggie, Claude Code и Codex справляются с 40 пул-реквестами OpenClaw.

    Почему это важно: Сравнительный тест трёх ИИ-агентов для разработки на одной и той же партии пул-реквестов показывает: ограничения в промпте в основном экономят деньги, а не повышают качество, и при этом каждый харнесс работает по-своему.

06.04пн
  1. 宝玉78

    Руководство по экономии токенов в Claude Code: осторожнее с контекстом на 1M — и открывать новый сеанс, и не открывать его — одинаково неправильно

    Баоюй разбирает механизм кэширования промптов в Claude Code, объясняет, почему лимит так быстро расходуется, и даёт правила экономии токенов. Он отмечает, что кэш работает только для префикса: у основного агента окно кэша — 1 час, у дочерних агентов — 5 минут, а чтение из кэша стоит примерно в десять раз дешевле пересчёта. Поэтому частые /clear, наоборот, запускают полную перестройку контекста по полной цене. Критерий такой: если кэш ещё горячий и задача не сменилась — продолжайте диалог; новый сеанс открывайте только когда кэш истёк, задача сменилась или в контексте слишком много шума.

    Почему это важно: Разберём, как расходуется квота Claude Code, отталкиваясь от механизма кэширования промптов: покажем, когда стоит продолжить сессию, а когда начать заново, и дадим готовые конфиги, которые можно скопировать.

05.03чт
  1. Lovable · Blog71

    Lovable 如何每分钟路由十亿 token:多回退链与项目级粘性负载均衡

    Lovable 的基础设施团队公开了其 LLM 供应商负载均衡方案,用于在峰值每分钟超过十亿 token 的流量下避免“model provider unavailable”。

    Ожидает перевода

    Почему это важно: Lovable 公开了每分钟十亿 token 规模下的多供应商负载均衡方案,可借鉴其用 PID 控制器和项目级粘性保住 prompt caching 的做法。