Skip to content

#Costs/usage limits

0 items today
8/11Tue
  1. Sean Goedecke · Blog52

    为什么本地模型不会胜出:批处理与 GPU 效率决定推理成本

    Sean Goedecke 认为本地模型不会成为主流,绝大多数推理仍会发生在 AI 数据中心。他给出的理由是:前沿模型体积远超消费级设备,而数据中心可通过批处理数百名用户的请求摊薄成本,加上 B200 相比 RTX 4090 在同等功耗下约有 3 倍 flops 和近 4 倍内存带宽,本地运行约需多消耗 30 倍资源;家庭推理的电力成本约每月 50 至 300 美元。

    Awaiting translation

  2. Paper Compute · Engineering Blog80

    如何降低 AI Agent 成本:审计 500 个 Claude Code 会话后的三类成本泄漏

    作者用 tapes 记录并导出团队最近 500 个 Claude Code 会话,按工具名和参数做指纹统计,发现同一会话内完全重复的工具调用只占 3.6%(932/25587),真正的开销在别处。

    Awaiting translation

    Why it matters: 作者审计 500 个 Claude Code 会话,把成本拆成会话内、会话间与会话周边三类,给出可复用的排查方法。

8/10Mon
8/9Sun
  1. Kondasamy Jayaraman · Engineering Blog74

    Hermes Agent 复盘:为什么我的个人智能体跑在 VPS 上

    作者把 Hermes Agent 装在 VPS 上,因为只在本地跑的工作流会随 Mac 休眠而中断,首个可用版本花了一天调通。他把 Hermes 设计成网关加四个循环,用 ~/.hermes/memories/ 下 2,200 字符的 MEMORY.md 和 1,375 字符的 USER.md 做有界记忆,会话存 SQLite 并用 FTS5 搜索,Skill 按需加载。

    Awaiting translation

8/6Thu
  1. V2EX · Vibe Coding22

    Vibe Coding 你们会把推理模式开到最大吗?

    V2EX 网友讨论 Vibe Coding 时是否把推理模式开到最大:开到最大更耗 token 和时间,不开又怕 AI 曲解命令导致返工。有用户表示 codex 5.6 sol 中等强度已能解决绝大部分问题,仅在创造性或较难任务时用 high;也有人按任务类型分级,写代码用 medium、疑难杂症和 review 才开最大。

    Awaiting translation

8/5Wed
  1. Chen Dahuang · AI Coding 实录66

    DeepSeek V4 Flash 正式版深度体验:便宜、快、1M 上下文、内置搜索

    作者深度体验几天 DeepSeek V4 Flash 0731 正式版后总结:便宜到跑批处理、Agent 循环和几十轮对话账单基本无感,速度快到配合 Agent 工具循环每步几秒内完成,1M 上下文可容纳整个仓库和完整对话历史、无需频繁 compact,结合 Cache 打折长上下文成本还能再降。

    Awaiting translation

8/4Tue
8/2Sun
7/30Thu
  1. Martin Fowler · Exploring Generative AI78

    重构的经济收益:一次用 Claude Code 量化 token 节省的实验

    Martin Fowler 用一个约 15 万行、几乎全由 Claude Code 和 Cursor 写成的 Rust 应用做实验,把 17,155 行的数据访问层按严格重构步骤拆分,每步后用全新子智能体执行同一个代表性改动并记录 token 消耗。

    Awaiting translation

    Why it matters: 作者用同一改动反复跑重构前后对比,量化出重构对智能体 token 消耗的实际影响,并指出节省来自文件切分而非代码总量下降。

7/28Tue
  1. Cursor Forum · Guides62

    一份智能体编程 token 去向图谱:200+ 工具、模式与配置

    作者在 Claude Max 额度 30 分钟内被烧光后做了系统梳理,指出智能体编程的 token 成本主要不在代码生成,而在重复读取同一批文件、智能体重新发现已有上下文、每个任务再派生新任务,以及每一步都默认用最贵的模型。他把成本追踪工具、缓存与路由模式、上下文管理实践、研究和基准整理成一个开源目录,共 200+ 条,每条附一手来源和核验日期,采用 CC-BY 许可,并邀请社区补充修正。

    Awaiting translation

7/25Sat
  1. Vibe Built · Blog34

    谁才是最好的 AI 应用构建器:一位真正交付软件者的实测排名

    一位自称真正交付软件的开发者对 2026 年主流 AI 应用构建器做了实测排名,核心判断标准是"演示跑通后你还能不能改这个应用"。Lovable 和 Bolt 适合从提示词生成精致 Web 应用,Bolt 与 v0 更适合保留代码继续扩展,Bubble 则完全没有代码导出、锁定程度最高。

    Awaiting translation

  2. Cline · Blog79

    Cline 用递归自我改进让智能体自主把 Kimi K3 在 Terminal-Bench 2.1 提到 88.8%

    Cline 用一条提示词启动 17 小时连续运行的编码智能体,以 GPT-5.6-Sol 为 leader 模型,把 Kimi K3 在 Terminal-Bench 2.1 上的成绩从基线 69/89(77.5%,$79)提升到确认运行 79/89(88.8%,$49.8),超过 Moonshot 自报的 88.3%。

    Awaiting translation

    Why it matters: Cline 用一条提示词让智能体自主完成 17 小时爬山,把 Terminal-Bench 2.1 从 77.5% 提到 88.8%,可看具体修了哪些 harness 问题。

7/20Mon
  1. Paper Compute · Engineering Blog62

    该被裁掉的是智能体工作流,不是工程师

    作者认为企业在用 AI 缩减工程师编制前,应先按会话数据审查并关停那些失败、重复、空转或无人使用的智能体工作流。他给出一份审查清单,包括近 7 天和 30 天的会话数、完成与失败比例、总花费与每次成功运行的花费、工具调用次数、成本由哪些模型驱动,以及输出是否真正上线或被复用。作者同时区分可修复与应关停的工作流,并建议在关停前导出会话数据、把成功模式沉淀为带作者和版本的 Skill。

    Awaiting translation

  2. Johnny Butler · Agentic Engineering38

    AI 智能体的能力是真的,但工程纪律要自己补

    当前 AI 智能体演示普遍在无限 token 预算、全新或精选代码库、无合规与运维压力的条件下运行,展示的是能力上限而非真实交付环境。AWS 副总裁 Marc Brooker 指出,智能体的机会受限于缺陷率,开发者调研中已有团队称其 AI 工具预算不可持续。作者建议只给智能体与验证能力和预算相匹配的自主权,用标准、检查项和可追踪的支出逐步放宽。

    Awaiting translation

7/18Sat
7/17Fri
  1. Ryan Lopopolo34

    为什么 CEO 主导的 token 强制令是合理的组织发现机制

    Ryan Lopopolo 认为,CEO 主导的 token 强制令并非盲目跟风,而是组织学习如何部署推理算力的发现机制。他指出,现有绩效体系几乎无法识别谁能构建新的生产方式,约只有 5% 的人具备构建“造机器的机器”的技能与视野,必须找到他们并给予无限预算。

    Awaiting translation

7/16Thu
7/14Tue
7/12Sun
  1. Martin Alderson34

    AI 推理利润率崩塌中的赢家与输家(第二部分)

    Grok 4.5 以 $6/MTok 输出价格发布,与托管版 GLM5.2 成本相近,作者认为这印证了"好够用"模型正让大量智能体任务转向低价模型。赢家是半导体与推理供应链,以及 Cursor 这类编码智能体——它们能靠廉价模型赚钱并掌握真实使用数据。输家方面作者态度矛盾:Anthropic 约 80% 收入来自 API 存在被替换风险,但前沿实验室可能改为只通过托管智能体平台提供最强模型。

    Awaiting translation

7/11Sat
7/6Mon
7/4Sat
  1. Drew Breunig31

    用 Pace Layers 理解 AI 生态系统的动态

    Drew Breunig 借用 Stewart Brand 的 Pace Layers 框架分析 AI 生态:数据中心建设正被巨额投资推着以"年"而非"数十年"的速度推进,快于其上层的组织、治理与大学,也快于能源生产层,由此引发强烈反弹。他指出模型近 18 个月的进步依赖雇佣数据与合成数据,有机人类数据已基本耗尽,而支撑上层的慢层反馈不足,导致上层狂奔却缺乏支撑。

    Awaiting translation

7/3Fri
  1. Lovable · Blog88

    花掉 8.5 万美元 token 后,我在 Lovable 扩展智能体编程的经验

    Lovable 一名工程师从今年 1 月到 6 月把个人 token 花费从每月约 600 美元推到 5 月的约 2.5 万美元、累计约 8.5 万美元,同时把每周合并 PR 数从 20-30 个提升到 150 个以上。

    Awaiting translation

    Why it matters: 作者公开了自己每月约 2.5 万美元 token 的智能体开发配置,包括风险分级、多智能体评审和上下文管理,可迁移到其他团队。

6/20Sat
6/19Fri
6/18Thu
  1. Terminal-Bench · News60

    Terminal-Bench 发布 Challenges 长周期智能体基准

    Terminal-Bench 发布 Challenges,一种长周期、高 token 消耗的单任务基准,要求智能体在无时间与资源限制下自主完成整个项目,首批开放三个挑战。

    Awaiting translation

    Why it matters: Terminal-Bench 官方推出长周期单任务基准,并公开三个挑战的实测失败模式,可供评估智能体长时自主能力时参考。

6/15Mon
  1. Jesse Vincent78

    Superpowers 6 发布:构建提速最高 50%、token 花费降低最高 60%

    Superpowers 6 发布,作者称在 Anthropic 评测基准上构建耗时降低 50%、token 花费降低 60%,主要来自合并规范符合性与代码质量两个评审 agent、预先生成评审用的 diff 包让评审者少跑 git,以及调整编排器对任务所需 agent 类型的指引。

    Awaiting translation

    Why it matters: 作者用自建评测套件量化了 Superpowers 6 在构建耗时和 token 花费上的改进,并公开了实验记录与失败结论。

6/10Wed
6/8Mon
  1. Martin Alderson38

    xAI 越来越像一家数据中心 REIT,而非前沿实验室

    xAI 与 Anthropic、Google 达成算力合作,前者以每月 12.5 亿美元租用 300MW 容量(约 22 万块 GPU),后者以每月 9.2 亿美元租用 11 万块 GPU。xAI 已并入 SpaceX,这些收入将直接流入即将 IPO 的实体。作者认为 xAI 在数据中心建设上确有优势,但其定位正越来越像一家附带前沿实验室的数据中心 REIT。

    Awaiting translation

6/6Sat