为什么本地模型不会胜出:批处理与 GPU 效率决定推理成本
Sean Goedecke 认为本地模型不会成为主流,绝大多数推理仍会发生在 AI 数据中心。他给出的理由是:前沿模型体积远超消费级设备,而数据中心可通过批处理数百名用户的请求摊薄成本,加上 B200 相比 RTX 4090 在同等功耗下约有 3 倍 flops 和近 4 倍内存带宽,本地运行约需多消耗 30 倍资源;家庭推理的电力成本约每月 50 至 300 美元。
Awaiting translation
Sean Goedecke 认为本地模型不会成为主流,绝大多数推理仍会发生在 AI 数据中心。他给出的理由是:前沿模型体积远超消费级设备,而数据中心可通过批处理数百名用户的请求摊薄成本,加上 B200 相比 RTX 4090 在同等功耗下约有 3 倍 flops 和近 4 倍内存带宽,本地运行约需多消耗 30 倍资源;家庭推理的电力成本约每月 50 至 300 美元。
Awaiting translation
作者用 tapes 记录并导出团队最近 500 个 Claude Code 会话,按工具名和参数做指纹统计,发现同一会话内完全重复的工具调用只占 3.6%(932/25587),真正的开销在别处。
Awaiting translation
Why it matters: 作者审计 500 个 Claude Code 会话,把成本拆成会话内、会话间与会话周边三类,给出可复用的排查方法。
作者指出,跑智能体任务时缓存读取而非输入输出才是主要成本,因为每轮都要重读已有上下文,累计开销随轮次呈平方增长。
Awaiting translation
作者把 Hermes Agent 装在 VPS 上,因为只在本地跑的工作流会随 Mac 休眠而中断,首个可用版本花了一天调通。他把 Hermes 设计成网关加四个循环,用 ~/.hermes/memories/ 下 2,200 字符的 MEMORY.md 和 1,375 字符的 USER.md 做有界记忆,会话存 SQLite 并用 FTS5 搜索,Skill 按需加载。
Awaiting translation
V2EX 网友讨论 Vibe Coding 时是否把推理模式开到最大:开到最大更耗 token 和时间,不开又怕 AI 曲解命令导致返工。有用户表示 codex 5.6 sol 中等强度已能解决绝大部分问题,仅在创造性或较难任务时用 high;也有人按任务类型分级,写代码用 medium、疑难杂症和 review 才开最大。
Awaiting translation
DeepSeek V4 Flash 缺多模态能力,可用 Qwen-3.7-Flash 作视觉补充,通过路由组合补齐读图场景。方案是输入带图片走 Qwen-3.7-Flash 识图并输出结构化描述,纯文本继续走 V4 Flash 推理,也可把描述交给 V4 Flash 做深度推理、写代码和总结。
Awaiting translation
Paper Compute 推出开源代理 tapes,它位于 agent harness 与推理服务之间,记录流经的全部内容,包括系统消息、输入、思考块、工具调用与结果、输出。
Awaiting translation
Meta 发布编码智能体 Muse Code 和面向编码的模型更新 Muse Spark 1.2,后者在代码生成、复杂调试、代码库理解和端到端开发流程上做了改进,并针对长周期编码任务(整仓库生成、大型端到端项目、auto-research)加大训练算力。
Awaiting translation
Lovable 宣布与 Cerebras 合作,计划到 2027 年大幅降低响应时间,并将分阶段迁移到 Cerebras 专用算力,先从对延迟最敏感的工作负载开始。
Awaiting translation
作者深度体验几天 DeepSeek V4 Flash 0731 正式版后总结:便宜到跑批处理、Agent 循环和几十轮对话账单基本无感,速度快到配合 Agent 工具循环每步几秒内完成,1M 上下文可容纳整个仓库和完整对话历史、无需频繁 compact,结合 Cache 打折长上下文成本还能再降。
Awaiting translation
Cline 盘点了 2026 年值得开发者尝试的 5 个开放权重模型:Kimi K3、DeepSeek V4 Flash、GLM-5.2、DeepSeek V4 Pro 和 MiniMax M3。
Awaiting translation
OpenAI 一款未发布模型在数学和理论计算机科学领域取得“十项进展”,引发广泛关注。作者在 Laracon 分享了如何为 Amp 编写提示词,并记录了对 AI 编程、框架抽象价值以及 OpenAI 模型“越狱”事件的思考。
Awaiting translation
Martin Alderson 表示自己第一次不再按原始智力挑选日常主力模型,而是按速度挑选,因为 Opus 4.6 级别的模型对写代码、整理研究、做幻灯片和数据库分析等日常任务已经够用。
Awaiting translation
Martin Fowler 用一个约 15 万行、几乎全由 Claude Code 和 Cursor 写成的 Rust 应用做实验,把 17,155 行的数据访问层按严格重构步骤拆分,每步后用全新子智能体执行同一个代表性改动并记录 token 消耗。
Awaiting translation
Why it matters: 作者用同一改动反复跑重构前后对比,量化出重构对智能体 token 消耗的实际影响,并指出节省来自文件切分而非代码总量下降。
作者在 Claude Max 额度 30 分钟内被烧光后做了系统梳理,指出智能体编程的 token 成本主要不在代码生成,而在重复读取同一批文件、智能体重新发现已有上下文、每个任务再派生新任务,以及每一步都默认用最贵的模型。他把成本追踪工具、缓存与路由模式、上下文管理实践、研究和基准整理成一个开源目录,共 200+ 条,每条附一手来源和核验日期,采用 CC-BY 许可,并邀请社区补充修正。
Awaiting translation
一位自称真正交付软件的开发者对 2026 年主流 AI 应用构建器做了实测排名,核心判断标准是"演示跑通后你还能不能改这个应用"。Lovable 和 Bolt 适合从提示词生成精致 Web 应用,Bolt 与 v0 更适合保留代码继续扩展,Bubble 则完全没有代码导出、锁定程度最高。
Awaiting translation
Cline 用一条提示词启动 17 小时连续运行的编码智能体,以 GPT-5.6-Sol 为 leader 模型,把 Kimi K3 在 Terminal-Bench 2.1 上的成绩从基线 69/89(77.5%,$79)提升到确认运行 79/89(88.8%,$49.8),超过 Moonshot 自报的 88.3%。
Awaiting translation
Why it matters: Cline 用一条提示词让智能体自主完成 17 小时爬山,把 Terminal-Bench 2.1 从 77.5% 提到 88.8%,可看具体修了哪些 harness 问题。
作者认为企业在用 AI 缩减工程师编制前,应先按会话数据审查并关停那些失败、重复、空转或无人使用的智能体工作流。他给出一份审查清单,包括近 7 天和 30 天的会话数、完成与失败比例、总花费与每次成功运行的花费、工具调用次数、成本由哪些模型驱动,以及输出是否真正上线或被复用。作者同时区分可修复与应关停的工作流,并建议在关停前导出会话数据、把成功模式沉淀为带作者和版本的 Skill。
Awaiting translation
当前 AI 智能体演示普遍在无限 token 预算、全新或精选代码库、无合规与运维压力的条件下运行,展示的是能力上限而非真实交付环境。AWS 副总裁 Marc Brooker 指出,智能体的机会受限于缺陷率,开发者调研中已有团队称其 AI 工具预算不可持续。作者建议只给智能体与验证能力和预算相匹配的自主权,用标准、检查项和可追踪的支出逐步放宽。
Awaiting translation
独立开发者实测后只留下 Cursor 和 Claude Code 两款日常工具,合计每月 36 美元:Cursor Pro 16 美元负责编辑器内的 Tab 补全与行内修改,Claude Code 随 20 美元的 Claude Pro 提供,在终端处理跨多文件的智能体任务。
Awaiting translation
Ryan Lopopolo 认为,CEO 主导的 token 强制令并非盲目跟风,而是组织学习如何部署推理算力的发现机制。他指出,现有绩效体系几乎无法识别谁能构建新的生产方式,约只有 5% 的人具备构建“造机器的机器”的技能与视野,必须找到他们并给予无限预算。
Awaiting translation
Ratel 是一个面向 AI 智能体的上下文工程层,把工具和 Skill 索引成目录,每轮只检索并注入相关能力,避免把全部工具 schema 和指令塞进上下文。
Awaiting translation
Kimi 上线旗舰模型 K3,支持 1M 上下文,但 1M 上下文按会员档位分级开放:Kimi Code 中 199 元每月及以上才能用 1M,99 元档为 256k,49 元档无法使用;Kimi 客户端则只有 699 元每月档能用 1M。
Awaiting translation
Paper Compute 的 Paper Console 可展示会话级模型用量与成本,其博客举例称一次 22 轮、427 次 API 调用的会话耗时约 30 小时、花费 100.66 美元,其中约 91% 流向 Fable 5、近 9% 流向 Opus、5 美分流向 Haiku。
Awaiting translation
作者日常同时使用 Claude Code、Codex、Gemini CLI 和 Pi Agent,两个月下来 Pi 承担了约 40-50% 的日常智能体交互,主要用于其他工具不合适的胶水任务和快速探索。
Awaiting translation
Codex 团队在 GPT-5.6 发布后于 Reddit 举办 AMA,说明 Sol 是主力模型、Terra 更快更省、Luna 主要用于廉价子智能体和上下文收集,UI 场景推荐用 Sol 配合参考图。
Awaiting translation
JetBrains 用 Claude Code 跑 SkillsBench 的 86 个真实编程任务,对比安装与不安装 Caveman 的效果,发现输出 Token 只从约 59.2 万降到 54.2 万,节省 8.5%,远低于项目宣传的 65%。
Awaiting translation
Grok 4.5 以 $6/MTok 输出价格发布,与托管版 GLM5.2 成本相近,作者认为这印证了"好够用"模型正让大量智能体任务转向低价模型。赢家是半导体与推理供应链,以及 Cursor 这类编码智能体——它们能靠廉价模型赚钱并掌握真实使用数据。输家方面作者态度矛盾:Anthropic 约 80% 收入来自 API 存在被替换风险,但前沿实验室可能改为只通过托管智能体平台提供最强模型。
Awaiting translation
Thorsten Ball 在 Joy & Curiosity #91 中记录 9 岁女儿用 iMovie 学剪辑,由此想到不懂剪辑术语的人难以向 AI 描述需求。
Awaiting translation
宝玉梳理了 ChatGPT 中 Chat、Work、Codex 三种模式的区别:Chat 回答问题,Work 跨应用完成知识工作并交付文档表格幻灯片,Codex 在代码仓库里完成开发任务并交付 diff、测试结果和 PR。
Awaiting translation
作者实测智谱 GLM5.2 后认为,它是首个达到 Opus 和 GPT 同级水准的开源权重模型,在 Claude Code 中几乎难以分辨二者差异。他指出迁移成本极低,Z.ai 和 Fireworks 都提供 OpenAI 与 Anthropic 兼容端点,只需改 base URL 和 API key 即可替换。
Awaiting translation
Drew Breunig 借用 Stewart Brand 的 Pace Layers 框架分析 AI 生态:数据中心建设正被巨额投资推着以"年"而非"数十年"的速度推进,快于其上层的组织、治理与大学,也快于能源生产层,由此引发强烈反弹。他指出模型近 18 个月的进步依赖雇佣数据与合成数据,有机人类数据已基本耗尽,而支撑上层的慢层反馈不足,导致上层狂奔却缺乏支撑。
Awaiting translation
Lovable 一名工程师从今年 1 月到 6 月把个人 token 花费从每月约 600 美元推到 5 月的约 2.5 万美元、累计约 8.5 万美元,同时把每周合并 PR 数从 20-30 个提升到 150 个以上。
Awaiting translation
Why it matters: 作者公开了自己每月约 2.5 万美元 token 的智能体开发配置,包括风险分级、多智能体评审和上下文管理,可迁移到其他团队。
Headroom 是一个开源、本地优先的代理,拦截 LLM API 调用并在请求到达服务商前重写 messages 数组,应用代码和模型都不用改。
Awaiting translation
Why it matters: Headroom 把上下文压缩放到代理层,读者可据此判断长会话智能体的 token 成本能否降下来。
Steve Yegge 认为,前沿模型能力仍在指数增长,但最强大的模型会像核武器一样被各国政府管控,多数人和多数财富 500 强公司将只能用到 Fable 级别的模型,因此可获取的智能曲线对大多数人会人为走平。
Awaiting translation
Terminal-Bench 发布 Challenges,一种长周期、高 token 消耗的单任务基准,要求智能体在无时间与资源限制下自主完成整个项目,首批开放三个挑战。
Awaiting translation
Why it matters: Terminal-Bench 官方推出长周期单任务基准,并公开三个挑战的实测失败模式,可供评估智能体长时自主能力时参考。
Superpowers 6 发布,作者称在 Anthropic 评测基准上构建耗时降低 50%、token 花费降低 60%,主要来自合并规范符合性与代码质量两个评审 agent、预先生成评审用的 diff 包让评审者少跑 git,以及调整编排器对任务所需 agent 类型的指引。
Awaiting translation
Why it matters: 作者用自建评测套件量化了 Superpowers 6 在构建耗时和 token 花费上的改进,并公开了实验记录与失败结论。
AgentsView 用户可在 ~/.agentsview/config.toml 中通过 [custom_model_pricing] 为尚未收录定价的模型手动添加价格,作者据此为当天发布的 Claude Fable 5 配置了 input 10.0、output 50.0、cache_creation 12.50、cache_read 1 的费率。
Awaiting translation
xAI 与 Anthropic、Google 达成算力合作,前者以每月 12.5 亿美元租用 300MW 容量(约 22 万块 GPU),后者以每月 9.2 亿美元租用 11 万块 GPU。xAI 已并入 SpaceX,这些收入将直接流入即将 IPO 的实体。作者认为 xAI 在数据中心建设上确有优势,但其定位正越来越像一家附带前沿实验室的数据中心 REIT。
Awaiting translation
作者用同一条口播视频和同一套提示词,分别让 Claude Code 驱动 Remotion 和 Hyperframes 做特效,实测两者的调试流程与 token 成本。
Awaiting translation