FP8 陷阱:GPU 账单降了 47%,但模型在输出“!!!!!!”
作者在单张 AMD MI300X 上用 vLLM ROCm 版跑 Qwen2.5 7B/32B/72B,按 $2.99/GPU-hr 计价,BF16 基线为 7B $0.227/M、32B $0.77/M、72B $1.67/M 输出 token。
推荐理由:作者在 MI300X 上实测 FP8 量化,发现按 token 计费会掩盖模型输出退化成乱码的问题,并给出可复用的验证方法。
Token 花在哪、额度怎么用得更久、成本失控怎么排查。
作者在单张 AMD MI300X 上用 vLLM ROCm 版跑 Qwen2.5 7B/32B/72B,按 $2.99/GPU-hr 计价,BF16 基线为 7B $0.227/M、32B $0.77/M、72B $1.67/M 输出 token。
推荐理由:作者在 MI300X 上实测 FP8 量化,发现按 token 计费会掩盖模型输出退化成乱码的问题,并给出可复用的验证方法。
作者开源了 claudemanager,一个本地守护进程,让 Claude Code 通过 ANTHROPIC_BASE_URL 指向它,只改动请求的 Authorization 头,就能把会话路由到 5 小时、每周和单模型窗口余量最多的 Max 账号,并在窗口填满前按自定义阈值切换。
推荐理由:作者开源了一个本地代理,把多个 Claude Code Max 账号按额度余量自动分流,并顺带记录了请求日志。
Flash-Agents 是一个 Claude Code 插件,把实现切片、移植测试、审查 diff、梳理代码库这类有边界的编码工作交给 DeepSeek V4.1 Flash worker,Claude 保留架构、验收标准和最终审查。
推荐理由:作者把 Claude Code 的编码任务外包给 DeepSeek Flash worker,并给出沙箱、补丁与实测数据,可据此判断成本与安全边界。
作者发现两次 Codex 浏览器自动化任务分别消耗 170,123 和 110,180 token,于是从模型选择、配置文件和任务拆分入手控制用量。
推荐理由:作者用两次浏览器任务烧掉十几万 token 的实测,给出按任务难度切换模型与配置的省额度做法。
作者让 GPT(gpt-6.1-sol,推理档位 high)在 Codex 里负责规划、关键判断和验收,通过 DeepSeek 官方 Harness 调用 DeepSeek-V4.1-Flash 负责写代码、跑试验和修复,一起做出五项功能跑通的本地 PDF 工具箱。
推荐理由:作者用 GPT 规划、DeepSeek 执行的分工跑通 PDF 工具箱,并给出三段提示词和缓存用量数据,可迁移到长任务降本。
俄罗斯电商平台 Flawwow 的联合创始人 Артем Гамбицкий 介绍了公司内部的产品沙箱:允许没有工程背景的同事把 AI 智能体写的应用直接发布到生产环境,四个月内 150 人提交了 262 个项目、约 5000 次部署,这些代码没有任何程序员读过。
推荐理由:作者公开了让非工程同事用 AI 智能体写代码并安全上线的四层防护与资源踩坑细节,可迁移到自建内部沙箱。
OpenAI 发布面向编程、文档处理和任务自动化的 GPT-6.1 Sol,公司称其在部分测试中接近 GPT-6 Astra。在真实代码库任务测试 DeepSWE 1.1 中,该模型追平 Astra,而执行成本约为其五分之一;在应用操控测试 OSWorld 2.0 中,最高推理档位下比 GPT-6 Sol 提升 7 个百分点。
推荐理由:GPT-6.1 Sol 在 DeepSWE 1.1 上追平 Astra 而成本约为其五分之一,读者可据此判断编程任务的性价比变化。
OpenAI 在 9 月 29 日旧金山 DevDay 上发布 GPT-6.1 Sol,API 名为 gpt-6.1-sol,定价为每百万输入 token 2 美元、输出 10 美元,缓存输入 0.10 美元,标准价格是 GPT-6 Astra 的五分之一。
推荐理由:OpenAI DevDay 发布 GPT-6.1 Sol,价格降至 Astra 的五分之一,并同步更新 Codex、Agents API 与插件体系,可据此判断成本与工具链变化。
Anthropic 于 9 月 22 日发布旗舰模型 Claude Opus 5.5,面向让智能体执行编程、数据分析等多步任务的开发者与团队,官方称相比 Opus 5 性能提升且成本下降。
推荐理由:Anthropic 官方公布的定价与默认负载成本降幅,可帮开发者判断长时智能体任务的迁移成本。
作者给出用 OpenRouter 把 Claude Code 接到任意模型的做法:把 OPENROUTER_API_KEY 放在 ~/.config/openrouter.env。
推荐理由:作者用约二十行 shell 把 Claude Code 的 harness 与模型解耦,并给出四个模型槽位的路由与踩坑细节。
Spotify 开源插件 shunt,通过 Claude Code 的 PreToolUse hooks 拦截超过 350 行的整文件读取,把 Read 以及 cat。
推荐理由:Spotify 用 PreToolUse Hook 把大文件读取和样板代码生成转给廉价模型,给出可迁移的成本拆分思路。
Armin Ronacher 用 GPT 6 Astra 跑了一个周末的软件工厂实验,让模型自行管理上下文和子智能体,目标是实现带虚拟线程和词法作用域的 Python。
推荐理由:作者用 35 小时无人值守的软件工厂实验,展示 GPT 6 Astra 为 token 效率牺牲代码可读性的具体证据。
GitHub 在 Copilot CLI 中以研究预览形式推出 Project HydraFusion,通过运行时编排在多个提供商的模型间选择执行方案,用户像选普通模型一样选择它,按各模型标准费率计费。
推荐理由:GitHub 官方给出 HydraFusion 的三种编排模式与三项基准的成本质量对比,可据此判断多模型编排在真实编码任务中的取舍。
GitHub Copilot 团队复盘了四项降低 AI 编码成本的改动,核心原则是按完整任务而非单次工具调用衡量效率。
推荐理由:GitHub Copilot 团队复盘四项降本改动,并给出可迁移的评估方法:按完整任务而非单次工具调用衡量成本。
作者结合自己一次派 13 个子代理配分镜的实操,讲解 Claude Code 和 Codex 都有的 subagents 功能:子代理在独立窗口干活,只把结论交回主对话。
推荐理由:作者用一次派 13 个子代理配分镜的实操,说明子代理如何把过程留在主对话之外、只回传结论。
Anthropic 发布电商 AI 智能体解剖指南,基于与零售商、电商平台、旅游娱乐和电信团队的部署经验,提出把 Claude 放在标准智能体循环中、用技能覆盖长尾需求、用工具调用现有系统的单一智能体架构,并称对比测试中该架构在质量上优于子智能体设计和把所有内容塞进提示词的做法。
推荐理由:Anthropic 基于企业级电商智能体部署经验,给出单智能体加技能架构、延迟与成本优化、记忆与安全评估的完整工程做法。
Cursor 支持自托管机器,代码库、构建产物和密钥都保留在自有基础设施的内部机器上,由智能体在本地处理工具调用。My Machines 用于把单台笔记本或 VM 接入个人工作流,团队池则是面向团队或企业的具名 worker 队列,容量随请求扩容、worker 断开时缩容,池不与代码仓库绑定,并支持闲置机器休眠后在重连窗口内恢复。
推荐理由:官方给出自托管机器的池化调度与沙箱接入方式,读者可据此判断工具执行能否留在自有网络内。
作者提出用 agent 会话记录衡量一次工程决策的下游影响,即 blast radius(影响范围),并用自家 tapes 项目的一次架构决策做验证:设计文档会话花费 57.05 美元,后续引发 4704.74 美元工作量,分布在 70 个人工会话、3 名工程师、8 个仓库和 27 天中,另有 404 个自动化评测会话花费 431.54 美元。
推荐理由:作者用自家一次架构决策的 474 条会话记录,展示如何把决策的下游成本量化成可复用的指标。
Addy Osmani 建议每隔几周运行一次 Claude Code 的 /doctor,单独用 /memory 检查记忆,并让每条指令重新证明自己的价值,因为模型、harness 和代码库都在变,旧配置会留下。
推荐理由:作者结合自身配置审计经验与近期研究,说明 Agent 配置文件为何会腐化,以及如何按节奏清理。
Cline 让八个模型在自家 harness 里做 IMO 2026 六道题,证明由 GPT-5.5 和 Claude Opus 5 双盲按 0–7 分制评分、Gemini 3.1 Pro 仲裁,金牌线为 29 分。
推荐理由:Cline 用同一套 harness 盲评八个模型做 IMO 2026,给出分数与单次成本对照,可看开源权重模型的实际性价比。