Cline 开源开放权重模型的评测方法与 trace
Cline 开源其开放权重模型的评测方法,并附上价值超过一千美元的爬坡分数与 trace 供下载分析。文章给出 Hill Climber's Checklist 五条启发式:设定北极星指标、量化噪声、按任务/模型/供应商拆解失败模式、不要默认更多思考更好、保留私有评测集。
推荐理由:Cline 公开评测方法与上千美元 trace,给出五条可迁移的爬坡启发式,适合自建 harness 的团队参考。
Token 花在哪、额度怎么用得更久、成本失控怎么排查。
Cline 开源其开放权重模型的评测方法,并附上价值超过一千美元的爬坡分数与 trace 供下载分析。文章给出 Hill Climber's Checklist 五条启发式:设定北极星指标、量化噪声、按任务/模型/供应商拆解失败模式、不要默认更多思考更好、保留私有评测集。
推荐理由:Cline 公开评测方法与上千美元 trace,给出五条可迁移的爬坡启发式,适合自建 harness 的团队参考。
NVIDIA 发布 Nemotron 3.5 Lightning,一个面向常驻智能体的可定制开源模型,并已在 Cline 中免费提供。
推荐理由:NVIDIA 新开源模型在 Cline 免费开放,读者可据此判断高频智能体调用场景是否值得换用。
作者用 tapes 记录并导出团队最近 500 个 Claude Code 会话,按工具名和参数做指纹统计,发现同一会话内完全重复的工具调用只占 3.6%(932/25587),真正的开销在别处。
推荐理由:作者审计 500 个 Claude Code 会话,把成本拆成会话内、会话间与会话周边三类,给出可复用的排查方法。
Martin Fowler 用一个约 15 万行、几乎全由 Claude Code 和 Cursor 写成的 Rust 应用做实验,把 17,155 行的数据访问层按严格重构步骤拆分,每步后用全新子智能体执行同一个代表性改动并记录 token 消耗。
推荐理由:作者用同一改动反复跑重构前后对比,量化出重构对智能体 token 消耗的实际影响,并指出节省来自文件切分而非代码总量下降。
Cline 用一条提示词启动 17 小时连续运行的编码智能体,以 GPT-5.6-Sol 为 leader 模型,把 Kimi K3 在 Terminal-Bench 2.1 上的成绩从基线 69/89(77.5%,$79)提升到确认运行 79/89(88.8%,$49.8),超过 Moonshot 自报的 88.3%。
推荐理由:Cline 用一条提示词让智能体自主完成 17 小时爬山,把 Terminal-Bench 2.1 从 77.5% 提到 88.8%,可看具体修了哪些 harness 问题。
Lovable 一名工程师从今年 1 月到 6 月把个人 token 花费从每月约 600 美元推到 5 月的约 2.5 万美元、累计约 8.5 万美元,同时把每周合并 PR 数从 20-30 个提升到 150 个以上。
推荐理由:作者公开了自己每月约 2.5 万美元 token 的智能体开发配置,包括风险分级、多智能体评审和上下文管理,可迁移到其他团队。
Headroom 是一个开源、本地优先的代理,拦截 LLM API 调用并在请求到达服务商前重写 messages 数组,应用代码和模型都不用改。
推荐理由:Headroom 把上下文压缩放到代理层,读者可据此判断长会话智能体的 token 成本能否降下来。
Terminal-Bench 发布 Challenges,一种长周期、高 token 消耗的单任务基准,要求智能体在无时间与资源限制下自主完成整个项目,首批开放三个挑战。
推荐理由:Terminal-Bench 官方推出长周期单任务基准,并公开三个挑战的实测失败模式,可供评估智能体长时自主能力时参考。
Superpowers 6 发布,作者称在 Anthropic 评测基准上构建耗时降低 50%、token 花费降低 60%,主要来自合并规范符合性与代码质量两个评审 agent、预先生成评审用的 diff 包让评审者少跑 git,以及调整编排器对任务所需 agent 类型的指引。
推荐理由:作者用自建评测套件量化了 Superpowers 6 在构建耗时和 token 花费上的改进,并公开了实验记录与失败结论。
Cloudflare 基于开源编码智能体 OpenCode 搭建 CI 原生的 AI 代码评审系统,用协调智能体调度最多 7 个按安全、性能、代码质量、文档、发布、内部规范划分的专职评审智能体,去重后只发一条结构化评审评论。
推荐理由:Cloudflare 公开了 CI 内多智能体代码评审的插件架构、风险分级与成本数据,可迁移到自建评审流水线。
Augment Code 在 AGENTS.md 中前置约 2.5k 字符的 Karpathy 风格编码规则,用 Auggie、Claude Code、Codex 跑 OpenClaw 的 40 个 PR 做对照。
推荐理由:同一批 PR 上三种编码智能体的对照实测,说明提示词约束主要省成本而非提质量,并给出各 harness 差异。
宝玉结合 Claude Code 的提示缓存机制,解释配额为何烧得快,并给出省 Token 的操作规则。他指出缓存只对前缀有效、主智能体缓存窗口 1 小时、子智能体 5 分钟,读取缓存成本约为重新计算的十分之一,因此频繁 /clear 反而会触发全价上下文重建;判断标准是缓存还热、任务没换就继续聊,缓存过期、任务切换或上下文噪音过多才开新会话。
推荐理由:从提示缓存机制出发解释 Claude Code 配额消耗,给出继续会话还是重开的判断条件和可复制的配置。
Lovable 的基础设施团队公开了其 LLM 供应商负载均衡方案,用于在峰值每分钟超过十亿 token 的流量下避免“model provider unavailable”。
推荐理由:Lovable 公开了每分钟十亿 token 规模下的多供应商负载均衡方案,可借鉴其用 PID 控制器和项目级粘性保住 prompt caching 的做法。