Cline 开源开放权重模型的评测方法与 trace
Cline 开源其开放权重模型的评测方法,并附上价值超过一千美元的爬坡分数与 trace 供下载分析。文章给出 Hill Climber's Checklist 五条启发式:设定北极星指标、量化噪声、按任务/模型/供应商拆解失败模式、不要默认更多思考更好、保留私有评测集。
推荐理由:Cline 公开评测方法与上千美元 trace,给出五条可迁移的爬坡启发式,适合自建 harness 的团队参考。
最佳实践、可复现的工作流和带命令、配置的教程。
Cline 开源其开放权重模型的评测方法,并附上价值超过一千美元的爬坡分数与 trace 供下载分析。文章给出 Hill Climber's Checklist 五条启发式:设定北极星指标、量化噪声、按任务/模型/供应商拆解失败模式、不要默认更多思考更好、保留私有评测集。
推荐理由:Cline 公开评测方法与上千美元 trace,给出五条可迁移的爬坡启发式,适合自建 harness 的团队参考。
OpenAI 把驱动 Codex App、CLI 和 IDE 扩展的 harness 开源,并通过 Codex app-server 的客户端协议开放创建线程、启动轮次、接收事件和处理审批请求等能力。
推荐理由:官方公开 Codex harness 与 app-server 协议,读者可据此判断把智能体嵌入自有产品的方式与边界。
Lovable 用六个月把月访问 4200 万的 lovable.dev 从 Next.js 迁到自家 TanStack Start 托管栈,迁移期间两套框架并行运行,由代理 worker 按路由和用户分流,最终 Next.js 专属代码只占 3%。
推荐理由:Lovable 官方复盘把 90 万行代码从 Next.js 迁到自家 TanStack Start 栈,双框架并行、AI 智能体批量迁移和一次 OOM 事故的细节都可直接借鉴。
Addy Osmani 介绍自己每天并行运行 5 到 10 个智能体、通常同时最多 5 个的工作方式,并把循环工程拆成 Claude Code 的两种原语:goal 用于把单个有界任务推进到可验证的完成标准,loop 按固定间隔重跑提示词,类似 cron。
推荐理由:作者把并行跑 5 到 10 个智能体的日常拆成 goal 与 loop 两种原语,并给出可复用的验证 Skill 与停止条件写法。
作者用 tapes 记录并导出团队最近 500 个 Claude Code 会话,按工具名和参数做指纹统计,发现同一会话内完全重复的工具调用只占 3.6%(932/25587),真正的开销在别处。
推荐理由:作者审计 500 个 Claude Code 会话,把成本拆成会话内、会话间与会话周边三类,给出可复用的排查方法。
Spotify 平台团队分享了后台编码智能体 Honk 的演进过程,它从替换迁移脚本起步,逐步接入构建与测试验证,把合并 PR 的节奏从 3 个月 1000 个提升到 10 天 1000 个。
推荐理由:Spotify 团队复盘 Honk 从脚本迁移到后台编码智能体的演进,重点讲验证与标准化如何决定生成代码能否合并。
OpenAI Codex Cookbook 给出把 Codex 接入开发流程的一套仓库约定:用 AGENTS.md 存放持久化仓库指令,用 PLANS.md 作为阶段计划来源,再拆成 harness/build/ 下的分阶段构建文件,每个阶段写明目标、验收标准、边界和审批门禁。
推荐理由:OpenAI 官方给出用 AGENTS.md、PLANS.md 与分阶段构建文件约束 Codex 的完整目录约定,可迁移到自己的仓库。
Martin Fowler 用一个约 15 万行、几乎全由 Claude Code 和 Cursor 写成的 Rust 应用做实验,把 17,155 行的数据访问层按严格重构步骤拆分,每步后用全新子智能体执行同一个代表性改动并记录 token 消耗。
推荐理由:作者用同一改动反复跑重构前后对比,量化出重构对智能体 token 消耗的实际影响,并指出节省来自文件切分而非代码总量下降。
Anthropic 技术团队成员 Thariq Shihipar 撰文总结 Claude 5 代模型的上下文工程新规则,称已为 Claude Opus 5、Claude Fable 5 等模型删掉 Claude Code 超过 80% 的 system prompt,编码评测没有可测量的损失。
推荐理由:Anthropic 官方给出 Claude 5 代模型的上下文工程新规则,并说明如何精简 system prompt、CLAUDE.md 与 Skills。
Cline 用一条提示词启动 17 小时连续运行的编码智能体,以 GPT-5.6-Sol 为 leader 模型,把 Kimi K3 在 Terminal-Bench 2.1 上的成绩从基线 69/89(77.5%,$79)提升到确认运行 79/89(88.8%,$49.8),超过 Moonshot 自报的 88.3%。
推荐理由:Cline 用一条提示词让智能体自主完成 17 小时爬山,把 Terminal-Bench 2.1 从 77.5% 提到 88.8%,可看具体修了哪些 harness 问题。
Lovable 在内部搭建了一套进攻性安全程序,让 AI 智能体集群像人类攻击者一样探测系统入口,直到拿到可验证的漏洞证据。它用夺旗赛的思路做验证:把 flag 散布在基础设施和权限最高的产品界面中,不预埋任何漏洞,智能体取到 flag 就说明找到了真实入侵路径,而不是模型猜测。
推荐理由:Lovable 公开了用夺旗机制验证漏洞的内部攻防智能体编排方法,可迁移到自家安全测试流程。
Augment Code 提出循环工程,即设计从触发、执行、验证到完成结果的智能体循环,让智能体承担中间环节、人类只在需要判断的检查点介入。文章把循环工程与提示词工程、上下文工程分层对比,并给出触发、执行、验证、结果、改进五个阶段,以及代码评审、工单转 PR、漏洞修复、事故响应四种已在生产运行的团队级循环。
推荐理由:Augment Code 把循环工程拆成触发、执行、验证、结果、改进五阶段,并给出四种已在生产运行的团队级循环形态。
Addy Osmani 提出软件工厂由 loop、harness、factory 三层构成,工厂不是更聪明的智能体,而是多个带 harness 的 loop 汇入一个评审门禁、由人掌控外层循环。
推荐理由:作者把软件工厂拆成 loop、harness、factory 三层,并指出验证而非生成才是真正的瓶颈。
作者 ykev 发布一份分步指南,教用户把闲置 Mac 变成 Claude Code 可完全控制、开启 computer use 的常驻机器,可从手机 Claude app 或主 Mac 经 SSH 操作。
推荐理由:作者把闲置 Mac 改造成 Claude Code 常驻控制机,给出从 SSH、免密 sudo 到 computer use 的完整步骤,可迁移到任意两台机器。
作者以在 Stripe 参与首次 code yellow 的经历为例,指出多数 code red 结束后只留下复盘和疲惫的工程师,指标重新无人维护。他认为 code red 应留下一个维护循环,并可用 OpenAI Codex 的 /goal 命令把一次性编码请求变成带明确完成标准的持续目标,让持久化智能体集群持续观察指标、生成干预并请求人工审核。
推荐理由:作者结合 Stripe code yellow 经历,提出用 Codex 的 /goal 把一次性抢修变成长期维护循环,可迁移到 SLO 治理。
AI Hero 的 skills 仓库发布 v1.1,把 /to-prd 重命名为 /to-spec,将 /to-plan 和 /to-issues 合并为 /to-tickets,并新增 /wayfinder、/research、/prototype 等 Skill。
推荐理由:作者把 grilling 到部署的完整 Skill 流程讲清楚,并给出重命名、合并和新增 /wayfinder 的迁移命令,适合想搭 AI 开发工作流的人参考。
Martin Fowler 在 M3 Max 48GB 和 M5 Pro 64GB 上实测 Qwen3.6 35B MoE、Gemma 4 31B/26B、Qwen Coder Next 80B 等本地小模型的智能体编码能力,按内存、速度、工具调用、代码正确性、上下文、任务复杂度、代码质量逐层筛选。
推荐理由:作者用两个具体任务对比多款本地小模型的智能体编码表现,并给出可复用的任务选择标准。
Claude Code 团队把 AI 智能体的循环定义为不断重复执行工作周期直到满足预设停止条件,并按触发方式、停止条件、所用基础指令和适用任务四个维度分成回合制、目标导向、基于时间和主动式四类。
推荐理由:Claude Code 团队把循环拆成回合制、目标导向、基于时间和主动式四类,并给出各自的触发、停止与 token 控制方式。
作者 Jesse Vincent 在 Prime Radiant 用 Claude Code 通过 Slackline 命令行 Slack 客户端与自家智能体 Ada 协作,让 Claude 提出改动、Ada 评审并测试、Claude 再部署更新,形成智能体互相评审的开发循环。
推荐理由:作者用两个智能体互相评审、测试、部署的循环,展示了一种可迁移的智能体协作开发模式。
Lovable 一名工程师从今年 1 月到 6 月把个人 token 花费从每月约 600 美元推到 5 月的约 2.5 万美元、累计约 8.5 万美元,同时把每周合并 PR 数从 20-30 个提升到 150 个以上。
推荐理由:作者公开了自己每月约 2.5 万美元 token 的智能体开发配置,包括风险分级、多智能体评审和上下文管理,可迁移到其他团队。