Ryan Lopopolo 如何为 Homelab 做 Harness Engineering
Ryan Lopopolo 把 Homelab 的 agent 质量保障主要落在文档上:文档站点按关注点组织清单、拓扑、工作负载、runbook 和维护约定,AGENTS.md 只提供索引,agent 按需加载详细操作模型。当在线指令遵循不够时,这些文档会被接入一个很薄的每周自动化来收敛仓库,让正确的上下文持久化并闭环。
Awaiting translation
Ryan Lopopolo 把 Homelab 的 agent 质量保障主要落在文档上:文档站点按关注点组织清单、拓扑、工作负载、runbook 和维护约定,AGENTS.md 只提供索引,agent 按需加载详细操作模型。当在线指令遵循不够时,这些文档会被接入一个很薄的每周自动化来收敛仓库,让正确的上下文持久化并闭环。
Awaiting translation
ccusage 通过读取本地会话日志,在终端直接输出 Claude Code 的 token 用量和费用明细,无需 API key 或代理配置。它把未缓存输入、缓存写入和折扣后的缓存读取分开统计,支持按会话、日、周、月查看,可用 npx ccusage@latest 直接运行,缓存过定价数据后加 --offline 可避免联网。
Awaiting translation
作者 Ville Pispa 记录了一次针对 .cursor/ 配置的压缩实践:把 alwaysApply 规则里的完整流程、表格和理由搬到按需读取的 docs 文档,规则只保留触发条件和链接,再用 2-4 字符的速记码(如 PCB 表示 pre-change backup)替代重复短语。
Awaiting translation
ETH Zurich 团队用带与不带 AGENTS.md 的测试项目跑编码智能体,发现提供上下文文件通常不提升任务成功率,推理成本平均增加超过 20%,该结论在不同 LLM、编码智能体和 LLM 生成与开发者提交的上下文文件上都成立。
Awaiting translation
这个插件把 Birgitta Boeckeler 在 martinfowler.com 提出的 harness engineering 落地为可安装工具,用确定性工具、智能体评审和周期性熵检查约束 AI 生成的代码。
Awaiting translation
Addy Osmani 建议每隔几周运行一次 Claude Code 的 /doctor,单独用 /memory 检查记忆,并让每条指令重新证明自己的价值,因为模型、harness 和代码库都在变,旧配置会留下。
Awaiting translation
Why it matters: 作者结合自身配置审计经验与近期研究,说明 Agent 配置文件为何会腐化,以及如何按节奏清理。
宝玉以给字幕转录翻译 App BaoCut 加远程转录功能为例,复盘了自己的 AI 原生开发流程:可行性分析、设计文档、高精度原型、编码实现、测试验证五步一个没少,但执行主体从人变成 Agent,人只在关键路径做确认和决策。
Awaiting translation
作者放弃浏览器“另存为”和 MHTML 归档,改用 wget -m -k -E -p -np 把目标站点下载成自包含的本地镜像,保留 CSS 动画、字体和资源,并把链接改写为本地路径。
Awaiting translation
Paper Compute 团队审计了 6 月 16 日至 8 月 14 日两个月的 766 次真实 Agent 会话,其中只有 29 次被沉淀为可复用 Skill,其余 737 次留在会话库里。
Awaiting translation
作者从 2025 年中开始尝试用 LLM 写代码,发现生成代码质量差、需要反复重复同样的风格建议,于是把重复出现的建议写进项目根目录的 agent.md,由编码工具在会话开始时注入提示词。
Awaiting translation
Adversa AI 披露一种加密上下文注入手法:攻击者提供密文、密钥和解密指令,输入过滤只能看到加密内容,模型在初始安全边界之后还原出明文指令,进而访问私有对话上下文或把数据外传,演示了 Grok 聊天数据泄露和 Gemini 的护栏绕过。
Awaiting translation
Armin Ronacher 撰文解释推理轨迹的本质:模型被训练在最终回答前把思考写入 scratchpad,GPT-OSS 的 Harmony 格式用 analysis 与 final 标记区分,推理内容与最终答案使用相同文本。
Awaiting translation
Cursor has updated its cloud agents and Cursor harness so cloud agents can subscribe to event sources, resume when there's new activity in a PR, Slack thread, or scheduled task, and keep going until the work is done—fixing CI failures and handling bot comments.
Why it matters: Cloud agents are moving from one-shot runs to subscribing to events and following up continuously on PRs and Slack threads, which gives readers a way to judge how the boundaries of automation are shifting.
Context7 MCP's custom AI instruction feature returns unsanitized attacker content alongside normal document queries, carrying injected instructions into the coding agent's trusted context and tricking it into reading keys, exfiltrating data, or deleting files.
Why it matters: The material breaks down how Context7 MCP injects prompts through custom instructions, and offers a mitigation approach: adding an authorization gate at the tool invocation boundary.
Drew Breunig 提出用「情境化智能体」来定义 harness:Harrison Chase 所说的系统提示词、规划工具、文件系统和子智能体构成开发者控制的核心循环,harness 则管理循环之外的世界,包括会话、环境、仓库、记忆、Skills、团队、组织和模型这些由内向外、使用人数递增而变动递减的层次。
Awaiting translation
Anthropic 官方博客拆解 Claude Code 会话的 token 成本:请求分 prefill 与 decode 两阶段,输出 token 单价约为输入的 5 倍,缓存读取为输入价格的 0.1x、写入最高 2x。
Awaiting translation
Baruch Sadogursky 与 Patrick Debois 在 InfoQ 演讲中用 Claude Code 现场演示:把全部项目文档塞进 CLAUDE.md 后,给接口加错误处理会因约定冲突返回 500,改用按描述懒加载的 Skill 后同一提示词通过测试。
Awaiting translation
Why it matters: 两位作者用现场演示拆解上下文工程的四类反模式,并给出 Skill、检索通道、外部记忆与评测的对应做法。
DeepSeek AI 与北京大学在论文中提出时空可组合性,形式化了 DeepSeek Harness 底层开源 TypeScript 微内核 Cordis 的架构。
Awaiting translation
作者指出在 Cursor 的 Plan Mode 或智能体工作流中用 backlog.md 存任务会带来三个问题:Markdown 复选框无法实时跟踪进度、非编码成员看不到智能体在做什么、长任务列表污染上下文窗口。
Awaiting translation
作者用 tapes 记录并导出团队最近 500 个 Claude Code 会话,按工具名和参数做指纹统计,发现同一会话内完全重复的工具调用只占 3.6%(932/25587),真正的开销在别处。
Awaiting translation
Why it matters: 作者审计 500 个 Claude Code 会话,把成本拆成会话内、会话间与会话周边三类,给出可复用的排查方法。
作者把 Hermes Agent 装在 VPS 上,因为只在本地跑的工作流会随 Mac 休眠而中断,首个可用版本花了一天调通。他把 Hermes 设计成网关加四个循环,用 ~/.hermes/memories/ 下 2,200 字符的 MEMORY.md 和 1,375 字符的 USER.md 做有界记忆,会话存 SQLite 并用 FTS5 搜索,Skill 按需加载。
Awaiting translation
有开发者发现,业务代码逻辑稍复杂后,让刚写完代码的 AI 在同一会话中自查漏洞,它大多判定代码不存在 Bug;新建空白会话重新提交审查,AI 往往能找出各类问题,更换另一款大模型检测还能发现更多细节问题,其中不少是影响不大的次要瑕疵。
Awaiting translation
Paper Compute 推出开源代理 tapes,它位于 agent harness 与推理服务之间,记录流经的全部内容,包括系统消息、输入、思考块、工具调用与结果、输出。
Awaiting translation
作者认为把 ASD-STE100、Orwell 六规则、GovUK 等写作规范直接写进全局 CLAUDE.md 或 AGENTS.md,会让模型在推理时同时满足词汇约束,从而降低思考质量。
Awaiting translation
作者深度体验几天 DeepSeek V4 Flash 0731 正式版后总结:便宜到跑批处理、Agent 循环和几十轮对话账单基本无感,速度快到配合 Agent 工具循环每步几秒内完成,1M 上下文可容纳整个仓库和完整对话历史、无需频繁 compact,结合 Cache 打折长上下文成本还能再降。
Awaiting translation
tikalk/adlc-team-skills 发布一套 Agent Skills,通过 session_start 钩子注入约一百 token 的团队规则索引,任务匹配时再按需加载完整规则,规则存放在可 PR 评审的 team-ai-directives 仓库中。
Awaiting translation
Hacker News 上一位用户发帖追问:Claude Code、Codex 等框架为何要引入 Skill 概念,而不是用组织良好的 Markdown 文档加 AGENTS.md 指向文件。
Awaiting translation
anyaa-labs 在 GitHub 发布 agent-architect Skill,支持 Claude Code 和 Codex,用于评估和设计多智能体系统。
Awaiting translation
一位用 Cursor 和 Claude Code 构建并运营真实产品的开发者总结出编程提示词的四个要点:先给上下文再派任务、只交办一个窄任务、写明硬性约束、让 AI 自证结果。他以给 POST /api/submit 路由加限流为例,对比了"给 API 加限流"这类模糊提示与点名文件、复用现有 Redis 客户端、禁止新增依赖、限定 10 次/分钟并只返回 diff 不提交的写法。
Awaiting translation
作者在 Claude Max 额度 30 分钟内被烧光后做了系统梳理,指出智能体编程的 token 成本主要不在代码生成,而在重复读取同一批文件、智能体重新发现已有上下文、每个任务再派生新任务,以及每一步都默认用最贵的模型。他把成本追踪工具、缓存与路由模式、上下文管理实践、研究和基准整理成一个开源目录,共 200+ 条,每条附一手来源和核验日期,采用 CC-BY 许可,并邀请社区补充修正。
Awaiting translation
面对 GitHub 等基础设施被 AI 智能体流量压垮的现状,作者主张从 tokenmaxxing 转向 valuemaxxing,用任务完成数、节省时间和避免返工来衡量价值,而非 token 消耗量。他指出 Claude Code 会话默认 30 天后删除,导致已付费的上下文白白流失,并认为 Skill 是比 markdown 文件更好的上下文路由方式,但大规模管理 Skill 仍无解。
Awaiting translation
作者用 Cursor 和 Claude Code 实际发布过多个产品,把 AI 建应用拆成八个阶段,指出智能体擅长搭脚手架、写界面和生成 CRUD,但选技术栈、判断界面是否正确、防止脏数据、真机测试、域名 DNS 密钥和线上排错仍要人来做。
Awaiting translation
Thariq Shihipar, a member of Anthropic's engineering team, wrote up the new context engineering rules for Claude 5, saying the team has cut over 80% of the system prompt from Claude Code for models like Claude Opus 5 and Claude Fable 5, with no measurable loss on coding evals.
Why it matters: Anthropic lays out the new context engineering rules for Claude 5 and explains how to trim the system prompt, CLAUDE.md, and Skills.
Drew Breunig 发布 drskill,用于评估全局或项目环境中的 Skill 与 MCP,可通过 uv tool install drskill 或 pip install drskill 安装后运行 drskill scan。
Awaiting translation
作者认为托管智能体是 2026 年初各平台共同押注的方向,Anthropic、OpenAI、Google、AWS 都在推出同类产品,其核心特征是异步执行、面向生产环境的最小权限隔离和可并行扩展。
Awaiting translation
Prime Radiant 在构建智能体框架 Sen 时引入 Therapist 模式,让一个独立子智能体成为唯一有权修改 Sen 人格的角色。
Awaiting translation
Addy Osmani proposes that a software factory has three layers—loop, harness, and factory. The factory isn’t a smarter agent; it’s multiple loops with harnesses feeding into a single review gate, with humans controlling the outer loop.
Why it matters: The author breaks the software factory into three layers—loop, harness, and factory—and points out that validation, not generation, is the real bottleneck.
Ryan Lopopolo 提出 Harness Engineering,即把选定的模型和编码智能体当作黑盒保持不变,只改进上下文和工具这两个外部杠杆,从而提升智能体输出。
Awaiting translation
作者日常同时使用 Claude Code、Codex、Gemini CLI 和 Pi Agent,两个月下来 Pi 承担了约 40-50% 的日常智能体交互,主要用于其他工具不合适的胶水任务和快速探索。
Awaiting translation
作者提出 coding agent 等于模型加 harness,harness 指模型之外的所有代码、配置与执行逻辑,包括提示词、工具、上下文策略、Hook、沙箱、子智能体和反馈回路。
Awaiting translation