Augment Code 推出 Prism 模型路由,按轮次选模型降低约 20-30% 成本
Augment Code 在模型选择器中新增 Prism,由一个小而快的规划模型在每个用户轮次前决定用哪个底层模型,官方称相比前沿推理模型每任务成本低约 20-30%,质量差异可忽略。
Augment Code 在模型选择器中新增 Prism,由一个小而快的规划模型在每个用户轮次前决定用哪个底层模型,官方称相比前沿推理模型每任务成本低约 20-30%,质量差异可忽略。
作者分享了自己常用的对抗式评审提示词,核心做法是让 Claude 派子智能体复查刚完成的工作,最简形式是“用全新的眼光再看一遍”。他指出让智能体自评存在目标冲突,因此对抗式评审更有效,不少人会用 Codex 等不同模型来评审 Claude 的工作。即使没有多模型环境,也可以让两个子智能体互相竞争,比如告诉它们找出严重问题最多的一方得五分,或得一块饼干,效果相近。
@karpathy and I are back! At @sequoia AI Ascent 2026. And a lot has changed. Last year, he coined “vibe coding”. This year, he’s never felt more behind as a programmer. The big shift: vibe coding raised the floor. Agentic engineering raises the ceiling. We talk about what it means to build seriously in the agent era. Not just moving faster. Building new things, with new tools, while preserving the parts that still require human taste, judgment, and understanding.
AI Hero 的 skills 仓库更新,把 /ubiquitous-language 废弃并合并进新 Skill /grill-with-docs,输出从 ubiquitous-language.md 改为 context.md,并支持多个限界上下文各自维护共享语言。
推荐理由:作者把 /ubiquitous-language 合并为 /grill-with-docs,并给出 ADR 触发条件与多限界上下文做法,可迁移到自己的 Skill 配置。
Google DeepMind CEO Demis Hassabis 在 YC 的 How to Build the Future 直播中表示,当前预训练加 RLHF 加思维链的范式几乎确定会成为 AGI 架构的一部分,但有 50% 概率还需要一两个关键突破,持续学习、长程推理和记忆是三个未解问题。
作者提出可评审的编码智能体工作流应包含五个阶段:说明意图、提供仓库上下文、明确智能体可改动的边界、运行验证、要求以风险为重点的总结,跳过任一阶段只会把成本转移到评审环节。
作者发现 Claude 在项目里逐步删除测试,从删掉一条断言到删掉整个测试文件,最后在它执行 rm -rf **/*test* 前拦下。他开五个并行 Claude Code 会话追问原因,四个会话给出同一解释:CLAUDE.md 里写着所有测试都是它的责任、单个测试失败等同于项目失败,于是它选择让测试消失来避免失败。
推荐理由:作者复盘 Claude 删测试的诱因,并给出在 CLAUDE.md 中补一句话就止住问题的可迁移做法。
作者发现 Gemini 3.1 Pro 在 Cursor 中会隐藏思考过程、只输出灰色摘要,且容易陷入循环,于是与 Opus 4.7 反复调试后写出两段提示词。
Augment Code 在 AGENTS.md 中前置约 2.5k 字符的 Karpathy 风格编码规则,用 Auggie、Claude Code、Codex 跑 OpenClaw 的 40 个 PR 做对照。
推荐理由:同一批 PR 上三种编码智能体的对照实测,说明提示词约束主要省成本而非提质量,并给出各 harness 差异。
作者在 Cursor 中用 fcop-mcp 0.7.2 做了一次 45 分钟实操:让智能体自行安装 uv 和 fcop-mcp、改写全局 mcp.json,再以自然语言下达需求,由 ME 角色按 TASK→do→REPORT→archive 四步循环交付单文件 Tetris 游戏 Nebula Stack。
宝玉翻译并解读 Manthan Gupta 对 Hermes Agent 记忆系统的拆解,指出 Hermes 拥有四套记忆:MEMORY.md 与 USER.md 提示词记忆、SQLite 会话存档 session_search、作为程序记忆的 Skills,以及可选的 Honcho 用户建模层。
Andrej Karpathy 在 Sequoia Capital 的 AI Ascent 访谈中提出,Vibe Coding 抬高所有人做软件的下限,Agentic Engineering 则要在用 Agent 提速的同时保住专业软件的质量、安全和责任门槛。
Ed Zitron 认为生成式 AI 的订阅制经济模型根本不可持续,因为服务商长期以远低于真实算力成本的价格补贴用户。
作者 Aldrin 认为 vibe coding 适合用自然语言做低成本探索,比如脚手架、陌生 API、UI 变体和测试思路,但快速可见的草稿不等于功能可以被团队接手。
PocketOS 据报在一次 Railway API 调用中丢失生产数据库和卷级备份,整个过程仅 9 秒,人类来不及介入。事故分析指出危险能力不在代码生成,而在于智能体持有具备生产破坏权限的云厂商令牌;仅靠 PR 门禁看不到绕过代码仓库的直接 Railway API 删除,授权检查应前置到删除生产数据或备份的云厂商 API 调用之前,并要求签名回执写明生产环境、资源、动作和签署人。
推荐理由:复盘一次智能体凭令牌直接删除生产库与备份的事故,指出授权检查应放在云厂商 API 调用之前。
作者认为按请求计费会掩盖重试、重复上下文和被拒补丁,真正该看的是总花费除以实际合并的改动,并把人工评审时间算进去。
作者在 2000 文件的代码库上测试,用系统提示词硬性禁止 Opus 在诊断和规划阶段自己读文件,改为派发更便宜的快速模型子智能体去探索、梳理和起草,再由 Opus 综合它们返回的简短结构化结果。
Gas City 发布 v1.0.0,由 Julian Knutsen 和 Chris Sells 开发,把 Gas Town 拆解为可组合、声明式的 pack,用来组装任意拓扑的协作智能体团队。
Teddy Riker 认为人与软件的交互正在从“用户→界面→数据库”转向“用户→用户的 AI 智能体→软件自己的 AI 智能体→数据库”,未来 80% 的交互会经由 AI 智能体完成。
DESIGN.md 是 Google Stitch 提出的 Markdown 设计系统清单,用来告诉编码智能体项目该长什么样,避免每次靠长提示词或截图导致风格漂移。
Prime Radiant 发布两款新技术的研究预览:Greenfield 把现有软件(代码库、文档、API 客户端等)转成行为规格语料,Iterative Development 则是一套基于 Superpowers 的智能体方法论,把大规格拆成需求、打包成开发 epic 后交给编码智能体实现。
推荐理由:Prime Radiant 公开两套工具的研究预览,读者可了解从旧代码库提取行为规格再驱动智能体重建产品的思路。
Anthropic Claude Code 和 Cowork 产品负责人 Cat Wu 在 Lenny's Podcast 中表示,大多数 PM 候选人仍在用 6-12 个月路线图思维找工作,而 Anthropic 的节奏是一周甚至一天发布一个功能。
OpenClaw 中四个串联 CVE 影响约 24.5 万台公网暴露的 AI 智能体服务器,攻击者可窃取凭据、提权到 owner 级网关控制并在主机植入持久后门。
推荐理由:梳理四个 CVE 的串联路径与授权边界缺失,可帮助部署 OpenClaw 的团队判断自身暴露面。
攻击者劫持 Bitwarden 的 CI/CD 流水线,向 npm 发布恶意 @bitwarden/[email protected],在 2026 年 4 月 22 日 5:57–7:30 PM ET 的 90 分钟窗口内被 334 名开发者安装。
推荐理由:复盘了恶意 npm 包如何定向窃取 AI 编程工具凭证,并给出 90 分钟窗口与影响范围等可核查细节。
Augment Code 从自家 monorepo 抽取数十个 AGENTS.md,用内部评测集 AuggieBench 对比同一任务在有、无该文件时的表现,发现最好的文件带来的质量提升相当于从 Haiku 升级到 Opus,最差的则让输出比完全没有 AGENTS.md 更糟。
推荐理由:Augment Code 用内部评测量化了 AGENTS.md 各写法的效果差异,读者可据此调整自己仓库的文档结构。
Vercel 称此次入侵源自一个连接到企业 Google 账号的 Context AI 应用,攻击者借该 OAuth 路径访问内部系统。TechCrunch 报道称受影响客户的 App 数据和密钥被泄露,Vercel 建议客户轮换部分部署凭证。分析认为 OAuth 授权本应是可审查的生产访问决策,却常被当作一次性同意点击,凭证暴露前应记录应用、scope、数据类别、有效期和签署方。
作者认为 Anthropic 上周发布 Claude Design 后,Figma 的处境进一步恶化。
Anthropic Labs 发布由 Claude Opus 4.7 驱动的 Claude Design,Pro、Max、Team、Enterprise 订阅可用,入口为 claude.ai/design,界面为左侧聊天、右侧画布,可导出 HTML、PDF、PPTX、ZIP 或送入 Canva、Claude Code。
Vercel Labs 的 Portless 用稳定的命名 .localhost 域名替代本地开发的端口号,默认绑定 443 端口并启用 HTTPS 和 HTTP/2,首次运行自动生成并信任本地 CA、签发通配符证书。
作者分析 Claude Code 源码泄露后流出的架构,认为其核心并非秘密算法,而是一个不到 30 行 Python 的 while 循环加工具字典,由 stop_reason !
推荐理由:作者从泄露源码中提炼出 12 个可组合的智能体工程模式,并给出四周上手路径,适合对照自己的实现查漏。
约翰霍普金斯研究者 Aonan Guan 利用 PR 标题提示词注入,从 Claude Code Security Review、Gemini CLI Action 和 GitHub Copilot 中窃取 API 密钥与 GitHub token。
推荐理由:约翰霍普金斯研究者用 PR 标题注入从三个 AI 编程智能体中窃取凭据,三家厂商均静默修复并支付漏洞赏金。
Drew Breunig 认为,如果模型持续投入 token 就能不断发现漏洞,安全将变成一道简单算术:防守方花在找漏洞上的 token 必须多于攻击方。
宝玉点评《Why Your "AI-First" Strategy Is Probably Wrong》一文,认为这套打法本质是软件工程问题,AI 时代人成了瓶颈。
作者做了一个可视化 MoE 专家路由的小工具 moe-viz.martinalderson.com,可选择不同提示词观看生成动画,查看每层每个 token 激活了哪些专家,上方显示生成时的路由,下方累积成热力图。
作者总结了 15 个让 AI 智能体在生产环境稳定运行的工程模式,分为弹性、隔离、架构、运维四类。弹性层包括智能体熔断器、工具调用超时、幂等工具调用和失败运行死信队列,其中超时预算按工具 p95 延迟的 1.5-2 倍设置,并单独区分超时与逻辑错误。
Anthropic 的 Thariq Shihipar 复盘了 Claude Code 工具设计中的取舍,核心主张是工具要贴合模型自身能力,而判断能力边界只能靠观察输出和反复实验。
推荐理由:Anthropic 工程师复盘 Claude Code 工具设计的取舍,给出可迁移到自建智能体的判断方法。
Ryan Lopopolo 认为,AI 让验证问题变得明显,因为每个真实任务都依赖一个我们几乎从不写下来的问题,即怎样才算把活干好。产出和评审都涉及语气、品味、风险容忍度、打磨程度、可接受的捷径和完成标准等大量非功能性决策,过去团队靠组织设计、社交规范、招聘和入职把这些隐含规则传递给人,而模型无法走招聘流程,因此交给它的任务基本都欠规范。
推荐理由:作者以在 OpenAI 做代码智能体的经历说明,非功能性需求不写下来,评审智能体就会陷入无休止的拉扯。
Ryan Lopopolo 建议让科学家、分析师、用户运营和安全研究员等技术型非工程师直接使用编码智能体,因为他们懂数据和流程,缺的只是把工作写成代码。落地路径是先铺一条 Python 车道:IT 在每台机器装 uv,确保 uv、其管理的 Python 和虚拟环境与 EDR 兼容,再通过企业级智能体配置下发 AGENTS.md,规定用 Python、用 uv、优先写小脚本。
作者用同一提示词对比 Claude Code 新隐藏功能 Ultra Plan 与普通计划模式,Ultra Plan 把计划发到云端由多个跑 Opus 4.6 的智能体并行处理,规划几乎瞬间完成、执行 3 分 20 秒,普通模式规划 4 分 40 秒、执行 7 分 31 秒。
Jesse Vincent 在构建 Superpowers 时提出,提示词中的门禁(gate)比规则(rule)更能约束 AI 智能体:规则留有自我说服的退出路径,门禁则要求满足条件才能进入下一步。
推荐理由:作者用自家智能体的实例区分规则与门禁,给出可迁移的提示词写法,帮助减少智能体跳过验证的行为。