AI Hero Skills v1.3 发布:新增 /implement-spec、/pr、/retro,CONTEXT.md 改名 GLOSSARY.md
AI Hero Skills 发布 v1.3,新增 /implement-spec、/pr、/retro 三个技能,把主流程从 /grill-with-docs → /to-spec → /to-tickets 延伸到实现、PR 和复盘。
推荐理由:作者把技能集补成从写 spec 到 PR、复盘的完整链路,并给出各环节的取舍与已知粗糙处。
AI 编程工具的版本发布和功能更新。
AI Hero Skills 发布 v1.3,新增 /implement-spec、/pr、/retro 三个技能,把主流程从 /grill-with-docs → /to-spec → /to-tickets 延伸到实现、PR 和复盘。
推荐理由:作者把技能集补成从写 spec 到 PR、复盘的完整链路,并给出各环节的取舍与已知粗糙处。
Earendil 团队于 10 月 1 日发布 Agent Harness Pi 1.0,GitHub 仓库约 11.1 万 Star、1.4 万 Fork,同时推出实验性新包 Pi Durable。
推荐理由:Pi 1.0 与 Pi Durable 把检查点、幂等提交、所有权树等分布式概念搬进 Agent 运行时,可据此判断长时运行 Agent 的工程取舍。
开源项目 Paseo 把 Claude Code、Codex、OpenCode 和 Pi 等命令行 Agent 收进同一个管理界面,所有 Agent 仍跑在本地电脑上,目前已有 18700+ Star。
推荐理由:原文展示了把多个命令行 Agent 收进同一界面并跨 Agent 交接任务的做法,适合同时跑多个 Agent 的开发者参考。
Lovable 发布 Chats,一个运行在工作区层级、可跨项目对话并触发构建的智能体,确认改动后会把任务交给项目里的 builder 智能体并把进展带回对话。
推荐理由:Lovable 公开 Chats 背后的轨迹、收件箱与激活三层架构,可迁移到自建多智能体编排。
Cursor 发布 Rollouts 和 Security Review 两个 bot,均面向团队版和企业版开放。
推荐理由:官方给出两个 bot 的监控与安全审查流程,读者可据此判断能否接入现有交付链路。
Lovable 上线 Opus 5.5,官方称其与 Opus 5 结果持平,但完成步数减少三分之一到一半。在 Lovable 内部基准上,Opus 5.5 在 0-to-1 构建和迭代改代码两项与 Opus 5 打平,验证纪律一项高出 4% 到 6%;各档推理强度下每任务步骤数减少 26% 到 57%,输入 token 减少 21% 到 59%,差异在 95% 置信水平上显著。
推荐理由:Lovable 官方给出 Opus 5.5 与 Opus 5 在步骤数和 token 上的对比数据,可据此判断构建效率的实际变化。
Lovable 发布用 Rust 从零实现的预览引擎 OJ,它读取现有 vite.config.ts 并通过兼容层运行真实 Vite 插件,单个二进制、不向项目安装工具链。
推荐理由:Lovable 用 Rust 重写预览引擎 OJ,给出与 Vite 的冷启动和内存对比,以及生产环境灰度数据。
Cline 发布开源桌面应用 Cline Desktop 的早期版本,把原本在 VS Code 扩展和 CLI 中的智能体运行框架搬进独立工作区,支持并行会话、定时任务和用于扩展工具与集成的 Marketplace。
推荐理由:官方给出桌面端的能力边界与开放入口,读者可据此判断它是否适合承接多智能体并行任务。
Cursor 推出「项目」功能,用于承接一项功能、一次迁移或一个完整应用这类长周期工作,可在数月内保持上下文并把任务委派给成千上万个子智能体。项目由云端智能体驱动,协调智能体不写代码,只负责规划、分派并交回成果,需要本机测试时再启动本地智能体;每个项目维护一组在云端和本地机器间同步的文件,持续积累研究成果、artifacts 和对代码库的了解。
推荐理由:官方给出项目式多智能体协作的上下文共享与自动触发机制,可据此判断长周期任务如何被接管。
GitHub 在 Copilot CLI 中以研究预览形式推出 Project HydraFusion,通过运行时编排在多个提供商的模型间选择执行方案,用户像选普通模型一样选择它,按各模型标准费率计费。
推荐理由:GitHub 官方给出 HydraFusion 的三种编排模式与三项基准的成本质量对比,可据此判断多模型编排在真实编码任务中的取舍。
Cursor 支持自托管机器,代码库、构建产物和密钥都保留在自有基础设施的内部机器上,由智能体在本地处理工具调用。My Machines 用于把单台笔记本或 VM 接入个人工作流,团队池则是面向团队或企业的具名 worker 队列,容量随请求扩容、worker 断开时缩容,池不与代码仓库绑定,并支持闲置机器休眠后在重连窗口内恢复。
推荐理由:官方给出自托管机器的池化调度与沙箱接入方式,读者可据此判断工具执行能否留在自有网络内。
OpenAI 推出 Daybreak,把 ChatGPT、Codex Security 和开源 Codex Security CLI 组合成一套安全防御工作流,覆盖 PR 合并前审查、仓库与漏洞积压排查、CI 定期检查。
推荐理由:官方给出 Codex Security 从 PR 审查、仓库扫描到 CLI 批量扫描的完整用法,可据此判断如何接入现有安全流程。
Cursor 更新云端智能体和 Cursor harness,让云端智能体可以订阅事件源,在 PR、Slack 讨论串或定时任务有新动态时恢复运行,并持续推进直至完成,修复 CI 问题、处理 bot 评论。
推荐理由:云端智能体从单次执行转向订阅事件、持续跟进 PR 与 Slack 讨论串,读者可据此判断自动化边界的变化。
OpenAI 把驱动 Codex App、CLI 和 IDE 扩展的 harness 开源,并通过 Codex app-server 的客户端协议开放创建线程、启动轮次、接收事件和处理审批请求等能力。
推荐理由:官方公开 Codex harness 与 app-server 协议,读者可据此判断把智能体嵌入自有产品的方式与边界。
Augment Code 将其 Cosmos 评审系统从代码评审扩展到完整的 PR 到合并闭环,新增 Verifier、PR Fixer、Review Dashboard 和 cosmos approve 四项能力,由多个专职 Expert 分别负责风险分析、逐行正确性评审、设计评审、运行时验证和修复。
推荐理由:Augment 把代码评审扩展成覆盖修复、验证与审批的 PR 到合并闭环,读者可据此判断多智能体分工的落地方式。
Anthropic 宣布从 8 月 14 日起,Pro、Max 和 Team 套餐的新会话默认运行 auto mode,并停止对分类器额外 token 开销收费;Enterprise、Claude API、AWS、Bedrock、Google Cloud 和 Microsoft Foundry 暂时保持可选,计划下个月改为默认。
推荐理由:Anthropic 公布 auto mode 的安全评测数据与内部拦截案例,可据此判断默认权限模式对现有工作流的影响。
Vercel 发布新版 v0 API,提供对 v0 应用生成智能体的可编程、无头访问:发送提示词后 v0 生成应用、在 Vercel Sandbox 中启动开发服务器,并返回可嵌入自有界面的预览 URL,该 API 已正式可用。
推荐理由:v0 把应用生成能力开放成 API,读者可据此判断如何把它接进自己的产品或智能体流程。
Terminal-Bench 团队发布一批 Harbor 新功能,让数据集可以按版本发布、排行榜可迁移到新版本,做法是复用、重评或重跑 trial。任务采用语义化版本:补丁级改动直接复用旧结果,验证器改动只需重评已保存产物,只有显著改变智能体环境的重大改动才需要重跑;数据集版本跟随任务中最大的版本号,排行榜通过 diff 只重跑重大改动任务。
推荐理由:Terminal-Bench 团队把基准当软件来维护,给出任务语义化版本与排行榜升级的具体机制,可迁移到自建评测流程。
OpenAI 为 Codex Code Review 加入自定义仓库规则能力,可在 AGENTS.md 中写入评审指引,Codex 在评审时应用相关规则并在结论中引用出处。官方评测显示,规则引导版本找回了 98% 的必需自定义问题,基线对照组为 58.3%。规则建议从兼容性要求、数据边界这类非显而易见的不变量入手,仓库级规则放根目录、服务级规则放对应目录,格式和机械检查仍交给 CI。
推荐理由:官方给出 Codex Code Review 自定义规则的能力、写法与评测数据,可判断如何把团队评审经验固化进 AGENTS.md。
Lovable 上线 agent integrations,任何公开已发布的 Lovable 应用都能添加 MCP server,从而被 ChatGPT、Claude 等 AI 工具直接调用。
推荐理由:Lovable 把已发布应用接入 MCP,读者可据此判断自家应用如何被 ChatGPT、Claude 直接调用。