GitHub 发布 AI 代码评审开放基准 ReviewBench
GitHub 发布代码评审离线基准 ReviewBench,基于 1.039 亿个 GitHub PR 的分布特征,构建了覆盖 19 种语言、219 个公开 PR 的评测集,并公开数据集、评分规则与 LLM 评审模型配置。
推荐理由:GitHub 公开了 AI 代码评审基准的数据集、评分规则与评测入口,读者可据此对比不同评审智能体。
GitHub 发布代码评审离线基准 ReviewBench,基于 1.039 亿个 GitHub PR 的分布特征,构建了覆盖 19 种语言、219 个公开 PR 的评测集,并公开数据集、评分规则与 LLM 评审模型配置。
推荐理由:GitHub 公开了 AI 代码评审基准的数据集、评分规则与评测入口,读者可据此对比不同评审智能体。
AI Hero Skills 发布 v1.3,新增 /implement-spec、/pr、/retro 三个技能,把主流程从 /grill-with-docs → /to-spec → /to-tickets 延伸到实现、PR 和复盘。
推荐理由:作者把技能集补成从写 spec 到 PR、复盘的完整链路,并给出各环节的取舍与已知粗糙处。
i had a lot of fun chatting with @mattpocockuk today about how i was able to land 2,500 PRs last month! Matt is a wonderful interviewer so i think the interview turned out really interesting both of our skill plugins work great together, so i recommend giving both a try and picking the best skills that suit your workflow https://www.youtube.com/watch?v=MN9dGgmLyso
推荐理由:宝玉借 Lauren Tan 月并 2500 个 PR 的实践,说明不逐个 Review 的前提是验证 Skill 与规则约束,并给出自己的适用条件。
Lovable 发布 Chats,一个运行在工作区层级、可跨项目对话并触发构建的智能体,确认改动后会把任务交给项目里的 builder 智能体并把进展带回对话。
推荐理由:Lovable 公开 Chats 背后的轨迹、收件箱与激活三层架构,可迁移到自建多智能体编排。
Cursor 发布 Rollouts 和 Security Review 两个 bot,均面向团队版和企业版开放。
推荐理由:官方给出两个 bot 的监控与安全审查流程,读者可据此判断能否接入现有交付链路。
Lovable 上线 Opus 5.5,官方称其与 Opus 5 结果持平,但完成步数减少三分之一到一半。在 Lovable 内部基准上,Opus 5.5 在 0-to-1 构建和迭代改代码两项与 Opus 5 打平,验证纪律一项高出 4% 到 6%;各档推理强度下每任务步骤数减少 26% 到 57%,输入 token 减少 21% 到 59%,差异在 95% 置信水平上显著。
推荐理由:Lovable 官方给出 Opus 5.5 与 Opus 5 在步骤数和 token 上的对比数据,可据此判断构建效率的实际变化。
Lovable 发布用 Rust 从零实现的预览引擎 OJ,它读取现有 vite.config.ts 并通过兼容层运行真实 Vite 插件,单个二进制、不向项目安装工具链。
推荐理由:Lovable 用 Rust 重写预览引擎 OJ,给出与 Vite 的冷启动和内存对比,以及生产环境灰度数据。
Cline 发布开源桌面应用 Cline Desktop 的早期版本,把原本在 VS Code 扩展和 CLI 中的智能体运行框架搬进独立工作区,支持并行会话、定时任务和用于扩展工具与集成的 Marketplace。
推荐理由:官方给出桌面端的能力边界与开放入口,读者可据此判断它是否适合承接多智能体并行任务。
OpenAI 官方博客针对 GPT-6 Astra 给出 Skills、AGENTS.md 和任务提示词的调整建议:Skill 描述要尽量短且明确适用场景,多流程 Skill 用根文档做最小路由,避免把 Skill 写成过于具体的步骤清单。
推荐理由:OpenAI 官方给出 GPT-6 Astra 下 Skills、AGENTS.md 与提示词的清理方法,可迁移到现有仓库配置。
Cursor 推出「项目」功能,用于承接一项功能、一次迁移或一个完整应用这类长周期工作,可在数月内保持上下文并把任务委派给成千上万个子智能体。项目由云端智能体驱动,协调智能体不写代码,只负责规划、分派并交回成果,需要本机测试时再启动本地智能体;每个项目维护一组在云端和本地机器间同步的文件,持续积累研究成果、artifacts 和对代码库的了解。
推荐理由:官方给出项目式多智能体协作的上下文共享与自动触发机制,可据此判断长周期任务如何被接管。
GitHub 在 Copilot CLI 中以研究预览形式推出 Project HydraFusion,通过运行时编排在多个提供商的模型间选择执行方案,用户像选普通模型一样选择它,按各模型标准费率计费。
推荐理由:GitHub 官方给出 HydraFusion 的三种编排模式与三项基准的成本质量对比,可据此判断多模型编排在真实编码任务中的取舍。
作者在 Codex 中用 Astra 构建了太空探索游戏 Void Explorer,包含 2,048 个恒星系和超过 10,000 个程序化生成的行星,并分享了从提示词到架构、测试和性能测量的完整流程。
推荐理由:作者用 Astra 在 Codex 中做完整游戏,展示了从提示词到测试、性能测量的可迁移协作流程。
Cline 把 VS Code 扩展从约 76,000 行单体核心迁移到 Cline SDK,并自建灰度发布机制:一个安装包内打包 loader、legacy 和 next 两套扩展,由 PostHog 功能开关按百分比决定激活哪套,崩溃时自动回退到 legacy,开关可随时降到 0% 作为 kill switch。
推荐理由:Cline 官方复盘如何把 1100 万用户的 VS Code 扩展迁到新 harness,含灰度机制与前后指标对比。
GitHub Copilot 团队复盘了四项降低 AI 编码成本的改动,核心原则是按完整任务而非单次工具调用衡量效率。
推荐理由:GitHub Copilot 团队复盘四项降本改动,并给出可迁移的评估方法:按完整任务而非单次工具调用衡量成本。
Cursor 支持自托管机器,代码库、构建产物和密钥都保留在自有基础设施的内部机器上,由智能体在本地处理工具调用。My Machines 用于把单台笔记本或 VM 接入个人工作流,团队池则是面向团队或企业的具名 worker 队列,容量随请求扩容、worker 断开时缩容,池不与代码仓库绑定,并支持闲置机器休眠后在重连窗口内恢复。
推荐理由:官方给出自托管机器的池化调度与沙箱接入方式,读者可据此判断工具执行能否留在自有网络内。
Cline 让八个模型在自家 harness 里做 IMO 2026 六道题,证明由 GPT-5.5 和 Claude Opus 5 双盲按 0–7 分制评分、Gemini 3.1 Pro 仲裁,金牌线为 29 分。
推荐理由:Cline 用同一套 harness 盲评八个模型做 IMO 2026,给出分数与单次成本对照,可看开源权重模型的实际性价比。
Cline 团队用 Cline SDK 搭了一个代码审查智能体,把审查拆成 review 与 judge 两段 agent 循环,再由驱动脚本把存活的问题以一条 COMMENT 事件批量提交到 GitHub PR。
推荐理由:完整拆解一个代码审查智能体的插件、Hook 与两段式循环,可迁移到其他自动化审查场景。
Lovable 官方复盘了把平台应用接入第三方服务的做法:先支持 MCP 作为聊天内取上下文的临时方案,再自建 app connectors,用 Connector Gateway 代理已发布应用与第三方 API 之间的请求,由它持有凭证和刷新逻辑,部署后的应用不接触密钥。
推荐理由:Lovable 官方复盘如何把连接器做成可复用基础设施,对做第三方集成和凭证管理的团队有参考价值。
OpenAI 工程师用 Codex 配合开源 notebook 应用 Runme 自动化重复性工作,例如跑模型评测。做法是在 Runme notebook 里写目标单元格,让 Codex 读取目标、写出计划并等待人工审批后再执行,过程中记录命令、输出和结论,包括走过的死路。
推荐理由:作者用 Runme notebook 加 WebMCP 把评测流程交给 Codex,读者可借鉴其目标、审批与上下文沉淀方式。
OpenAI 推出 Daybreak,把 ChatGPT、Codex Security 和开源 Codex Security CLI 组合成一套安全防御工作流,覆盖 PR 合并前审查、仓库与漏洞积压排查、CI 定期检查。
推荐理由:官方给出 Codex Security 从 PR 审查、仓库扫描到 CLI 批量扫描的完整用法,可据此判断如何接入现有安全流程。