跳到正文
10/6 · 周二

最新精选

今天10/6周二
  1. GitHub Blog · Copilot66

    GitHub 发布 AI 代码评审开放基准 ReviewBench

    GitHub 发布代码评审离线基准 ReviewBench,基于 1.039 亿个 GitHub PR 的分布特征,构建了覆盖 19 种语言、219 个公开 PR 的评测集,并公开数据集、评分规则与 LLM 评审模型配置。

    推荐理由:GitHub 公开了 AI 代码评审基准的数据集、评分规则与评测入口,读者可据此对比不同评审智能体。

10/5周一
10/4周日
  1. 宝玉82

    宝玉结合播客内容,梳理在 SpaceXAI 做 Grok Bot 的 Lauren Tan 一个月合并 2500 个 PR 的做法:晚上让 AI 自己检查、自己合并,第二天早上再抽查,不逐个 Review。

    引用lauren@poteto

    i had a lot of fun chatting with @mattpocockuk today about how i was able to land 2,500 PRs last month! Matt is a wonderful interviewer so i think the interview turned out really interesting both of our skill plugins work great together, so i recommend giving both a try and picking the best skills that suit your workflow https://www.youtube.com/watch?v=MN9dGgmLyso

    推荐理由:宝玉借 Lauren Tan 月并 2500 个 PR 的实践,说明不逐个 Review 的前提是验证 Skill 与规则约束,并给出自己的适用条件。

9/24周四
  1. Lovable · Blog71

    Lovable 发布 Chats,并公开多智能体协作的轨迹与收件箱架构

    Lovable 发布 Chats,一个运行在工作区层级、可跨项目对话并触发构建的智能体,确认改动后会把任务交给项目里的 builder 智能体并把进展带回对话。

    推荐理由:Lovable 公开 Chats 背后的轨迹、收件箱与激活三层架构,可迁移到自建多智能体编排。

9/23周三
  1. Cursor · Changelog62

    Cursor 推出 Rollouts 与 Security Review 两个 bot

    Cursor 发布 Rollouts 和 Security Review 两个 bot,均面向团队版和企业版开放。

    推荐理由:官方给出两个 bot 的监控与安全审查流程,读者可据此判断能否接入现有交付链路。

  2. Lovable · Blog60

    Lovable 上线 Opus 5.5:构建更快,质量与 Opus 5 持平

    Lovable 上线 Opus 5.5,官方称其与 Opus 5 结果持平,但完成步数减少三分之一到一半。在 Lovable 内部基准上,Opus 5.5 在 0-to-1 构建和迭代改代码两项与 Opus 5 打平,验证纪律一项高出 4% 到 6%;各档推理强度下每任务步骤数减少 26% 到 57%,输入 token 减少 21% 到 59%,差异在 95% 置信水平上显著。

    推荐理由:Lovable 官方给出 Opus 5.5 与 Opus 5 在步骤数和 token 上的对比数据,可据此判断构建效率的实际变化。

9/15周二
  1. Lovable · Blog64

    Lovable 开源 Rust 预览引擎 OJ,冷启动与内存优于 Vite

    Lovable 发布用 Rust 从零实现的预览引擎 OJ,它读取现有 vite.config.ts 并通过兼容层运行真实 Vite 插件,单个二进制、不向项目安装工具链。

    推荐理由:Lovable 用 Rust 重写预览引擎 OJ,给出与 Vite 的冷启动和内存对比,以及生产环境灰度数据。

  2. Cline · Blog62

    Cline 发布开源桌面应用 Cline Desktop,面向开放权重模型

    Cline 发布开源桌面应用 Cline Desktop 的早期版本,把原本在 VS Code 扩展和 CLI 中的智能体运行框架搬进独立工作区,支持并行会话、定时任务和用于扩展工具与集成的 Marketplace。

    推荐理由:官方给出桌面端的能力边界与开放入口,读者可据此判断它是否适合承接多智能体并行任务。

9/11周五
  1. OpenAI Developer Blog · Codex66

    OpenAI 谈如何为 GPT-6 Astra 重写 Skills 与提示词

    OpenAI 官方博客针对 GPT-6 Astra 给出 Skills、AGENTS.md 和任务提示词的调整建议:Skill 描述要尽量短且明确适用场景,多流程 Skill 用根文档做最小路由,避免把 Skill 写成过于具体的步骤清单。

    推荐理由:OpenAI 官方给出 GPT-6 Astra 下 Skills、AGENTS.md 与提示词的清理方法,可迁移到现有仓库配置。

9/10周四
  1. Cursor · Changelog76

    Cursor 推出「项目」功能,用协调智能体承接长周期开发任务

    Cursor 推出「项目」功能,用于承接一项功能、一次迁移或一个完整应用这类长周期工作,可在数月内保持上下文并把任务委派给成千上万个子智能体。项目由云端智能体驱动,协调智能体不写代码,只负责规划、分派并交回成果,需要本机测试时再启动本地智能体;每个项目维护一组在云端和本地机器间同步的文件,持续积累研究成果、artifacts 和对代码库的了解。

    推荐理由:官方给出项目式多智能体协作的上下文共享与自动触发机制,可据此判断长周期任务如何被接管。

9/5周六
  1. GitHub Blog · Copilot71

    GitHub Copilot 推出 Project HydraFusion,用多模型运行时编排提升编码质量

    GitHub 在 Copilot CLI 中以研究预览形式推出 Project HydraFusion,通过运行时编排在多个提供商的模型间选择执行方案,用户像选普通模型一样选择它,按各模型标准费率计费。

    推荐理由:GitHub 官方给出 HydraFusion 的三种编排模式与三项基准的成本质量对比,可据此判断多模型编排在真实编码任务中的取舍。

9/4周五
  1. OpenAI Developer Blog · Codex71

    如何用 Codex 中的 Astra 构建游戏:从 Void Explorer 到性能调优

    作者在 Codex 中用 Astra 构建了太空探索游戏 Void Explorer,包含 2,048 个恒星系和超过 10,000 个程序化生成的行星,并分享了从提示词到架构、测试和性能测量的完整流程。

    推荐理由:作者用 Astra 在 Codex 中做完整游戏,展示了从提示词到测试、性能测量的可迁移协作流程。

9/3周四
  1. Cline · Blog74

    Cline 如何把 1100 万用户迁移到最大一次 harness 升级

    Cline 把 VS Code 扩展从约 76,000 行单体核心迁移到 Cline SDK,并自建灰度发布机制:一个安装包内打包 loader、legacy 和 next 两套扩展,由 PostHog 功能开关按百分比决定激活哪套,崩溃时自动回退到 legacy,开关可随时降到 0% 作为 kill switch。

    推荐理由:Cline 官方复盘如何把 1100 万用户的 VS Code 扩展迁到新 harness,含灰度机制与前后指标对比。

  2. GitHub Blog · Copilot72

    GitHub Copilot 如何在不牺牲任务质量的前提下降低 AI 编码成本

    GitHub Copilot 团队复盘了四项降低 AI 编码成本的改动,核心原则是按完整任务而非单次工具调用衡量效率。

    推荐理由:GitHub Copilot 团队复盘四项降本改动,并给出可迁移的评估方法:按完整任务而非单次工具调用衡量成本。

9/2周三
  1. Cursor · Changelog66

    Cursor 推出自托管机器,工具执行留在自有网络内

    Cursor 支持自托管机器,代码库、构建产物和密钥都保留在自有基础设施的内部机器上,由智能体在本地处理工具调用。My Machines 用于把单台笔记本或 VM 接入个人工作流,团队池则是面向团队或企业的具名 worker 队列,容量随请求扩容、worker 断开时缩容,池不与代码仓库绑定,并支持闲置机器休眠后在重连窗口内恢复。

    推荐理由:官方给出自托管机器的池化调度与沙箱接入方式,读者可据此判断工具执行能否留在自有网络内。

8/27周四
  1. Cline · Blog71

    Cline 实测八个模型做 IMO 2026:DeepSeek V4 Flash 以 0.12 美元拿到金牌线

    Cline 让八个模型在自家 harness 里做 IMO 2026 六道题,证明由 GPT-5.5 和 Claude Opus 5 双盲按 0–7 分制评分、Gemini 3.1 Pro 仲裁,金牌线为 29 分。

    推荐理由:Cline 用同一套 harness 盲评八个模型做 IMO 2026,给出分数与单次成本对照,可看开源权重模型的实际性价比。

8/26周三
  1. Cline · Blog71

    用 Cline SDK 在 Cline loop 上构建代码审查智能体

    Cline 团队用 Cline SDK 搭了一个代码审查智能体,把审查拆成 review 与 judge 两段 agent 循环,再由驱动脚本把存活的问题以一条 COMMENT 事件批量提交到 GitHub PR。

    推荐理由:完整拆解一个代码审查智能体的插件、Hook 与两段式循环,可迁移到其他自动化审查场景。

8/25周二
  1. Lovable · Blog62

    Lovable 如何让自家应用接入外部技术栈:从 MCP 到近 100 个连接器

    Lovable 官方复盘了把平台应用接入第三方服务的做法:先支持 MCP 作为聊天内取上下文的临时方案,再自建 app connectors,用 Connector Gateway 代理已发布应用与第三方 API 之间的请求,由它持有凭证和刷新逻辑,部署后的应用不接触密钥。

    推荐理由:Lovable 官方复盘如何把连接器做成可复用基础设施,对做第三方集成和凭证管理的团队有参考价值。

  2. OpenAI Developer Blog · Codex62

    用 Codex 和 Runme notebook 自动化 OpenAI 的重复性评测工作

    OpenAI 工程师用 Codex 配合开源 notebook 应用 Runme 自动化重复性工作,例如跑模型评测。做法是在 Runme notebook 里写目标单元格,让 Codex 读取目标、写出计划并等待人工审批后再执行,过程中记录命令、输出和结论,包括走过的死路。

    推荐理由:作者用 Runme notebook 加 WebMCP 把评测流程交给 Codex,读者可借鉴其目标、审批与上下文沉淀方式。

8/21周五
  1. OpenAI Developer Blog · Codex65

    OpenAI 发布 Daybreak 与 Codex Security 安全工作流

    OpenAI 推出 Daybreak,把 ChatGPT、Codex Security 和开源 Codex Security CLI 组合成一套安全防御工作流,覆盖 PR 合并前审查、仓库与漏洞积压排查、CI 定期检查。

    推荐理由:官方给出 Codex Security 从 PR 审查、仓库扫描到 CLI 批量扫描的完整用法,可据此判断如何接入现有安全流程。