GitHub 发布 AI 代码评审开放基准 ReviewBench
GitHub 发布代码评审离线基准 ReviewBench,基于 1.039 亿个 GitHub PR 的分布特征,构建了覆盖 19 种语言、219 个公开 PR 的评测集,并公开数据集、评分规则与 LLM 评审模型配置。
推荐理由:GitHub 公开了 AI 代码评审基准的数据集、评分规则与评测入口,读者可据此对比不同评审智能体。
GitHub 发布代码评审离线基准 ReviewBench,基于 1.039 亿个 GitHub PR 的分布特征,构建了覆盖 19 种语言、219 个公开 PR 的评测集,并公开数据集、评分规则与 LLM 评审模型配置。
推荐理由:GitHub 公开了 AI 代码评审基准的数据集、评分规则与评测入口,读者可据此对比不同评审智能体。
Earendil 团队于 10 月 1 日发布 Agent Harness Pi 1.0,GitHub 仓库约 11.1 万 Star、1.4 万 Fork,同时推出实验性新包 Pi Durable。
推荐理由:Pi 1.0 与 Pi Durable 把检查点、幂等提交、所有权树等分布式概念搬进 Agent 运行时,可据此判断长时运行 Agent 的工程取舍。
Google DeepMind 发布 Gemini 4 Argon,单次输出上限从 64K 提升到 1M tokens,主打长任务与多步骤推理。
推荐理由:汇总了 Gemini 4 Argon 的官方评测数据与 Google 内部落地案例,可对照各家旗舰模型的能力差异。
OpenAI 发布面向编程、文档处理和任务自动化的 GPT-6.1 Sol,公司称其在部分测试中接近 GPT-6 Astra。在真实代码库任务测试 DeepSWE 1.1 中,该模型追平 Astra,而执行成本约为其五分之一;在应用操控测试 OSWorld 2.0 中,最高推理档位下比 GPT-6 Sol 提升 7 个百分点。
推荐理由:GPT-6.1 Sol 在 DeepSWE 1.1 上追平 Astra 而成本约为其五分之一,读者可据此判断编程任务的性价比变化。
Simon Willison 在旧金山 Fort Mason 现场直播 OpenAI DevDay 2026 主题演讲,OpenAI 发布个人智能体 Dots、ChatGPT Space、GPT-6.1 Sol 与 Ultrafast 等产品。
推荐理由:现场逐条记录 OpenAI DevDay 发布内容,可快速了解 Dots、GPT-6.1 Sol、Ultrafast 与 Codex Security 的实际形态。
OpenAI 在 9 月 29 日旧金山 DevDay 上发布 GPT-6.1 Sol,API 名为 gpt-6.1-sol,定价为每百万输入 token 2 美元、输出 10 美元,缓存输入 0.10 美元,标准价格是 GPT-6 Astra 的五分之一。
推荐理由:OpenAI DevDay 发布 GPT-6.1 Sol,价格降至 Astra 的五分之一,并同步更新 Codex、Agents API 与插件体系,可据此判断成本与工具链变化。
Anthropic 于 9 月 22 日发布旗舰模型 Claude Opus 5.5,面向让智能体执行编程、数据分析等多步任务的开发者与团队,官方称相比 Opus 5 性能提升且成本下降。
推荐理由:Anthropic 官方公布的定价与默认负载成本降幅,可帮开发者判断长时智能体任务的迁移成本。
Cursor 发布 Rollouts 和 Security Review 两个 bot,均面向团队版和企业版开放。
推荐理由:官方给出两个 bot 的监控与安全审查流程,读者可据此判断能否接入现有交付链路。
Lovable 上线 Opus 5.5,官方称其与 Opus 5 结果持平,但完成步数减少三分之一到一半。在 Lovable 内部基准上,Opus 5.5 在 0-to-1 构建和迭代改代码两项与 Opus 5 打平,验证纪律一项高出 4% 到 6%;各档推理强度下每任务步骤数减少 26% 到 57%,输入 token 减少 21% 到 59%,差异在 95% 置信水平上显著。
推荐理由:Lovable 官方给出 Opus 5.5 与 Opus 5 在步骤数和 token 上的对比数据,可据此判断构建效率的实际变化。
Lovable 发布用 Rust 从零实现的预览引擎 OJ,它读取现有 vite.config.ts 并通过兼容层运行真实 Vite 插件,单个二进制、不向项目安装工具链。
推荐理由:Lovable 用 Rust 重写预览引擎 OJ,给出与 Vite 的冷启动和内存对比,以及生产环境灰度数据。
Cline 发布开源桌面应用 Cline Desktop 的早期版本,把原本在 VS Code 扩展和 CLI 中的智能体运行框架搬进独立工作区,支持并行会话、定时任务和用于扩展工具与集成的 Marketplace。
推荐理由:官方给出桌面端的能力边界与开放入口,读者可据此判断它是否适合承接多智能体并行任务。
Cursor 推出「项目」功能,用于承接一项功能、一次迁移或一个完整应用这类长周期工作,可在数月内保持上下文并把任务委派给成千上万个子智能体。项目由云端智能体驱动,协调智能体不写代码,只负责规划、分派并交回成果,需要本机测试时再启动本地智能体;每个项目维护一组在云端和本地机器间同步的文件,持续积累研究成果、artifacts 和对代码库的了解。
推荐理由:官方给出项目式多智能体协作的上下文共享与自动触发机制,可据此判断长周期任务如何被接管。
GitHub 在 Copilot CLI 中以研究预览形式推出 Project HydraFusion,通过运行时编排在多个提供商的模型间选择执行方案,用户像选普通模型一样选择它,按各模型标准费率计费。
推荐理由:GitHub 官方给出 HydraFusion 的三种编排模式与三项基准的成本质量对比,可据此判断多模型编排在真实编码任务中的取舍。
OpenAI 于 2026 年 9 月 3 日发布 GPT-6 Astra 与 Astra Pro,首批仅限 Daybreak 网络安全计划企业,ChatGPT 付费版、API 和 AWS 将在随后几天开放。
推荐理由:梳理 GPT-6 Astra 与 Fable 5.1 的基准对比,指出各家测试版本与 harness 不一致,读者可据此判断哪些分数可比。
Cursor 支持自托管机器,代码库、构建产物和密钥都保留在自有基础设施的内部机器上,由智能体在本地处理工具调用。My Machines 用于把单台笔记本或 VM 接入个人工作流,团队池则是面向团队或企业的具名 worker 队列,容量随请求扩容、worker 断开时缩容,池不与代码仓库绑定,并支持闲置机器休眠后在重连窗口内恢复。
推荐理由:官方给出自托管机器的池化调度与沙箱接入方式,读者可据此判断工具执行能否留在自有网络内。
Cline 让八个模型在自家 harness 里做 IMO 2026 六道题,证明由 GPT-5.5 和 Claude Opus 5 双盲按 0–7 分制评分、Gemini 3.1 Pro 仲裁,金牌线为 29 分。
推荐理由:Cline 用同一套 harness 盲评八个模型做 IMO 2026,给出分数与单次成本对照,可看开源权重模型的实际性价比。
OpenAI 推出 Daybreak,把 ChatGPT、Codex Security 和开源 Codex Security CLI 组合成一套安全防御工作流,覆盖 PR 合并前审查、仓库与漏洞积压排查、CI 定期检查。
推荐理由:官方给出 Codex Security 从 PR 审查、仓库扫描到 CLI 批量扫描的完整用法,可据此判断如何接入现有安全流程。
Cursor 更新云端智能体和 Cursor harness,让云端智能体可以订阅事件源,在 PR、Slack 讨论串或定时任务有新动态时恢复运行,并持续推进直至完成,修复 CI 问题、处理 bot 评论。
推荐理由:云端智能体从单次执行转向订阅事件、持续跟进 PR 与 Slack 讨论串,读者可据此判断自动化边界的变化。
OpenAI 把驱动 Codex App、CLI 和 IDE 扩展的 harness 开源,并通过 Codex app-server 的客户端协议开放创建线程、启动轮次、接收事件和处理审批请求等能力。
推荐理由:官方公开 Codex harness 与 app-server 协议,读者可据此判断把智能体嵌入自有产品的方式与边界。
NVIDIA 发布 Nemotron 3.5 Lightning,一个面向常驻智能体的可定制开源模型,并已在 Cline 中免费提供。
推荐理由:NVIDIA 新开源模型在 Cline 免费开放,读者可据此判断高频智能体调用场景是否值得换用。