跳到正文

#Agent

今日 0 条
10/6周二
  1. 宝玉71

    SemiAnalysis 实测 Anthropic、OpenAI 等九家 AI 订阅套餐后得出,同样 200 美元,Claude 订阅折算的 Token 用量约为 OpenAI 的 5 倍。

    引用SemiAnalysis@SemiAnalysis_

    Anthropic Subscriptions Offer 5x+ More Value Than OpenAI Limit testing every AI subscription plan from Anthropic, OpenAI, Meta, SpaceXAI, MiniMax, Moonshot, Zdotai, Cursor, and Cognition https://newsletter.semianalysis.com/p/anthropic-subscriptions-offer-5x

  2. 宝玉71

    据 The Information 10 月 5 日报道,Meta 和微软都在减少员工内部使用 Anthropic 的 Claude,转向自家模型和工具。

    引用NIK@ns123abc

    🚨BREAKING: Microsoft and META are aggressively cutting employee use of Claude ahead of Anthropic's IPO Microsoft has cut internal claude spend by more than 33%, nuked per-employee token budget from $100k/month to $10k/month, and forced Copilot to auto-route to cheaper models META used Claude code to build Muse, then cut active users from 60,000 to 30,000 (50% decline) after launch, and replaced it with Muse Code Palantir and Nvidia are also scaling back claude over soaring prices and data privacy fears it’s OVER…

  3. 宝玉70

    amontlabs/lcu 把 Codex 的 Computer Use 单独拆出,让 Claude Code、Codex CLI、Pi 等 Agent 工具通过 MCP 调用。

    引用向阳乔木@vista8

    发现一个牛逼的东西,让任意 Agent 调用 Codex 的 Computer Use。 Codex 最强的就是 Computer Use。 但最近用 Claude Opus 5.5比较多,这样就强强联合了。 刚测试通过,安装后建议配置个 Hook,指定白名单可控制哪些 App 安装地址见评论区

  4. GitHub Blog · Copilot66

    GitHub 发布 AI 代码评审开放基准 ReviewBench

    GitHub 发布代码评审离线基准 ReviewBench,基于 1.039 亿个 GitHub PR 的分布特征,构建了覆盖 19 种语言、219 个公开 PR 的评测集,并公开数据集、评分规则与 LLM 评审模型配置。

    推荐理由:GitHub 公开了 AI 代码评审基准的数据集、评分规则与评测入口,读者可据此对比不同评审智能体。

10/4周日
  1. 宝玉82

    宝玉结合播客内容,梳理在 SpaceXAI 做 Grok Bot 的 Lauren Tan 一个月合并 2500 个 PR 的做法:晚上让 AI 自己检查、自己合并,第二天早上再抽查,不逐个 Review。

    引用lauren@poteto

    i had a lot of fun chatting with @mattpocockuk today about how i was able to land 2,500 PRs last month! Matt is a wonderful interviewer so i think the interview turned out really interesting both of our skill plugins work great together, so i recommend giving both a try and picking the best skills that suit your workflow https://www.youtube.com/watch?v=MN9dGgmLyso

    推荐理由:宝玉借 Lauren Tan 月并 2500 个 PR 的实践,说明不逐个 Review 的前提是验证 Skill 与规则约束,并给出自己的适用条件。

10/3周六
  1. 宝玉62

    剑桥大学 AI 科学与政策项目(CASP)9 月发布一篇论文,Hinton、Bengio 等 20 多位研究者联名讨论 AI 研发被自动化后是否会引发智能爆炸,Hinton 在 X 上推荐了该论文。

    引用Geoffrey Hinton@geoffreyhinton

    The idea of an intelligence explosion caused by recursive self improvement has been around for a long time but until very recently it did not seem imminent. Now many leading researchers think it may happen quite soon. You can read our paper about it here: https://casp.ac/reports/intelligence-explosion

10/1周四
9/26周六
  1. Boris Cherny60

    Claude Tag 在 Slack 中现已支持个人连接器,可直接访问个人有权限的 Drive 文档、Salesforce 账号或数仓表,今天在 Teams 上线、下周面向 Enterprise 开放。

    引用Noah Zweben@noahzweben

    Claude Tag in Slack can now use your personal connectors! You can now securely access that Drive doc, Salesforce account, or Warehouse table that you have personal access to right where the work happens. Avail. on Teams today and Enterprise next week https://claude.com/blog/claude-tag-now-supports-personal-connectors-in-channels

9/25周五
  1. GitHub Blog · Copilot34

    GitHub Copilot 的 canvas:当聊天框不是与 AI 协作的正确界面

    GitHub Copilot 应用推出 canvas,一种运行在应用内、无浏览器外壳的全栈小应用,可与 Copilot 智能体双向通信,也能在本地执行代码。作者认为 chat 只适合作为通用兜底界面,用户明确任务时更该让智能体生成可复用工具,例如用 canvas 管理 Winget 包或直接操作 SQLite 数据库,避免把 token 浪费在“stage and commit”这类操作上。

9/24周四
9/23周三
  1. Lovable · Blog60

    Lovable 上线 Opus 5.5:构建更快,质量与 Opus 5 持平

    Lovable 上线 Opus 5.5,官方称其与 Opus 5 结果持平,但完成步数减少三分之一到一半。在 Lovable 内部基准上,Opus 5.5 在 0-to-1 构建和迭代改代码两项与 Opus 5 打平,验证纪律一项高出 4% 到 6%;各档推理强度下每任务步骤数减少 26% 到 57%,输入 token 减少 21% 到 59%,差异在 95% 置信水平上显著。

    推荐理由:Lovable 官方给出 Opus 5.5 与 Opus 5 在步骤数和 token 上的对比数据,可据此判断构建效率的实际变化。

9/22周二
  1. Sebastian Raschka72

    小米发布开源权重模型 MiMo-V2.6-Pro,在 Artificial Analysis 智能指数上以 46 分成为开源权重模型第一,每任务成本 0.13 美元,输入 0.435 美元/1M tokens、输出 0.87 美元/1M tokens,采用 1.02T 总参数、42B 激活参数的 MoE 架构。

    引用Artificial Analysis@ArtificialAnlys

    MiMo-V2.6-Pro debuts as the top open weights model on the Artificial Analysis Intelligence Index (46). At $0.13 per Intelligence Index task, it lands on the Intelligence vs. Cost per Task Pareto frontier @Xiaomi has just released MiMo-V2.6-Pro, an open weights model with major advances in intelligence over its predecessor, MiMo-V2.5-Pro (Intelligence Index: 26). Despite the improvement, it retains the same attractive pricing at $0.435 per 1M input tokens (with a 99% cache-hit discount) and $0.87 per 1M output tokens. This makes MiMo-V2.6-Pro one of the most cost-efficient models to deploy. MiMo-V2.6-Pro is an MoE model with 1.02T total parameters and 42B active parameters. Stay tuned for additional analysis of the model. Check out MiMo-V2.6-Pro full benchmarking breakdown here: https://artificialanalysis.ai

9/15周二
  1. Cline · Blog62

    Cline 发布开源桌面应用 Cline Desktop,面向开放权重模型

    Cline 发布开源桌面应用 Cline Desktop 的早期版本,把原本在 VS Code 扩展和 CLI 中的智能体运行框架搬进独立工作区,支持并行会话、定时任务和用于扩展工具与集成的 Marketplace。

    推荐理由:官方给出桌面端的能力边界与开放入口,读者可据此判断它是否适合承接多智能体并行任务。

9/12周六
9/11周五
  1. OpenAI Developer Blog · Codex66

    OpenAI 谈如何为 GPT-6 Astra 重写 Skills 与提示词

    OpenAI 官方博客针对 GPT-6 Astra 给出 Skills、AGENTS.md 和任务提示词的调整建议:Skill 描述要尽量短且明确适用场景,多流程 Skill 用根文档做最小路由,避免把 Skill 写成过于具体的步骤清单。

    推荐理由:OpenAI 官方给出 GPT-6 Astra 下 Skills、AGENTS.md 与提示词的清理方法,可迁移到现有仓库配置。

9/10周四
  1. Cursor · Changelog76

    Cursor 推出「项目」功能,用协调智能体承接长周期开发任务

    Cursor 推出「项目」功能,用于承接一项功能、一次迁移或一个完整应用这类长周期工作,可在数月内保持上下文并把任务委派给成千上万个子智能体。项目由云端智能体驱动,协调智能体不写代码,只负责规划、分派并交回成果,需要本机测试时再启动本地智能体;每个项目维护一组在云端和本地机器间同步的文件,持续积累研究成果、artifacts 和对代码库的了解。

    推荐理由:官方给出项目式多智能体协作的上下文共享与自动触发机制,可据此判断长周期任务如何被接管。

9/5周六
  1. GitHub Blog · Copilot71

    GitHub Copilot 推出 Project HydraFusion,用多模型运行时编排提升编码质量

    GitHub 在 Copilot CLI 中以研究预览形式推出 Project HydraFusion,通过运行时编排在多个提供商的模型间选择执行方案,用户像选普通模型一样选择它,按各模型标准费率计费。

    推荐理由:GitHub 官方给出 HydraFusion 的三种编排模式与三项基准的成本质量对比,可据此判断多模型编排在真实编码任务中的取舍。

9/4周五
  1. OpenAI Developer Blog · Codex71

    如何用 Codex 中的 Astra 构建游戏:从 Void Explorer 到性能调优

    作者在 Codex 中用 Astra 构建了太空探索游戏 Void Explorer,包含 2,048 个恒星系和超过 10,000 个程序化生成的行星,并分享了从提示词到架构、测试和性能测量的完整流程。

    推荐理由:作者用 Astra 在 Codex 中做完整游戏,展示了从提示词到测试、性能测量的可迁移协作流程。

9/3周四
  1. Cline · Blog74

    Cline 如何把 1100 万用户迁移到最大一次 harness 升级

    Cline 把 VS Code 扩展从约 76,000 行单体核心迁移到 Cline SDK,并自建灰度发布机制:一个安装包内打包 loader、legacy 和 next 两套扩展,由 PostHog 功能开关按百分比决定激活哪套,崩溃时自动回退到 legacy,开关可随时降到 0% 作为 kill switch。

    推荐理由:Cline 官方复盘如何把 1100 万用户的 VS Code 扩展迁到新 harness,含灰度机制与前后指标对比。

9/2周三
  1. Cursor · Changelog66

    Cursor 推出自托管机器,工具执行留在自有网络内

    Cursor 支持自托管机器,代码库、构建产物和密钥都保留在自有基础设施的内部机器上,由智能体在本地处理工具调用。My Machines 用于把单台笔记本或 VM 接入个人工作流,团队池则是面向团队或企业的具名 worker 队列,容量随请求扩容、worker 断开时缩容,池不与代码仓库绑定,并支持闲置机器休眠后在重连窗口内恢复。

    推荐理由:官方给出自托管机器的池化调度与沙箱接入方式,读者可据此判断工具执行能否留在自有网络内。

8/30周日
8/26周三
  1. Cline · Blog71

    用 Cline SDK 在 Cline loop 上构建代码审查智能体

    Cline 团队用 Cline SDK 搭了一个代码审查智能体,把审查拆成 review 与 judge 两段 agent 循环,再由驱动脚本把存活的问题以一条 COMMENT 事件批量提交到 GitHub PR。

    推荐理由:完整拆解一个代码审查智能体的插件、Hook 与两段式循环,可迁移到其他自动化审查场景。

8/25周二
  1. Lovable · Blog62

    Lovable 如何让自家应用接入外部技术栈:从 MCP 到近 100 个连接器

    Lovable 官方复盘了把平台应用接入第三方服务的做法:先支持 MCP 作为聊天内取上下文的临时方案,再自建 app connectors,用 Connector Gateway 代理已发布应用与第三方 API 之间的请求,由它持有凭证和刷新逻辑,部署后的应用不接触密钥。

    推荐理由:Lovable 官方复盘如何把连接器做成可复用基础设施,对做第三方集成和凭证管理的团队有参考价值。

  2. OpenAI Developer Blog · Codex62

    用 Codex 和 Runme notebook 自动化 OpenAI 的重复性评测工作

    OpenAI 工程师用 Codex 配合开源 notebook 应用 Runme 自动化重复性工作,例如跑模型评测。做法是在 Runme notebook 里写目标单元格,让 Codex 读取目标、写出计划并等待人工审批后再执行,过程中记录命令、输出和结论,包括走过的死路。

    推荐理由:作者用 Runme notebook 加 WebMCP 把评测流程交给 Codex,读者可借鉴其目标、审批与上下文沉淀方式。

8/21周五
  1. OpenAI Developer Blog · Codex65

    OpenAI 发布 Daybreak 与 Codex Security 安全工作流

    OpenAI 推出 Daybreak,把 ChatGPT、Codex Security 和开源 Codex Security CLI 组合成一套安全防御工作流,覆盖 PR 合并前审查、仓库与漏洞积压排查、CI 定期检查。

    推荐理由:官方给出 Codex Security 从 PR 审查、仓库扫描到 CLI 批量扫描的完整用法,可据此判断如何接入现有安全流程。

8/19周三
  1. Cursor · Changelog66

    Cursor 更新云端智能体与 Harness:支持事件订阅、子智能体独立运行和 /goal

    Cursor 更新云端智能体和 Cursor harness,让云端智能体可以订阅事件源,在 PR、Slack 讨论串或定时任务有新动态时恢复运行,并持续推进直至完成,修复 CI 问题、处理 bot 评论。

    推荐理由:云端智能体从单次执行转向订阅事件、持续跟进 PR 与 Slack 讨论串,读者可据此判断自动化边界的变化。

  2. Cline · Blog71

    Cline 开源开放权重模型的评测方法与 trace

    Cline 开源其开放权重模型的评测方法,并附上价值超过一千美元的爬坡分数与 trace 供下载分析。文章给出 Hill Climber's Checklist 五条启发式:设定北极星指标、量化噪声、按任务/模型/供应商拆解失败模式、不要默认更多思考更好、保留私有评测集。

    推荐理由:Cline 公开评测方法与上千美元 trace,给出五条可迁移的爬坡启发式,适合自建 harness 的团队参考。

8/18周二
  1. Lovable · Blog74

    Lovable 如何把 lovable.dev 从 Next.js 迁到自家 TanStack Start 栈

    Lovable 用六个月把月访问 4200 万的 lovable.dev 从 Next.js 迁到自家 TanStack Start 托管栈,迁移期间两套框架并行运行,由代理 worker 按路由和用户分流,最终 Next.js 专属代码只占 3%。

    推荐理由:Lovable 官方复盘把 90 万行代码从 Next.js 迁到自家 TanStack Start 栈,双框架并行、AI 智能体批量迁移和一次 OOM 事故的细节都可直接借鉴。

8/13周四
  1. Augment Code · Blog62

    Augment Code 扩展 Cosmos:把代码评审做成 PR 到合并的智能体闭环

    Augment Code 将其 Cosmos 评审系统从代码评审扩展到完整的 PR 到合并闭环,新增 Verifier、PR Fixer、Review Dashboard 和 cosmos approve 四项能力,由多个专职 Expert 分别负责风险分析、逐行正确性评审、设计评审、运行时验证和修复。

    推荐理由:Augment 把代码评审扩展成覆盖修复、验证与审批的 PR 到合并闭环,读者可据此判断多智能体分工的落地方式。

8/11周二
8/9周日
8/5周三
  1. Vercel · v0 Blog62

    Vercel 发布新版 v0 API,可编程调用应用生成智能体

    Vercel 发布新版 v0 API,提供对 v0 应用生成智能体的可编程、无头访问:发送提示词后 v0 生成应用、在 Vercel Sandbox 中启动开发服务器,并返回可嵌入自有界面的预览 URL,该 API 已正式可用。

    推荐理由:v0 把应用生成能力开放成 API,读者可据此判断如何把它接进自己的产品或智能体流程。

8/3周一
  1. OpenAI · Codex Cookbook71

    用 Codex 迭代开发工作流:从 AGENTS.md 到分阶段构建文件

    OpenAI Codex Cookbook 给出把 Codex 接入开发流程的一套仓库约定:用 AGENTS.md 存放持久化仓库指令,用 PLANS.md 作为阶段计划来源,再拆成 harness/build/ 下的分阶段构建文件,每个阶段写明目标、验收标准、边界和审批门禁。

    推荐理由:OpenAI 官方给出用 AGENTS.md、PLANS.md 与分阶段构建文件约束 Codex 的完整目录约定,可迁移到自己的仓库。

8/2周日
7/30周四
  1. Terminal-Bench · News60

    Terminal-Bench 3.0 发布:74 个任务、7 个领域,最强模型通过率约 34%

    Terminal-Bench 团队发布 Terminal-Bench 3.0,首个版本包含 7 个领域共 74 个任务,最强模型通过率约 34%。该版本在 Terminal-Bench 2.1 基础上扩展任务多样性,并引入 CI/CD、语义化版本和结果迁移来持续改进基准。

    推荐理由:Terminal-Bench 3.0 用 74 个任务和 CI/CD 版本化机制重建基准,读者可了解新基准如何拉开模型差距。