跳到正文

#Agent

今日 0 条
7/30周四
  1. Terminal-Bench · News62

    Terminal-Bench 发布 Harbor 新功能,把基准做成可持续更新的版本化资产

    Terminal-Bench 团队发布一批 Harbor 新功能,让数据集可以按版本发布、排行榜可迁移到新版本,做法是复用、重评或重跑 trial。任务采用语义化版本:补丁级改动直接复用旧结果,验证器改动只需重评已保存产物,只有显著改变智能体环境的重大改动才需要重跑;数据集版本跟随任务中最大的版本号,排行榜通过 diff 只重跑重大改动任务。

    推荐理由:Terminal-Bench 团队把基准当软件来维护,给出任务语义化版本与排行榜升级的具体机制,可迁移到自建评测流程。

7/25周六
  1. Cline · Blog79

    Cline 用递归自我改进让智能体自主把 Kimi K3 在 Terminal-Bench 2.1 提到 88.8%

    Cline 用一条提示词启动 17 小时连续运行的编码智能体,以 GPT-5.6-Sol 为 leader 模型,把 Kimi K3 在 Terminal-Bench 2.1 上的成绩从基线 69/89(77.5%,$79)提升到确认运行 79/89(88.8%,$49.8),超过 Moonshot 自报的 88.3%。

    推荐理由:Cline 用一条提示词让智能体自主完成 17 小时爬山,把 Terminal-Bench 2.1 从 77.5% 提到 88.8%,可看具体修了哪些 harness 问题。

7/24周五
  1. Lovable · Blog71

    Lovable 如何用 AI 黑客智能体集群对自己打夺旗赛

    Lovable 在内部搭建了一套进攻性安全程序,让 AI 智能体集群像人类攻击者一样探测系统入口,直到拿到可验证的漏洞证据。它用夺旗赛的思路做验证:把 flag 散布在基础设施和权限最高的产品界面中,不预埋任何漏洞,智能体取到 flag 就说明找到了真实入侵路径,而不是模型猜测。

    推荐理由:Lovable 公开了用夺旗机制验证漏洞的内部攻防智能体编排方法,可迁移到自家安全测试流程。

7/22周三
  1. Augment Code · Blog62

    什么是循环工程,领先软件工程团队如何用它

    Augment Code 提出循环工程,即设计从触发、执行、验证到完成结果的智能体循环,让智能体承担中间环节、人类只在需要判断的检查点介入。文章把循环工程与提示词工程、上下文工程分层对比,并给出触发、执行、验证、结果、改进五个阶段,以及代码评审、工单转 PR、漏洞修复、事故响应四种已在生产运行的团队级循环。

    推荐理由:Augment Code 把循环工程拆成触发、执行、验证、结果、改进五阶段,并给出四种已在生产运行的团队级循环形态。

7/20周一
  1. OpenAI Developer Blog · Codex71

    Codex Code Review 支持在 AGENTS.md 中自定义评审规则

    OpenAI 为 Codex Code Review 加入自定义仓库规则能力,可在 AGENTS.md 中写入评审指引,Codex 在评审时应用相关规则并在结论中引用出处。官方评测显示,规则引导版本找回了 98% 的必需自定义问题,基线对照组为 58.3%。规则建议从兼容性要求、数据边界这类非显而易见的不变量入手,仓库级规则放根目录、服务级规则放对应目录,格式和机械检查仍交给 CI。

    推荐理由:官方给出 Codex Code Review 自定义规则的能力、写法与评测数据,可判断如何把团队评审经验固化进 AGENTS.md。

7/15周三
7/8周三
  1. AI Hero · Skills Updates65

    AI Hero skills 仓库发布 v1.1:新增 /wayfinder,重命名 /to-spec 与 /to-tickets

    AI Hero 的 skills 仓库发布 v1.1,把 /to-prd 重命名为 /to-spec,将 /to-plan 和 /to-issues 合并为 /to-tickets,并新增 /wayfinder、/research、/prototype 等 Skill。

    推荐理由:作者把 grilling 到部署的完整 Skill 流程讲清楚,并给出重命名、合并和新增 /wayfinder 的迁移命令,适合想搭 AI 开发工作流的人参考。

7/3周五
  1. Lovable · Blog88

    花掉 8.5 万美元 token 后,我在 Lovable 扩展智能体编程的经验

    Lovable 一名工程师从今年 1 月到 6 月把个人 token 花费从每月约 600 美元推到 5 月的约 2.5 万美元、累计约 8.5 万美元,同时把每周合并 PR 数从 20-30 个提升到 150 个以上。

    推荐理由:作者公开了自己每月约 2.5 万美元 token 的智能体开发配置,包括风险分级、多智能体评审和上下文管理,可迁移到其他团队。

6/24周三
  1. Andrej Karpathy60

    Anthropic 发布 Claude Tag,团队可在 Slack 中把 Claude 加为团队成员,让它访问指定频道和工具,通过 @ 它来委派任务。Karpathy 认为这是 LLM 交互界面的第三次重大改版:第一代是访问网站,第二代是下载到电脑的应用,第三代则是自带工具和组织级上下文、与人类团队并行工作的持久异步实体。

    引用Claude@claudeai

    Introducing Claude Tag, a new way for teams to work with Claude. In Slack, Claude joins as a team member with access to the channels and tools you choose. Tag Claude in and delegate tasks to it while you focus on other work.

6/23周二
  1. OpenAI Developer Blog · Codex65

    OpenAI 官方指南:如何用手机远程指挥 Codex 完成工程工作

    OpenAI 发布 Codex Remote 使用指南,介绍如何在 ChatGPT 移动端启动、指挥、审查和整理运行在开发机上的编码任务,核心思路是把手机当作控制平面而非终端。

    推荐理由:OpenAI 官方梳理 ChatGPT 移动端 Remote 控制 Codex 的完整用法,涵盖 Queue 与 Steer、side chat、Plan 与 Goal 等关键决策点。

6/18周四
  1. Terminal-Bench · News60

    Terminal-Bench 发布 Challenges 长周期智能体基准

    Terminal-Bench 发布 Challenges,一种长周期、高 token 消耗的单任务基准,要求智能体在无时间与资源限制下自主完成整个项目,首批开放三个挑战。

    推荐理由:Terminal-Bench 官方推出长周期单任务基准,并公开三个挑战的实测失败模式,可供评估智能体长时自主能力时参考。

  2. Augment Code · Blog71

    Augment 在 Cosmos 平台推出 Project Builder,把大型工程从设计文档推进到合并

    Augment 在 Cosmos 平台推出 Project Builder,这个 Cosmos expert 能把一句功能描述变成基于真实代码库的设计文档,经人工评审后编排 worker agent 完成实现并推进到合并。

    推荐理由:Augment 官方披露 Project Builder 的设计评审与编排流程,以及三个生产项目的代码量和上线周期,可据此判断设计先行加智能体编排的可行性。

6/15周一
  1. Cline · Blog71

    用插件和 Hook 扩展 Cline 智能体循环

    Cline 官方博客介绍如何用插件和 Hook 给智能体循环加上确定性行为与护栏。插件是单个对象文件,可复用在同一份代码的 CLI、VS Code、JetBrains 和 SDK 上。

    推荐理由:原文给出 Cline 插件与 Hook 的完整代码示例,读者可据此为智能体循环加上日志记录和危险命令拦截。

6/10周三
  1. Andrej Karpathy75

    Andrej Karpathy 评价 Claude Fable 5 发布,指出它与 Mythos 是同一底层模型,只是增加了安全防护,在几乎所有基准上以明显优势达到 SOTA。

    引用Claude@claudeai

    Fable 5 is state-of-the-art on nearly all tested benchmarks, with exceptional performance in software engineering, knowledge work, scientific research, and vision. The longer and more complex the task, the larger Fable 5’s lead over our other models.

6/2周二
  1. claude.dev · Anthropic Developer Blog82

    Claude Code 动态工作流:六种编排模式与使用场景

    Anthropic 在 Claude Code 中发布动态工作流,Claude 可针对具体任务即时编写自己的 harness,并支持分享和复用。工作流通过 agent()、parallel()、pipeline() 等函数编排子智能体,可指定每个智能体使用的模型和是否在独立 worktree 中运行,中断后恢复会话能接着执行。

    推荐理由:Anthropic 团队拆解动态工作流的六种编排模式与适用边界,可迁移到多智能体任务设计。

5/26周二
  1. Augment Code · Blog62

    Augment 用 Cosmos 智能体接管值班排查,人工投入降 81%

    Augment 把内部 Cosmos 平台的 Incident Investigator 专家接入 Slack 和 PagerDuty,对每条告警自动做分诊和根因分析,并给出代码修复、回滚、升级或仅监控四种处置建议,人只需审阅 RCA 并做判断。

    推荐理由:Augment 公开了用 Cosmos Expert 接管告警排查的完整做法与前后一个月数据,可迁移到自家值班流程。

5/21周四
  1. Lovable · Blog74

    Lovable 给智能体加了吐槽工具,每天自动合并约 10 个修复

    Lovable 团队为自家智能体搭建了两个自动化闭环,用来持续减少用户卡住的情况。第一个是 Lovable Stack Overflow(LSO)知识库,在用户请求前由分类器、选择器和合成器判断是否注入解决方案,早期版本让卡住率下降 5%、发布率提升 2%。

    推荐理由:Lovable 团队公开两个自动化闭环的落地细节,可借鉴如何用知识库和反馈工具降低用户卡住率。

5/18周一
  1. Lovable · Blog62

    Lovable 上线 Skills,把重复指令变成可复用技能

    Lovable 上线 Skills 功能,把重复交代的工作方式写成可复用的 markdown 技能文件,在相关任务出现时按需加载。技能以文件夹形式组织,主文件 SKILL.md 含 name、description 和 instructions,description 是决定是否触发的唯一依据,支持文件只在主文件引用且确实需要时才加载。

    推荐理由:官方详解 Lovable Skills 的文件结构、触发机制与写法,并给出可对照的正反示例。

5/12周二
  1. Augment Code · Blog60

    Augment Code 调研 219 位工程负责人:AI 原生开发中的信任与角色落差

    Augment Code 调研了 219 位工程负责人,发现其团队约 48% 的代码由 AI 生成,55% 担心团队对代码库失去共同理解,63% 表示工程师向管理者提出了技能相关性方面的担忧,在 201-1000 人规模的团队中这一比例升至 89%。

    推荐理由:219 位工程负责人的调研数据揭示了 AI 原生开发中代码评审、技能焦虑与角色定义之间的落差。

5/11周一
5/9周六
  1. OpenAI · Codex Cookbook72

    OpenAI 在 Codex 中推出 Goals 持久目标功能

    OpenAI 在 Codex 0.128.0 起提供 Goals 功能,把一次性提示词变成线程内持久目标,Codex 会持续对照测试、基准或产物等证据判断是否完成。

    推荐理由:官方给出 Goals 的适用边界、六要素写法和生命周期命令,可据此判断何时该用持久目标替代一次性提示词。

5/2周六
5/1周五
  1. Andrej Karpathy58

    Karpathy 在 Sequoia Ascent 2026 的炉边对话中提出,LLM 的意义不只是加速已有工作,并举了三个新场景:menugen 这类完全由 LLM 承担、无需传统代码的应用,用 .md skills 替代 .sh 安装脚本,以及处理非结构化知识的 LLM 知识库。

    引用Stephanie Zhan@stephzhan

    @karpathy and I are back! At @sequoia AI Ascent 2026. And a lot has changed. Last year, he coined “vibe coding”. This year, he’s never felt more behind as a programmer. The big shift: vibe coding raised the floor. Agentic engineering raises the ceiling. We talk about what it means to build seriously in the agent era. Not just moving faster. Building new things, with new tools, while preserving the parts that still require human taste, judgment, and understanding.

4/30周四
  1. AI Hero · Skills Updates62

    AI Hero 更新 Skills:/ubiquitous-language 并入 /grill-with-docs

    AI Hero 的 skills 仓库更新,把 /ubiquitous-language 废弃并合并进新 Skill /grill-with-docs,输出从 ubiquitous-language.md 改为 context.md,并支持多个限界上下文各自维护共享语言。

    推荐理由:作者把 /ubiquitous-language 合并为 /grill-with-docs,并给出 ADR 触发条件与多限界上下文做法,可迁移到自己的 Skill 配置。

4/22周三
  1. Augment Code · Blog88

    Augment Code 实测 AGENTS.md:好文件相当于模型升级,坏文件不如不写

    Augment Code 从自家 monorepo 抽取数十个 AGENTS.md,用内部评测集 AuggieBench 对比同一任务在有、无该文件时的表现,发现最好的文件带来的质量提升相当于从 Haiku 升级到 Opus,最差的则让输出比完全没有 AGENTS.md 更糟。

    推荐理由:Augment Code 用内部评测量化了 AGENTS.md 各写法的效果差异,读者可据此调整自己仓库的文档结构。

4/10周五
3/9周一
  1. OpenAI Developer Blog · Codex87

    OpenAI 如何用 Skills 加速 Agents SDK 仓库维护

    OpenAI 用 Codex 配合仓库内的 Skills、AGENTS.md 和 GitHub Actions 维护 Agents SDK 仓库,把验证、发布准备、示例集成测试和 PR 评审变成可重复流程。

    推荐理由:OpenAI 官方公开了用 Skills、AGENTS.md 和 GitHub Action 维护 Agents SDK 仓库的完整配置,可迁移到其他开源项目。

2/23周一
  1. OpenAI Developer Blog · Codex72

    用 Codex 跑 25 小时长时程任务:一份可复用的项目记忆文件栈

    OpenAI 用 GPT-5.3-Codex 在 Extra High 推理档下从空仓库连续运行约 25 小时、消耗约 13M token、生成约 3 万行代码,做出一个可测试的设计工具。

    推荐理由:作者用 25 小时、13M token 的实测展示长时程智能体如何靠持久化项目记忆和逐里程碑验证保持不跑偏。

2/3周二
  1. Vercel · v0 Blog60

    Vercel 发布新版 v0,从生成演示转向生产级应用

    Vercel 发布新版 v0,将其定位从生成演示转向生产级应用和智能体。新版本基于沙箱运行时,可导入任意 GitHub 仓库并自动拉取 Vercel 上的环境变量和配置;新增 Git 面板,让非工程成员也能为每个对话建分支、向 main 提 PR 并在合并后部署;同时提供与 Snowflake 和 AWS 数据库的安全集成,以及默认开启的部署保护和访问控制。

    推荐理由:v0 从生成演示转向生产级应用,给出导入 GitHub 仓库、Git 面板和数据库集成等具体能力变化。

1/22周四
1/11周日
  1. OpenAI Developer Blog · Codex71

    Skyscanner 如何用 JetBrains MCP 增强 Codex CLI

    Skyscanner 工程师把 OpenAI 的 Codex CLI 接入 JetBrains IDE 的 MCP server,让 Codex 能调用 IDE 的 get_file_problems 检查文件错误、执行预设的 run configurations 跑测试和 lint。

    推荐理由:Skyscanner 工程师把 Codex CLI 接入 JetBrains MCP,让 AI 直接读取 IDE 报错并跑测试,读者可借鉴这套反馈闭环。

11/19周三
  1. OpenAI · Codex Cookbook67

    如何用 Codex CLI 分阶段改造遗留代码库

    OpenAI 在 Codex Cookbook 中给出用 Codex CLI 改造遗留代码库的完整流程,以 COBOL 投资组合系统为示例,围绕 ExecPlan 设计文档分五个阶段推进。

    推荐理由:以 COBOL 投资组合系统为例,给出用 Codex CLI 分阶段改造遗留代码的可复用文档与验证流程。

11/7周五
  1. Terminal-Bench · News62

    Terminal-Bench 发布 2.0 版本与 Harbor 评测优化包

    Terminal-Bench 发布 2.0 版本和 Harbor 包,前者是经过更严格验证、难度更高的智能体评测基准,后者用于评估和优化智能体。Harbor 重写了 Terminal-Bench 的测试框架,支持云端部署容器、面向 RL 和 SFT 的 rollout 接口,并兼容任何可装入容器的智能体。

    推荐理由:Terminal-Bench 2.0 与 Harbor 同时发布,读者可了解智能体评测基准的验证方式与云端扩展思路。

8/29周五
  1. OpenAI · Codex Cookbook74

    在 GitLab CI/CD 中用 Codex CLI 自动做代码质量检查与安全修复

    OpenAI Codex Cookbook 给出把 Codex CLI 接入 GitLab CI/CD 的完整做法,用于生成 CodeClimate JSON 代码质量报告、把 SAST 结果整理成 security_priority.md,并让 Codex 输出可 git apply 的补丁。

    推荐理由:官方 Cookbook 给出把 Codex CLI 接入 GitLab CI 的完整配置,含提示词约束、JSON 标记提取与 diff 校验,可直接照搬。

7/15周二
6/25周三
5/19周一
  1. Terminal-Bench · News62

    Terminal-Bench 发布首个终端智能体评测基准

    Terminal-Bench 发布首个版本,用于量化 AI 智能体在终端中执行复杂任务的能力,首发数据集 Terminal-Bench-Core-v0 包含 80 个手工编写并人工验证的任务,每个任务配有独立 Docker 环境、人工验证的解法与测试用例。

    推荐理由:Terminal-Bench 给出 80 个带 Docker 环境和测试用例的终端任务,可用来横向比较不同智能体在命令行中的实际表现。