微软与 UCSB 提出 ScholarEvolve:用论文进化 Agent Harness
微软与加州大学圣巴巴拉分校研究者公开论文 ScholarEvolve,从已发表的 Agent 研究中寻找改进思路,写进 Harness 后用真实任务检验,执行任务的模型保持不变。
微软与加州大学圣巴巴拉分校研究者公开论文 ScholarEvolve,从已发表的 Agent 研究中寻找改进思路,写进 Harness 后用真实任务检验,执行任务的模型保持不变。
南洋理工大学 S-Lab、A*STAR 和 UIUC 团队提出 V-Rubrics,将 50,248 个视觉样本拆成 352,938 条可逐项检查的准则,让视觉事实、推理步骤和任务要求分别参与奖励计算。
作者上手体验了 OpenAI DevDay 发布的 Dots、Decisions API、开源 Codex Harness 更新和 ChatGPT Space 四项能力。
Earendil 团队于 10 月 1 日发布 Agent Harness Pi 1.0,GitHub 仓库约 11.1 万 Star、1.4 万 Fork,同时推出实验性新包 Pi Durable。
推荐理由:Pi 1.0 与 Pi Durable 把检查点、幂等提交、所有权树等分布式概念搬进 Agent 运行时,可据此判断长时运行 Agent 的工程取舍。
JetBrains 为 IDE 内的 Air 开启早期访问计划,插件已上架 Marketplace,2026.3 EAP 版本中已内置。
OpenAI 发布 GPT-6 Sol 和 Luna,Sol 定价 $2/$10 MTok、约为 GPT-5.6 的一半,DeepSWE 68.8%,Luna 定价 $0.10/$0.50 MTok。
Synopsys 发布 Autopilot 平台,用于编排 AI 智能体 AgentEngineer,可自动执行验证、数字与模拟电路实现、制造、建模和系统分析等多阶段工程流程。
protoLabsAI 发布 protoAgent 0.183.1,包含四项修复且不改动配置。pr-reviewer 插件不再对同一版本 PR 重复评审,后台进程改为旧副本先退出再启动新副本;终端控制面板修复了跨轮次重复向智能体下发命令的问题。使用 pr-reviewer 的智能体需更新并重启才能生效。
UiPath 于 9 月 23 日更新 UiPath Platform,Automation Suite 全栈现可在本地 Linux 基础设施上运行,面向有数据存储、安全和环境控制要求的企业。
Lovable 与 AWS、CrowdStrike、Databricks、Docker、Google Cloud、Okta、Proofpoint、Salesforce、ServiceNow、Wiz、Zscaler 共同成为 Blueprint Alliance 创始成员,该联盟推动面向企业级 AI 智能体安全与治理的开放参考架构。
俄罗斯团队 Маракуйя ИИ 的智能体框架首次参加 Terminal-Bench 4 和 OSWorld 2 两项基准测试,取得亮眼成绩。
Superpowers 6.4 发布,新增对 Meta Muse、OpenCode 2.0 和 Qwen Code 三个编程智能体的支持,并重写了 executing-plans 技能中的 Native Execution。
Cursor 推出「项目」功能,用于承接一项功能、一次迁移或一个完整应用这类长周期工作,可在数月内保持上下文并把任务委派给成千上万个子智能体。项目由云端智能体驱动,协调智能体不写代码,只负责规划、分派并交回成果,需要本机测试时再启动本地智能体;每个项目维护一组在云端和本地机器间同步的文件,持续积累研究成果、artifacts 和对代码库的了解。
推荐理由:官方给出项目式多智能体协作的上下文共享与自动触发机制,可据此判断长周期任务如何被接管。
GitHub 在 Copilot CLI 中以研究预览形式推出 Project HydraFusion,通过运行时编排在多个提供商的模型间选择执行方案,用户像选普通模型一样选择它,按各模型标准费率计费。
推荐理由:GitHub 官方给出 HydraFusion 的三种编排模式与三项基准的成本质量对比,可据此判断多模型编排在真实编码任务中的取舍。
WikiSkill 是一个让 Agent Skill 与持久知识库(wiki)协同演化的框架,它把原始执行经验、累积知识和可执行 Skill 分离,并持续将经验沉淀进 wiki 供后续 Skill 更新使用。
斯坦福大学研究人员主导、Terminal-Bench 团队联合全球科研机构专家打造的 Terminal-Bench-Science 0.1 发布,首批含生命、物理、地球、数学和工程科学领域的 70 项任务。
Cursor 更新云端智能体和 Cursor harness,让云端智能体可以订阅事件源,在 PR、Slack 讨论串或定时任务有新动态时恢复运行,并持续推进直至完成,修复 CI 问题、处理 bot 评论。
推荐理由:云端智能体从单次执行转向订阅事件、持续跟进 PR 与 Slack 讨论串,读者可据此判断自动化边界的变化。
Meta 发布编码智能体 Muse Code 和面向编码的模型更新 Muse Spark 1.2,后者在代码生成、复杂调试、代码库理解和端到端开发流程上做了改进,并针对长周期编码任务(整仓库生成、大型端到端项目、auto-research)加大训练算力。
Terminal-Bench 发布 Challenges,一种长周期、高 token 消耗的单任务基准,要求智能体在无时间与资源限制下自主完成整个项目,首批开放三个挑战。
推荐理由:Terminal-Bench 官方推出长周期单任务基准,并公开三个挑战的实测失败模式,可供评估智能体长时自主能力时参考。
Anthropic 在 Claude Code 中发布动态工作流,Claude 可针对具体任务即时编写自己的 harness,并支持分享和复用。工作流通过 agent()、parallel()、pipeline() 等函数编排子智能体,可指定每个智能体使用的模型和是否在独立 worktree 中运行,中断后恢复会话能接着执行。
推荐理由:Anthropic 团队拆解动态工作流的六种编排模式与适用边界,可迁移到多智能体任务设计。
Steve Yegge 宣布 Gas Town 和 Beads 同日发布 v1.0.0。Beads 是面向编码智能体的记忆系统与知识图谱,v1.0 用 Dolt 替换了原先 SQLite + JSONL 的架构,双向同步、三方合并和合并冲突等问题被移除,同时支持嵌入式和服务器模式,本周 GitHub star 数突破 20k。
Superpowers 5 发布,作者称最喜欢的改动是 Visual Brainstorming 伴随工具,它会在智能体认为有内容需要展示时提示用户,通过本地 web 服务器加载智能体写出的 HTML 片段,并把浏览器里的点击和反馈回传给智能体,以替代 Claude 常生成的 ASCII 图。
推荐理由:作者是 Superpowers 维护者,文中说明了 5.0 的视觉头脑风暴、spec 评审循环和子智能体开发三项变化,可据此判断是否值得接入现有工作流。