Claude Code 将 auto mode 设为 Pro、Max 和 Team 套餐默认
Anthropic 从 8 月 14 日起把 auto mode 设为大多数 Claude Code 套餐新会话的默认设置。
Ожидает перевода
Anthropic 从 8 月 14 日起把 auto mode 设为大多数 Claude Code 套餐新会话的默认设置。
Ожидает перевода
Claude Code 新增跨会话消息功能,让一个会话把发现、状态或决定以纯文本发给另一个会话,Claude 通过 ListAgents 找目标、SendMessage 发送,用户无需手动调用这两个工具。
Ожидает перевода
Paper Compute 推出开源代理 tapes,它位于 agent harness 与推理服务之间,记录流经的全部内容,包括系统消息、输入、思考块、工具调用与结果、输出。
Ожидает перевода
Meta 发布编码智能体 Muse Code 和面向编码的模型更新 Muse Spark 1.2,后者在代码生成、复杂调试、代码库理解和端到端开发流程上做了改进,并针对长周期编码任务(整仓库生成、大型端到端项目、auto-research)加大训练算力。
Ожидает перевода
Lovable 宣布与 Cerebras 合作,计划到 2027 年大幅降低响应时间,并将分阶段迁移到 Cerebras 专用算力,先从对延迟最敏感的工作负载开始。
Ожидает перевода
Lovable 为所有公开发布的应用推出 trust center 安全页,访问路径为 YOURAPPURL/.well-known/trust.html,由平台自动生成、无需开发者填写。
Ожидает перевода
Vercel выпустил новую версию API v0 — программный, безголовый доступ к агентам генерации приложений v0: отправляешь промпт, v0 создаёт приложение, поднимает сервер разработки в Vercel Sandbox и возвращает URL превью, который можно встроить в свой интерфейс. API уже доступен.
Почему это важно: v0 открыл генерацию приложений через API — читатель может прикинуть, как встроить её в свой продукт или в работу агентов.
Команда Terminal-Bench выпустила набор новых возможностей Harbor: датасеты теперь можно публиковать по версиям, а таблицу лидеров — переносить на новую версию, для чего нужно либо переиспользовать, либо переоценить, либо перезапустить trial. Задачи версионируются семантически: при изменениях уровня патча старые результаты просто переиспользуются, при изменениях валидатора достаточно переоценить уже сохранённые артефакты, и только существенные изменения, заметно меняющие среду ИИ-агента, требуют перезапуска. Версия датасета соответствует максимальной версии среди задач, а таблица лидеров через diff перезапускает только задачи с существенными изменениями.
Почему это важно: Команда Terminal-Bench относится к бенчмарку как к программному обеспечению и описывает конкретный механизм семантического версионирования задач и обновления таблицы лидеров, который можно перенести в собственный процесс оценки.
Lovable 的 connector 现在可以运行在终端用户自己的数据上,用户用 Google、Microsoft、Slack、Salesforce、HubSpot 等账号登录后,应用会继承其原有权限,凭据由 Lovable 的 connector gateway 短暂持有,不会进入应用或浏览器。
Ожидает перевода
Lovable 成为首个获得 AIUC-1 认证的 AI 编程智能体平台,该标准是业界首个专为 AI 智能体打造的安全、保障与可靠性标准。AIUC-1 由 Stanford、MIT、MITRE 和云安全联盟参与制定,包含六大原则下的 51 项要求,覆盖密钥管理、安全代码生成默认设置、沙箱执行、人工监督和企业治理,每项要求均需提供证据并由第三方独立验证,而非自我声明。
Ожидает перевода
OpenAI добавила в Codex Code Review возможность задавать собственные правила для репозитория: в AGENTS.md можно описать указания по ревью, и Codex применит их при проверке и сошлётся на источник в выводах. По данным официальных тестов, версия с правилами нашла 98% необходимых кастомных проблем, тогда как в контрольной группе — 58.3%. Правила стоит начинать с неочевидных инвариантов вроде требований к совместимости или границ данных: правила уровня репозитория кладём в корень, правила уровня сервиса — в соответствующий каталог, а форматирование и механические проверки по-прежнему оставляем CI.
Почему это важно: OpenAI рассказывает, какие возможности даёт настройка правил в Codex Code Review, как их писать и что показывают тесты, — по этому можно решить, как закрепить опыт ревью команды в AGENTS.md.
Lovable 上线 agent integrations,任何公开已发布的 Lovable 应用都能添加 MCP server,从而被 ChatGPT、Claude 等 AI 工具直接调用。
Ожидает перевода
Почему это важно: Lovable 把已发布应用接入 MCP,读者可据此判断自家应用如何被 ChatGPT、Claude 直接调用。
Ожидает перевода
Introducing Claude Tag, a new way for teams to work with Claude. In Slack, Claude joins as a team member with access to the channels and tools you choose. Tag Claude in and delegate tasks to it while you focus on other work.
AI Hero 的 skills 目录发布 v1,通过在各 Skill 上启用 disable-model-invocation: true,让 Skill 描述不再进入模型选择 Skill 时查看的上下文窗口,Skill 描述的 token 成本降低 63%。
Ожидает перевода
Почему это важно: v1 用 disable-model-invocation 把 Skill 描述移出上下文窗口,并区分用户调用与模型调用,读者可据此判断自己的 Skill 组织方式。
Augment выпустила на платформе Cosmos инструмент Project Builder — эксперта Cosmos, который превращает описание функции в проектный документ на основе реальной кодовой базы; после ручной проверки он распределяет задачи между рабочими агентами, доводит реализацию до слияния.
Почему это важно: Augment официально раскрыла, как в Project Builder устроены проверка проектного документа и распределение задач, а также привела объём кода и сроки запуска трёх продакшн-проектов — по этим данным можно оценить, насколько жизнеспособен подход «сначала проектирование, затем оркестрация ИИ-агентов».
Greptile 工程师 Shlok 介绍新代码评审器 TREX(Test, Run, Execute),它在评审 PR 之外真正运行代码,把截图、日志、API trace 和执行脚本作为证据附在每条发现上,发现 bug 就发成 PR 评论。
Ожидает перевода
Superpowers 6 发布,作者称在 Anthropic 评测基准上构建耗时降低 50%、token 花费降低 60%,主要来自合并规范符合性与代码质量两个评审 agent、预先生成评审用的 diff 包让评审者少跑 git,以及调整编排器对任务所需 agent 类型的指引。
Ожидает перевода
Почему это важно: 作者用自建评测套件量化了 Superpowers 6 在构建耗时和 token 花费上的改进,并公开了实验记录与失败结论。
Lovable 上线 Google Workspace、Gemini Enterprise 和 Google Maps Platform 连接器,所有 Lovable 用户均可在工作区设置中连接账号使用。
Ожидает перевода
Lovable 上线 Skills 功能,把重复交代的工作方式写成可复用的 markdown 技能文件,在相关任务出现时按需加载。技能以文件夹形式组织,主文件 SKILL.md 含 name、description 和 instructions,description 是决定是否触发的唯一依据,支持文件只在主文件引用且确实需要时才加载。
Ожидает перевода
Почему это важно: 官方详解 Lovable Skills 的文件结构、触发机制与写法,并给出可对照的正反示例。
Lovable 上线 Discoverability 功能,新发布的应用直接输出完整 HTML,可被搜索引擎和 LLM 爬虫即时读取和索引,已构建的 4000 万个应用也通过预渲染生成静态 HTML 快照。
Ожидает перевода
Lovable 成为首批寻求 AIUC-1 认证的 AI 编程智能体平台之一,第三方审计计划于 2026 年夏季进行。AIUC-1 是面向 AI 智能体安全、保障与可靠性的标准,此次扩展为首个专为 AI 编程智能体设计的认证框架。该白皮书指出,编程智能体产出源代码、数据库 schema、API 配置等可执行产物,直接接触生产基础设施和真实用户数据,生成代码中的漏洞即是现实的安全暴露。
Ожидает перевода
Superpowers 5.1.0 发布,重做了 git worktree 的使用方式,以适配 Claude Code 和 Codex 对 worktree 的一等支持。该版本移除了早期遗留的废弃 slash 命令,将 code reviewer 子智能体改为带自定义提示词的普通子智能体,并新增对 Factory Droid 的支持、优化 OpenCode 集成。
Ожидает перевода
Augment Code 在模型选择器中新增 Prism,由一个小而快的规划模型在每个用户轮次前决定用哪个底层模型,官方称相比前沿推理模型每任务成本低约 20-30%,质量差异可忽略。
Ожидает перевода
Lovable 推出 iOS 和 Android 移动端 App,用户可在手机上用语音或文本提示词排队提交需求,由智能体自主运行测试并持续构建。构建完成后 App 会发送通知,手机与电脑之间的项目进度可无缝接续。
Ожидает перевода
Lovable 在早期访问中测试 GPT-5.5,其内部基准显示最难任务通过率从 GPT-5.4 的 36.9% 升至 41.6%,每次请求工具调用减少 23.1%,用户卡住的消息占比下降 9.9%。GPT-5.5 每请求输出 token 减少 33%,日常任务成本效率提升约 15%,将很快向 Lovable 构建者开放。
Ожидает перевода
Gas City 发布 v1.0.0,由 Julian Knutsen 和 Chris Sells 开发,把 Gas Town 拆解为可组合、声明式的 pack,用来组装任意拓扑的协作智能体团队。
Ожидает перевода
Prime Radiant 发布两款新技术的研究预览:Greenfield 把现有软件(代码库、文档、API 客户端等)转成行为规格语料,Iterative Development 则是一套基于 Superpowers 的智能体方法论,把大规格拆成需求、打包成开发 epic 后交给编码智能体实现。
Ожидает перевода
Почему это важно: Prime Radiant 公开两套工具的研究预览,读者可了解从旧代码库提取行为规格再驱动智能体重建产品的思路。
Claude Opus 4.7 已接入 Lovable,Lovable 基准测试显示其日常任务效率明显提升。相比 Opus 4.6,它完成任务所需轮次减少 40%,token 用量减少 10–20%,速度提升 15%,性能得分高 2–3%。对开发者而言,这意味着更快的迭代和更少的来回返工。
Ожидает перевода
Anthropic Labs 发布由 Claude Opus 4.7 驱动的 Claude Design,Pro、Max、Team、Enterprise 订阅可用,入口为 claude.ai/design,界面为左侧聊天、右侧画布,可导出 HTML、PDF、PPTX、ZIP 或送入 Canva、Claude Code。
Ожидает перевода
Steve Yegge 宣布 Gas Town 和 Beads 同日发布 v1.0.0。Beads 是面向编码智能体的记忆系统与知识图谱,v1.0 用 Dolt 替换了原先 SQLite + JSONL 的架构,双向同步、三方合并和合并冲突等问题被移除,同时支持嵌入式和服务器模式,本周 GitHub star 数突破 20k。
Ожидает перевода
Paper Compute 发布面向生产环境 AI 智能体的基础设施,包含 tapes 和 stereOS 两个组件。tapes 是零埋点的可观测层,以反向代理形式部署在智能体与推理服务之间,无需 SDK 或改代码,只需一个环境变量,即可捕获并生成可验证、防篡改的执行记录,并支持异常检测。
Ожидает перевода
Lovable 不再只构建全栈应用,其 AI 智能体现在能运行代码和 Python 脚本,直接分析文件与数据,并生成可下载的表格、PDF、幻灯片、Word 文档、图片和视频。它支持将 CSV、PDF 或截图转成可用的应用,也能生成营销报告、投资人 deck 和发票等专业文档,并导出为 PDF、PowerPoint、Excel、Word 或 CSV。
Ожидает перевода
Google 工程师开源了面向 Linux 内核的智能体 AI 代码审查系统 Sashiko,此前已在 Google 内部使用,现覆盖 Linux 内核邮件列表的全部提交。
Ожидает перевода
Superpowers 5 发布,作者称最喜欢的改动是 Visual Brainstorming 伴随工具,它会在智能体认为有内容需要展示时提示用户,通过本地 web 服务器加载智能体写出的 HTML 片段,并把浏览器里的点击和反馈回传给智能体,以替代 Claude 常生成的 ASCII 图。
Ожидает перевода
Почему это важно: 作者是 Superpowers 维护者,文中说明了 5.0 的视觉头脑风暴、spec 评审循环和子智能体开发三项变化,可据此判断是否值得接入现有工作流。
Paper Compute 发布 stereOS,一个基于 NixOS 的操作系统,让每个 AI 智能体在 gVisor 用户态虚拟内核和只读 /nix/store 根文件系统命名空间中运行沙箱。
Ожидает перевода
OpenAI 宣布 Codex 可通过 Figma MCP Server 生成 Figma 设计文件,并支持设计稿与代码双向流转。
Ожидает перевода
Почему это важно: 官方给出 Codex 与 Figma MCP 双向打通的具体操作步骤,读者可据此判断设计到代码的往返流程能否落地。
Vercel 发布新版 v0,将其定位从生成演示转向生产级应用和智能体。新版本基于沙箱运行时,可导入任意 GitHub 仓库并自动拉取 Vercel 上的环境变量和配置;新增 Git 面板,让非工程成员也能为每个对话建分支、向 main 提 PR 并在合并后部署;同时提供与 Snowflake 和 AWS 数据库的安全集成,以及默认开启的部署保护和访问控制。
Ожидает перевода
Почему это важно: v0 从生成演示转向生产级应用,给出导入 GitHub 仓库、Git 面板和数据库集成等具体能力变化。
Superpowers 4.0 发布,核心改动是把实现步骤后的代码评审拆成两个智能体:先由 spec review 智能体确认实现符合计划,通过后 code review 智能体再检查代码质量,两步都改为循环执行,协调智能体知道实现者修复后要重跑评审。
Ожидает перевода
DeepSource(YC W20)团队发布 Autofix Bot,一个把静态分析与前沿 AI 智能体结合的代码审查智能体,面向 AI 编码工作流。其混合架构分三步:5000+ 确定性检查器建立高精度基线并由子智能体抑制误报,AI 审查以静态发现为锚点并调用 AST、数据流图、控制流、导入图等工具,最后由子智能体生成修复、静态校验后输出干净的 git patch。
Ожидает перевода
Terminal-Bench выпустил версию 2.0 и пакет Harbor: первый — это более строго проверенный и сложный бенчмарк для оценки агентов, второй — для их оценки и оптимизации. Harbor переписал тестовый фреймворк Terminal-Bench: теперь можно разворачивать контейнеры в облаке, есть интерфейсы rollout для RL и SFT, а также совместимость с любыми агентами, которые упаковываются в контейнер.
Почему это важно: Вместе с Terminal-Bench 2.0 вышел Harbor — читатели узнают, как проверяются бенчмарки для агентов и как масштабировать их в облаке.