OpenAI 为 ChatGPT 和 Codex 生成文本加入不可见水印
OpenAI 在 ChatGPT 和 Codex 中为生成文本加入不可见水印,以符合欧盟 AI 法案对机器可读标识的要求,目前仅面向欧盟用户,未来几周自动生效。
OpenAI 在 ChatGPT 和 Codex 中为生成文本加入不可见水印,以符合欧盟 AI 法案对机器可读标识的要求,目前仅面向欧盟用户,未来几周自动生效。
SemiAnalysis 实测 Anthropic、OpenAI 等九家 AI 订阅套餐后得出,同样 200 美元,Claude 订阅折算的 Token 用量约为 OpenAI 的 5 倍。
Anthropic Subscriptions Offer 5x+ More Value Than OpenAI Limit testing every AI subscription plan from Anthropic, OpenAI, Meta, SpaceXAI, MiniMax, Moonshot, Zdotai, Cursor, and Cognition https://newsletter.semianalysis.com/p/anthropic-subscriptions-offer-5x
OpenAI 宣布未来几周内对欧盟用户在 ChatGPT 和 Codex 生成的文字加入不可见水印,以满足欧盟《人工智能法案》要求,API 用户可在全球范围自行开启,默认关闭。
We're expanding our approach to content provenance to include text in response to EU regulatory requirements, while recognizing the significant limitations of current text watermarking technology. Our tools already help verify whether an image or audio file was created with our models. This work builds on those efforts to help people better understand when content may have been generated or edited with an OpenAI model. In the EU, we’ll start watermarking eligible text from ChatGPT and Codex over the coming weeks to comply with the EU AI Act. Customers using our API can turn on text watermarking for select models worldwide today.
作者用 npm 发布时间戳统计 2026 年 Q3 的发布次数:Claude Code 发布 79 个版本、Codex CLI 38 个、Gemini CLI 15 个,中位发布间隔分别为 0.96 天、1.64 天和 6.09 天。
Claude Max 5x 每月 100 美元、Max 20x 每月 200 美元,均仅支持按月计费,两档功能完全相同,差别只在用量是 Pro 的 5 倍还是 20 倍。对多数用户而言 Max 5x 更划算,多付的 100 美元只买到额度;两个 Max 5x 席位合计 200 美元,与一个 Max 20x 同价。Max 20x 仅在每个工作日都跑满 Pro 级限额时才值得。
Anthropic 宣布投入 1 亿美元成立 Claude Frontier Academy,目标在 2027 年底前培养 1 万名 FDE(前沿部署工程师)。
Claude Code 2.1.284 将 Claude Sonnet 5.5(claude-sonnet-5-5)设为 Anthropic API 默认 Sonnet 模型,1M 上下文,$2/$10 per MTok,价格与 Sonnet 5 持平。
JetBrains 为 IDE 内的 Air 开启早期访问计划,插件已上架 Marketplace,2026.3 EAP 版本中已内置。
OpenAI 发布 GPT-6 Sol 和 Luna,Sol 定价 $2/$10 MTok、约为 GPT-5.6 的一半,DeepSWE 68.8%,Luna 定价 $0.10/$0.50 MTok。
OpenAI 将重新向新订阅者开放 200 美元的 Pro 订阅,但调整了额度计算方式。据 Тибо Соттио 说法,按 API 消耗折算,新方案提供的用量约为旧版 Pro 200 的一半。
Anthropic 为 Claude 开发者开放插件提交门户,可提交扩展审核并发布到 Claude Directory。付费套餐开发者可提交带远程服务器的 MCP 连接器,或整合 MCP 服务器与 Agent Skills 并托管在 GitHub 的 bundle。
Claude Code 2.1.283 于 9 月 25 日发布,管理员可通过 availableModelsMatch: "exact" 只允许指定模型版本,并用 deniedModels 单独禁用模型,避免新版本未经批准进入受管环境。
Claude Tag in Slack can now use your personal connectors! You can now securely access that Drive doc, Salesforce account, or Warehouse table that you have personal access to right where the work happens. Avail. on Teams today and Enterprise next week https://claude.com/blog/claude-tag-now-supports-personal-connectors-in-channels
Anthropic 发布 Claude Code 2.1.282,修复了使用 --continue 和 --resume 启动时重发旧消息、extended thinking 块丢失,以及恢复后的会话可能无法处理请求的问题。
Anthropic 于 9 月 22 日发布旗舰模型 Claude Opus 5.5,面向让智能体执行编程、数据分析等多步任务的开发者与团队,官方称相比 Opus 5 性能提升且成本下降。
推荐理由:Anthropic 官方公布的定价与默认负载成本降幅,可帮开发者判断长时智能体任务的迁移成本。
Lovable 上线 Opus 5.5,官方称其与 Opus 5 结果持平,但完成步数减少三分之一到一半。在 Lovable 内部基准上,Opus 5.5 在 0-to-1 构建和迭代改代码两项与 Opus 5 打平,验证纪律一项高出 4% 到 6%;各档推理强度下每任务步骤数减少 26% 到 57%,输入 token 减少 21% 到 59%,差异在 95% 置信水平上显著。
推荐理由:Lovable 官方给出 Opus 5.5 与 Opus 5 在步骤数和 token 上的对比数据,可据此判断构建效率的实际变化。
Claude Code 从 2.1.277 版本开始支持 AGENTS.md:当文件夹中没有 CLAUDE.md 时,Claude 会检查并使用 AGENTS.md。该支持基于 Claude Code mods 构建,这是其即将推出的定制 Claude Code harness 的方式,属于内置 mod,用户之后也可以自行构建自定义版本的项目指令。
开发者 pdfu 在 iOS 27 和 macOS Golden Gate 的私有框架中发现,Apple 的新 Siri 架构设计了与第三方 AI 模型对接的机制。
OpenAI 于 2026 年 9 月 3 日发布 GPT-6 Astra 与 Astra Pro,首批仅限 Daybreak 网络安全计划企业,ChatGPT 付费版、API 和 AWS 将在随后几天开放。
推荐理由:梳理 GPT-6 Astra 与 Fable 5.1 的基准对比,指出各家测试版本与 harness 不一致,读者可据此判断哪些分数可比。
斯坦福大学研究人员主导、Terminal-Bench 团队联合全球科研机构专家打造的 Terminal-Bench-Science 0.1 发布,首批含生命、物理、地球、数学和工程科学领域的 70 项任务。
Anthropic 宣布从 8 月 14 日起,Pro、Max 和 Team 套餐的新会话默认运行 auto mode,并停止对分类器额外 token 开销收费;Enterprise、Claude API、AWS、Bedrock、Google Cloud 和 Microsoft Foundry 暂时保持可选,计划下个月改为默认。
推荐理由:Anthropic 公布 auto mode 的安全评测数据与内部拦截案例,可据此判断默认权限模式对现有工作流的影响。
Claude Code 新增跨会话消息功能,让一个会话把发现、状态或决定以纯文本发给另一个会话,Claude 通过 ListAgents 找目标、SendMessage 发送,用户无需手动调用这两个工具。
Terminal-Bench 团队发布 Terminal-Bench 3.0,首个版本包含 7 个领域共 74 个任务,最强模型通过率约 34%。该版本在 Terminal-Bench 2.1 基础上扩展任务多样性,并引入 CI/CD、语义化版本和结果迁移来持续改进基准。
推荐理由:Terminal-Bench 3.0 用 74 个任务和 CI/CD 版本化机制重建基准,读者可了解新基准如何拉开模型差距。
Lovable 上线 agent integrations,任何公开已发布的 Lovable 应用都能添加 MCP server,从而被 ChatGPT、Claude 等 AI 工具直接调用。
推荐理由:Lovable 把已发布应用接入 MCP,读者可据此判断自家应用如何被 ChatGPT、Claude 直接调用。
Superpowers 6 发布,作者称在 Anthropic 评测基准上构建耗时降低 50%、token 花费降低 60%,主要来自合并规范符合性与代码质量两个评审 agent、预先生成评审用的 diff 包让评审者少跑 git,以及调整编排器对任务所需 agent 类型的指引。
推荐理由:作者用自建评测套件量化了 Superpowers 6 在构建耗时和 token 花费上的改进,并公开了实验记录与失败结论。
Andrej Karpathy 评价 Claude Fable 5 发布,指出它与 Mythos 是同一底层模型,只是增加了安全防护,在几乎所有基准上以明显优势达到 SOTA。
Fable 5 is state-of-the-art on nearly all tested benchmarks, with exceptional performance in software engineering, knowledge work, scientific research, and vision. The longer and more complex the task, the larger Fable 5’s lead over our other models.
Anthropic 在 Claude Code 中发布动态工作流,Claude 可针对具体任务即时编写自己的 harness,并支持分享和复用。工作流通过 agent()、parallel()、pipeline() 等函数编排子智能体,可指定每个智能体使用的模型和是否在独立 worktree 中运行,中断后恢复会话能接着执行。
推荐理由:Anthropic 团队拆解动态工作流的六种编排模式与适用边界,可迁移到多智能体任务设计。
Claude Opus 4.7 已接入 Lovable,Lovable 基准测试显示其日常任务效率明显提升。相比 Opus 4.6,它完成任务所需轮次减少 40%,token 用量减少 10–20%,速度提升 15%,性能得分高 2–3%。对开发者而言,这意味着更快的迭代和更少的来回返工。
Anthropic Labs 发布由 Claude Opus 4.7 驱动的 Claude Design,Pro、Max、Team、Enterprise 订阅可用,入口为 claude.ai/design,界面为左侧聊天、右侧画布,可导出 HTML、PDF、PPTX、ZIP 或送入 Canva、Claude Code。
Anthropic 为 Opus 4.6 和 Sonnet 4.6 推出 1M 上下文窗口正式版,作者实测约 500K token 的 Claude Code 会话仍能保持任务连贯。
Superpowers 5 发布,作者称最喜欢的改动是 Visual Brainstorming 伴随工具,它会在智能体认为有内容需要展示时提示用户,通过本地 web 服务器加载智能体写出的 HTML 片段,并把浏览器里的点击和反馈回传给智能体,以替代 Claude 常生成的 ASCII 图。
推荐理由:作者是 Superpowers 维护者,文中说明了 5.0 的视觉头脑风暴、spec 评审循环和子智能体开发三项变化,可据此判断是否值得接入现有工作流。
Anthropic 在 Claude Code、Claude.ai 和 Claude API 同步上线第一方 Skills 系统,作者 Jesse Vincent 随即发布改用官方 Skills 的 Superpowers 新版本。
推荐理由:作者以近一个月的实际使用经验,对比官方 Skills 与自建方案的差异,并给出迁移中的取舍。
Anthropic 将 Terminal-Bench 列为 Claude 4 模型卡七项基准之一,Claude 4 Opus 在 Terminal-Bench-Core 上取得 43.2% 的 SOTA 成绩。Dario Amodei 在 Code with Claude 主题演讲中也提及该基准。Terminal-Bench 团队表示将在未来几天验证 Claude 4 的表现并更新官方排行榜。
AI 代码审查平台 Graphite 完成 5200 万美元 B 轮融资,由 Accel 领投,Anthropic 的 Anthology Fund、Shopify Ventures、Figma Ventures、Andreessen Horowitz 等参投。