跳到正文

#OpenAI

今日 0 条
10/6周二
  1. Tproger · Программирование58

    GitHub 与 Microsoft 开放 ReviewBench 评测 AI 代码评审

    GitHub 和 Microsoft 于 2026 年 10 月 5 日开放研究预览版 ReviewBench,用于评测 AI 代码评审智能体。该基准包含来自 187 个公开仓库、19 种语言的 219 个 pull request,语言和仓库规模分布基于对 GitHub 上 1.039 亿个 pull request 的分析,并刻意提高了实质性改动的占比。

  2. 宝玉71

    SemiAnalysis 实测 Anthropic、OpenAI 等九家 AI 订阅套餐后得出,同样 200 美元,Claude 订阅折算的 Token 用量约为 OpenAI 的 5 倍。

    引用SemiAnalysis@SemiAnalysis_

    Anthropic Subscriptions Offer 5x+ More Value Than OpenAI Limit testing every AI subscription plan from Anthropic, OpenAI, Meta, SpaceXAI, MiniMax, Moonshot, Zdotai, Cursor, and Cognition https://newsletter.semianalysis.com/p/anthropic-subscriptions-offer-5x

  3. 宝玉67

    OpenAI 在 28 天更新的第 1 天宣布,通过 ChatGPT 订阅使用 GPT-6 Astra 和 GPT-6.1 Sol 时默认速度提升约 50%,用户无需改设置,两小时内生效。

    引用Tibo@thsottiaux

    Day 1/ We have optimized the default speed to be ~50% faster across GPT-6 Astra and GPT-6.1 Sol through the subscription across all our products and partners using Sign in With ChatGPT (including OpenCode, Pi, Amp, Devin, ...). No changes needed on your end and this should be felt within the next two hours.

  4. 宝玉62

    OpenAI 宣布未来几周内对欧盟用户在 ChatGPT 和 Codex 生成的文字加入不可见水印,以满足欧盟《人工智能法案》要求,API 用户可在全球范围自行开启,默认关闭。

    引用OpenAI@OpenAI

    We're expanding our approach to content provenance to include text in response to EU regulatory requirements, while recognizing the significant limitations of current text watermarking technology. Our tools already help verify whether an image or audio file was created with our models. This work builds on those efforts to help people better understand when content may have been generated or edited with an OpenAI model. In the EU, we’ll start watermarking eligible text from ChatGPT and Codex over the coming weeks to comply with the EU AI Act. Customers using our API can turn on text watermarking for select models worldwide today.

10/5周一
10/4周日
10/3周六
9/30周三
  1. Habr · Codex76

    OpenAI 发布 GPT-6.1 Sol,API 价格约为 Astra 的五分之一

    OpenAI 发布面向编程、文档处理和任务自动化的 GPT-6.1 Sol,公司称其在部分测试中接近 GPT-6 Astra。在真实代码库任务测试 DeepSWE 1.1 中,该模型追平 Astra,而执行成本约为其五分之一;在应用操控测试 OSWorld 2.0 中,最高推理档位下比 GPT-6 Sol 提升 7 个百分点。

    推荐理由:GPT-6.1 Sol 在 DeepSWE 1.1 上追平 Astra 而成本约为其五分之一,读者可据此判断编程任务的性价比变化。

9/29周二
  1. Tproger · Программирование88

    OpenAI 在 DevDay 发布 GPT-6.1 Sol,价格仅为 Astra 的五分之一

    OpenAI 在 9 月 29 日旧金山 DevDay 上发布 GPT-6.1 Sol,API 名为 gpt-6.1-sol,定价为每百万输入 token 2 美元、输出 10 美元,缓存输入 0.10 美元,标准价格是 GPT-6 Astra 的五分之一。

    推荐理由:OpenAI DevDay 发布 GPT-6.1 Sol,价格降至 Astra 的五分之一,并同步更新 Codex、Agents API 与插件体系,可据此判断成本与工具链变化。

9/26周六
  1. Habr · Codex58

    OpenAI 发布 Codex CLI 0.157.0,自动启动后台服务

    OpenAI 发布 Codex CLI 0.157.0,主要变化是工具会为支持的交互式会话自动启动后台服务器,让 Codex 的使用不再绑定在单个终端窗口。新增的 f 键可以从 CLI 分叉其他应用中打开的对话,保留草稿和排队中的提示词,/import 命令也能在远程和本地后台会话中使用。原文指出这并不代表关闭终端后任务仍会继续执行,OpenAI 没有这样的声明,后台服务器只是为共享会话打基础。

9/25周五
9/23周三
9/14周一
9/4周五
8/27周四
8/21周五
  1. OpenAI Developer Blog · Codex65

    OpenAI 发布 Daybreak 与 Codex Security 安全工作流

    OpenAI 推出 Daybreak,把 ChatGPT、Codex Security 和开源 Codex Security CLI 组合成一套安全防御工作流,覆盖 PR 合并前审查、仓库与漏洞积压排查、CI 定期检查。

    推荐理由:官方给出 Codex Security 从 PR 审查、仓库扫描到 CLI 批量扫描的完整用法,可据此判断如何接入现有安全流程。

8/19周三
8/10周一
  1. Hacker News · Claude Code 高分83

    Claude Code 将 auto mode 设为默认权限模式

    Anthropic 宣布从 8 月 14 日起,Pro、Max 和 Team 套餐的新会话默认运行 auto mode,并停止对分类器额外 token 开销收费;Enterprise、Claude API、AWS、Bedrock、Google Cloud 和 Microsoft Foundry 暂时保持可选,计划下个月改为默认。

    推荐理由:Anthropic 公布 auto mode 的安全评测数据与内部拦截案例,可据此判断默认权限模式对现有工作流的影响。

8/5周三
  1. Vercel · v0 Blog62

    Vercel 发布新版 v0 API,可编程调用应用生成智能体

    Vercel 发布新版 v0 API,提供对 v0 应用生成智能体的可编程、无头访问:发送提示词后 v0 生成应用、在 Vercel Sandbox 中启动开发服务器,并返回可嵌入自有界面的预览 URL,该 API 已正式可用。

    推荐理由:v0 把应用生成能力开放成 API,读者可据此判断如何把它接进自己的产品或智能体流程。

7/30周四
  1. Terminal-Bench · News60

    Terminal-Bench 3.0 发布:74 个任务、7 个领域,最强模型通过率约 34%

    Terminal-Bench 团队发布 Terminal-Bench 3.0,首个版本包含 7 个领域共 74 个任务,最强模型通过率约 34%。该版本在 Terminal-Bench 2.1 基础上扩展任务多样性,并引入 CI/CD、语义化版本和结果迁移来持续改进基准。

    推荐理由:Terminal-Bench 3.0 用 74 个任务和 CI/CD 版本化机制重建基准,读者可了解新基准如何拉开模型差距。

7/20周一
  1. OpenAI Developer Blog · Codex71

    Codex Code Review 支持在 AGENTS.md 中自定义评审规则

    OpenAI 为 Codex Code Review 加入自定义仓库规则能力,可在 AGENTS.md 中写入评审指引,Codex 在评审时应用相关规则并在结论中引用出处。官方评测显示,规则引导版本找回了 98% 的必需自定义问题,基线对照组为 58.3%。规则建议从兼容性要求、数据边界这类非显而易见的不变量入手,仓库级规则放根目录、服务级规则放对应目录,格式和机械检查仍交给 CI。

    推荐理由:官方给出 Codex Code Review 自定义规则的能力、写法与评测数据,可判断如何把团队评审经验固化进 AGENTS.md。

7/15周三
7/12周日
4/24周五
2/26周四
3/18周二