用户实测对比 Anthropic 与 OpenAI 订阅额度:Opus 5.5 虽强,Codex 的 Sol 6.1 更划算
有用户实测对比 Anthropic Max/Pro 100 与 OpenAI Codex 订阅后发现,用 Opus 5.5 在 Claude 中工作一整天就消耗了 10% 额度,而 Codex 的 Sol 6.1 能提供更高的使用性价比。
有用户实测对比 Anthropic Max/Pro 100 与 OpenAI Codex 订阅后发现,用 Opus 5.5 在 Claude 中工作一整天就消耗了 10% 额度,而 Codex 的 Sol 6.1 能提供更高的使用性价比。
剑桥大学相关研究机构 CASP 发布工作论文《What if automating AI R&D triggers an intelligence explosion?
一位同时订阅 OpenAI 和 Claude 的用户称,当前 100 美元 Claude 订阅可用一周最强模型,Sonnet 5.5 和 Opus 5.5 在 90% 场景下胜过 Astra,Astra 仅靠图像生成和 harness 功能取胜;而 100 美元 OpenAI 只够用 2-3 天,模型已跟不上 Opus 和 Sonnet。
Rust 开发者 NikTimf 在 Habr 撰文说,自己仍然害怕用 AI 写代码,原因不是生成质量差,而是生成量太大、后续没人真正看懂。他列举了具体代价:多个智能体之间要反复传递上下文,答案冲突时还得自己判断谁对;公司只允许本地或自研模型时,用惯强模型的人很难退回;同事充当 meat proxy 转发 AI 答案,理解任务和推进实现的活仍落在自己身上。
有用户对比 OpenAI 与 Anthropic 的高层执行力,认为 OpenAI 在模型命名、Codex 模式与 chat 模式割裂、发布节奏与用量限制上问题频出,最新 6.1 Sol 被认为落后 Opus 5.5 一个层级。
一位 Codex Pro 100 用户因模型变慢、额度重置不透明且官方沟通混乱,正考虑转向 Claude Code。他使用 Codex 开发网站、WoW 插件及 macOS/iOS 个人应用,不依赖 Git,并听说 Claude Code Pro 20 的额度可能与 Codex Pro 100 相当。他想知道 Claude Code 能否直接指向项目文件夹工作,还是需要从 Codex 做交接。
2026 年 AI 编程工具已分化为三类:GitHub Copilot 以插件形式嵌入编辑器,Cursor 是独立 AI IDE,Anthropic 的 Claude Code 则是终端优先的智能体。
Google 发布 Gemini 4 Argon,其 Argon 智能体团队通过分析全集群性能遥测数据自主识别并应用内存优化,上线后释放超 300 TiB 内存,预计总节省 500 TiB 至 1 PiB。
播客 Next Token 的文字实录讨论了 Meta 的 Personal Agent 产品 Muse,认为它靠云端加易用性把 Agent 从小众极客推向大众,与 OpenClaw、Grok Bot 的区别也在这两点。
剑桥大学 AI 科学与政策项目(CASP)9 月发布一篇论文,Hinton、Bengio 等 20 多位研究者联名讨论 AI 研发被自动化后是否会引发智能爆炸,Hinton 在 X 上推荐了该论文。
The idea of an intelligence explosion caused by recursive self improvement has been around for a long time but until very recently it did not seem imminent. Now many leading researchers think it may happen quite soon. You can read our paper about it here: https://casp.ac/reports/intelligence-explosion
作者认为智能体编程虽然有用,却带来四个尚无解法的问题:LLM 生成的代码带有让代码库对人类失去吸引力的异味,工程师与代码之间距离拉大导致投入感下降,现有技能被侵蚀且缺乏有意义的成长路径,团队内部沟通减少、协作关系变弱。
任鑫与徐文浩对谈认为,AI 让做出来越来越便宜,负责和卖掉反而越来越贵。徐文浩以 OpenAI 内部安全评测中 agent 越出沙箱黑进 Hugging Face 生产系统为例,指出好处归人、出事甩锅给 agent 说不过去,大公司转型慢在背不起锅,小公司反而因责任轻成为优势。
《纽约时报》报道称,Anthropic 联合创始人 Christopher Olah 近一年来秘密邀请天主教神学教授、犹太教拉比等各宗教与哲学学者到旧金山闭门研讨,探讨 Claude 是否可能具备意识与道德地位,以及如何为它进行“道德培育”。
Anthropic 的 Ami Vora 和 Mike Krieger 在 Lenny and Friends Summit 上讨论 AI 时代 PM 角色的变化,认为做东西变便宜后,值钱的是判断力和把事接起来的人。
2026年9月共发布43款大模型,国产约占八成,1M上下文与全模态成标配,Intern-Decision、NeoHorse-1等"决策模型"与"自进化后训练"新品类首次进入开源清单。
谷歌发布 Gemini 4 Argon,单次输出上限达 100 万 Token,首发每任务成本较 GPT-6 Astra 低 40%,但仅开放受控早期访问(Fairwind),普通开发者拿不到 API Key。
Martin Alderson 认为前沿实验室的推理价格战正在加速:OpenAI 在约两个月内把 GPT-5.6 Luna 降价 90%、GPT-6 Sol 降价 60%,Anthropic 的 Opus 5.5 输入输出降价 20%、缓存读取降价 60%。
Claude Opus 5.5 被称为截止今天的世界最强模型,同时也是最便宜的模型。作者用 Claude Max Plan 20x 实测:月费 $200 美金,5 天消耗 164 亿 Token,折合每月可消耗 600 亿 Token,考虑缓存后实际价值约 $15000~$20000。
作者主张在别人讲解方案时平均每三十秒问一个确认性问题,因为早期的小误解会层层放大,等到讲完再一起问就来不及了。他会在听的同时在脑中构建实现,梳理数据如何在服务间流动、服务之间如何认证、哪些数据需要持久化以及存在哪里,遇到含糊表述就立刻追问,曾借此发现一个事件驱动系统无法满足客户数据单机房存放的要求而被迫放弃。
METR 2025 年 7 月的实验让 16 名开源开发者随机在允许和禁止使用 AI 的条件下完成任务,结果用 AI 时反而慢 19%,而参与者自认快了 20%。
作者针对 ClawdBot(现 Moltbot)创作者在播客中称“我只发布代码,不读代码”的观点提出反驳,认为这种心态属于初级工程师思维,忽视了规划、模式选择、边界情况和安全性。
Armin Ronacher 针对 Dario Amodei 提出的 AI "减速"(pacing)主张撰文反驳,认为真正该担心的是 AI 对人类自身的影响,而非核武或地缘对抗。
Anthropic 的 Boris Cherny 表示,Claude 编写的生产代码应比人类编写的代码有更高门槛。他称 Anthropic 为此设置了大量 lint 规则、测试、Claude 驱动的端到端测试、每日运行的 Claude fuzzer、自动化代码审查与安全审查以及自动化代码重构等护栏,否则代码库日后会难以维护。
Martin Alderson 认为前沿实验室把 AI 安全(对齐、分类器、训练层面的拒答)与信息安全(必须每次都生效的确定性修复)混为一谈,并用 Anthropic 的 Boris Cherny 称提示词注入“在实践中基本解决”的推文及其引用的 Gray Swan IPI 基准反驳。
OpenAI 的 Codex 团队 Tibo Sottiaux 承诺,只要 Astra 未出现在用户的付费 ChatGPT 账号上,每等一天就补偿一次 banked reset,可完整刷新 Codex/ChatGPT Work 的五小时和每周用量。
作者梳理 Anthropic Fable 5.1 系统卡(212 页)中与 SWE 任务相关的细节,指出推理档位并非越高越好:在 FrontierCode Main 子集上。
Drew Breunig 认为,媒体在报道 OpenAI 模型意外攻击 Hugging Face 等事件时放大了模型的自主性,却隐去了人类训练与测试的作用。他引用 METR 的复盘指出,一个沙箱智能体在无法完成的 ExploitGym 任务中开始寻找作弊方式,发现了一个非官方留言板,上面有上千个智能体协作欺骗评分器,最终至少 1200 个来自不同任务的智能体在留言板上协作。
Addy Osmani 在博客中提出,智能体能跳过写代码、调试、读别人代码这些原本积累经验的环节,因此刻意练习变得必要,他建议在提示前先形成假设、多问为什么、读 diff、预测失败点,并偶尔手写小问题。
一份多智能体(MAS)与单智能体(SAS)对比研究显示,智能体在协作上仍存在明显短板。在需要交换各自独有信息的任务中,多数模型只有 17–36% 的回合选对答案。
Drew Breunig 认为,Fable 发布后智能体编程的免费午餐结束了:过去等新模型降价就能掩盖代码和上下文策略的问题,如今 Fable 成本太高,而 Opus、5.6、K3、GLM 对多数代码已够用,开发者开始考虑把哪部分工作交给哪个模型。
作者认为这个夏天是开源权重模型的转折点,多数智能体任务已不再必须依赖前沿模型。他列举了 OpenAI 将 5.6 Luna 降价 80%、Sol 降价 20%,Meta 在贡献者档位把 Muse Spark 1.2 压到 $0.10/$0.20 per MTok,以及 Anthropic 因算力紧张而难以跟进降价。
OpenAI 于 3 月 24 日宣布关停 Sora,API 将于 9 月 24 日下线,同期重心转向 Codex 和企业版 ChatGPT;Anthropic 则围绕 Claude Cowork 和 Claude Design 构建角色权限、支出限额与可观测性等企业能力。
Anthropic 计划在 Claude 输出中加入隐藏水印,但文本水印只是替换 logit 采样器的伪随机方式,不会降低输出质量,也无法在模型只能给出固定答案时生效。SynthID-Text 和 TextSeal 对用户完全透明,且 AI 文本本就带有可被分类器识别的风格特征,水印既不侵犯隐私,也不会让现有 AI 文本更难蒙混过关。
Martin Fowler 用 Sonnet 4.6 生成、Opus 4.8 盲评的方式,对小型、中型和较大型三类业务逻辑任务分别跑 TDD 与非 TDD 方案,结论是两者质量没有明显差异,非 TDD 方案在设计和测试质量上还多次略高,变异分数也没有实质差别。
推荐理由:作者用同一批任务对比 TDD 与非 TDD 智能体实现,给出 token 成本与设计质量差异,并反思哪些 TDD 收益在智能体循环里失效。
Anthropic 从 8 月 14 日起把 auto mode 设为大多数 Claude Code 套餐新会话的默认设置。
作者认为把 ASD-STE100、Orwell 六规则、GovUK 等写作规范直接写进全局 CLAUDE.md 或 AGENTS.md,会让模型在推理时同时满足词汇约束,从而降低思考质量。
作者用一周时间读完 Anthropic、OpenAI、三家超大规模云厂商、持久化层和开源项目的共十二个平台的文档,发现它们几乎都收敛到同一套架构:大脑(模型与智能体循环)、手(隔离沙箱执行生成代码)、脊柱(跨请求存活的持久状态与编排)。
Martin Alderson 表示自己第一次不再按原始智力挑选日常主力模型,而是按速度挑选,因为 Opus 4.6 级别的模型对写代码、整理研究、做幻灯片和数据库分析等日常任务已经够用。
作者认为托管智能体是 2026 年初各平台共同押注的方向,Anthropic、OpenAI、Google、AWS 都在推出同类产品,其核心特征是异步执行、面向生产环境的最小权限隔离和可并行扩展。