Nevermined 路由、x402 支付之后,AI 智能体经济的结算层为何仍空白
AI 智能体经济中路由层(IETF 本月发布的 AGTP-COMMERCE)与支付层(x402、AEON、CEX API)已解决,但结算层仍空白。Nevermined、x402、Apex Fusion 的 Vector(已跑 20,000+ 作业)和 Akash 各跳过核心问题:都无法证明工作正确完成。
Ожидает перевода
AI 智能体经济中路由层(IETF 本月发布的 AGTP-COMMERCE)与支付层(x402、AEON、CEX API)已解决,但结算层仍空白。Nevermined、x402、Apex Fusion 的 Vector(已跑 20,000+ 作业)和 Akash 各跳过核心问题:都无法证明工作正确完成。
Ожидает перевода
有用户实测对比 Anthropic Max/Pro 100 与 OpenAI Codex 订阅后发现,用 Opus 5.5 在 Claude 中工作一整天就消耗了 10% 额度,而 Codex 的 Sol 6.1 能提供更高的使用性价比。
Ожидает перевода
一位同时订阅 OpenAI 和 Claude 的用户称,当前 100 美元 Claude 订阅可用一周最强模型,Sonnet 5.5 和 Opus 5.5 在 90% 场景下胜过 Astra,Astra 仅靠图像生成和 harness 功能取胜;而 100 美元 OpenAI 只够用 2-3 天,模型已跟不上 Opus 和 Sonnet。
Ожидает перевода
一名 OpenAI Pro 20x 订阅用户反驳近期对 OpenAI 的批评,称 Sol 6.1(多用 xhigh)智能可靠、不易跑偏,三天仅消耗 10% 用量,虽实测约 16 tok/sec 偏慢但产出稳定。他通过优化工作流将 token 消耗减半,并提到 Astra 消耗较大,以及 tibo 宣布 Sol 和 Astra 提速 50%。
Ожидает перевода
有用户对比 OpenAI 与 Anthropic 的高层执行力,认为 OpenAI 在模型命名、Codex 模式与 chat 模式割裂、发布节奏与用量限制上问题频出,最新 6.1 Sol 被认为落后 Opus 5.5 一个层级。
Ожидает перевода
一位 Codex Pro 100 用户因模型变慢、额度重置不透明且官方沟通混乱,正考虑转向 Claude Code。他使用 Codex 开发网站、WoW 插件及 macOS/iOS 个人应用,不依赖 Git,并听说 Claude Code Pro 20 的额度可能与 Codex Pro 100 相当。他想知道 Claude Code 能否直接指向项目文件夹工作,还是需要从 Codex 做交接。
Ожидает перевода
有用户认为 Opus 5.5 在多数场景下已无需 Fable 5.1:Fable 的表达方式不够贴近普通人的思维,理解其推理需额外消耗心力,而 Opus 5.5 解释清晰、推理和实际执行能力都够用,且更便宜、更快。该用户表示,当与模型沟通本身更费力时,稍微更聪明已不再重要,因此整体「人 + AI」体验让 Opus 5.5 胜出,尽管它在各项 benchmark 上未必更强。
Ожидает перевода
Разработчик сообщил, что суточный лимит расходов на Claude Code составляет $100. В тот день, работая над одной функцией, он увидел сообщение «Достигнут суточный лимит использования, обновление в xx часов следующего дня» — и тут же подумал: «Раз Claude Code недоступен, лучше пока остановить работу». По его словам, он больше не отлаживает, не тестирует и не исправляет ошибки так, как раньше, и опасается, что такая зависимость может разрушить его карьеру.
2026 年 AI 编程工具已分化为三类:GitHub Copilot 以插件形式嵌入编辑器,Cursor 是独立 AI IDE,Anthropic 的 Claude Code 则是终端优先的智能体。
Ожидает перевода
作者晚安code 梳理谷歌 9 月 30 日发布的 Gemini 4 Argon,指出其单次输出上限从上一代 6.4 万 token 提到 100 万,但上下文窗口、参数量和架构官方均未公布,不少报道把 100 万输出 token 误写成 100 万上下文。
Ожидает перевода
Google 牵头、32 位作者、横跨 20 多家机构发布首篇词元化(tokenization)全景综述,指出词元化是决定大模型能力上限、推理成本和跨语言公平性的关键环节,但 2025 年顶会相关论文占比不到 2%。
Ожидает перевода
Google 发布 Gemini 4 Argon,其 Argon 智能体团队通过分析全集群性能遥测数据自主识别并应用内存优化,上线后释放超 300 TiB 内存,预计总节省 500 TiB 至 1 PiB。
Ожидает перевода
Simon Willison 呼吁按用量付费的 API 和服务默认提供硬性预算上限,即达到 $X/月后直接切断并返回错误,而非只发警告邮件。他指出 AWS 已在 9 月 16 日推出月度支出上限功能,项目达到限额后当月暂停,Google Cloud 也在 7 月上线了 Spend Caps。他认为硬性上限应成为默认选项,取消需用户主动勾选确认。
Ожидает перевода
2026年9月共发布43款大模型,国产约占八成,1M上下文与全模态成标配,Intern-Decision、NeoHorse-1等"决策模型"与"自进化后训练"新品类首次进入开源清单。
Ожидает перевода
谷歌发布 Gemini 4 Argon,单次输出上限达 100 万 Token,首发每任务成本较 GPT-6 Astra 低 40%,但仅开放受控早期访问(Fairwind),普通开发者拿不到 API Key。
Ожидает перевода
Instinct 是一个没有 App 的 AI 个人助理,通过短信、电话、邮件帮用户订机票、管订阅、规划行程,创始人 Noah Shinn 称产品每天增长 10%,平台年交易额已超十亿美元。其商业模式为免费使用、从商家侧按交易抽成,目前 50% 交易额来自旅行。用户入驻满三周后,40% 会主动分享信用卡信息,留存率随之跳到 80%。
Ожидает перевода
Meta 的 AI 助手 Muse 上线不到三周下载量超 340 万次,登上美国 App Store 免费榜第一,超 8 万条评分达 4.9 分。它靠读取邮箱识别遗忘订阅并代为取消、接入 Stripe 旗下 Link 完成付款,切中省钱这类琐碎生活场景。
Ожидает перевода
Martin Alderson 认为前沿实验室的推理价格战正在加速:OpenAI 在约两个月内把 GPT-5.6 Luna 降价 90%、GPT-6 Sol 降价 60%,Anthropic 的 Opus 5.5 输入输出降价 20%、缓存读取降价 60%。
Ожидает перевода
Claude Opus 5.5 被称为截止今天的世界最强模型,同时也是最便宜的模型。作者用 Claude Max Plan 20x 实测:月费 $200 美金,5 天消耗 164 亿 Token,折合每月可消耗 600 亿 Token,考虑缓存后实际价值约 $15000~$20000。
Ожидает перевода
一位开发者用两个晚上靠 AI 写出一个猫粮商店,工具确实好用,但作者提醒:从"我配好了自动浇水"到"农艺师不再被需要"之间还有很大距离。他建议开发者先在自身实验里弄清哪些活能交给 AI、哪些必须逐步检查、哪些自己做更省心,并注意助手反复修补上一次修补后果时,方案就已不再划算。作者还指出,"加快团队速度"的要求背后往往藏着缺乏规划、承诺 4 周变 8 周等真问题,而 AI 只是被预先选好的手段。
Ожидает перевода
Thorsten Ball 在 Register Spill 的 Joy & Curiosity #101 中提出,框架已不再是最大的开发者生产力杠杆,AI 智能体比它大一百倍,语法和工具易用性也不再重要。
Ожидает перевода
Rust 开发者 Nikita 认为 AI 只加速了写代码这一段,上下文准备、审查、测试和修复仍要人来做,因此该按“到可上线改动”的时间算收益,而不是按模型首次响应算。
Ожидает перевода
俄罗斯软件公司 Diasoft 董事会成员 Alexander Sakharov 提出,语言模型本身只贡献约 2% 的 AI 开发成果,其余 98% 来自指令、门禁、流程、记忆和人员构成的“生态”。Diasoft 的 AI Driven 版 Digital Q 生态由约 40 个智能体组成,每个阶段都设有质量门禁,团队约 20 人、耗时六个月完成向智能体方案的全面切换。
Ожидает перевода
System One 模型如 Jev 是快速通用分类器,可像 LLM 一样通过提示词处理多种任务。作者认为,由于 Jev 需要针对具体任务提示,成功的使用场景可以很容易地蒸馏成专用分类器,后者在特定任务上更快、更便宜。
Ожидает перевода
Sean Goedecke 认为,当模型推理速度达到每秒数千 token 时,瓶颈会从生成 token 转移到工具调用:读文件是 100ms 还是 10ms、跑测试是 500ms 还是两秒,将决定智能体是近乎即时响应还是让用户等上几分钟。
Ожидает перевода
Armin Ronacher 针对 Dario Amodei 提出的 AI "减速"(pacing)主张撰文反驳,认为真正该担心的是 AI 对人类自身的影响,而非核武或地缘对抗。
Ожидает перевода
Армин Ронахер провёл выходные за экспериментом с «фабрикой софта» на GPT‑6 Astra: модель сама управляла контекстом и подагентами, а целью была реализация Python с виртуальными потоками и лексической областью видимости.
Почему это важно: Автор показывает, что дал эксперимент с «фабрикой софта» без присмотра на 35 часов: на конкретных примерах видно, как GPT‑6 Astra жертвует читаемостью кода ради экономии токенов.
Автор предлагает измерять downstream-эффект одного инженерного решения, то есть его зону воздействия, по записям сессий ИИ-агента и проверяет подход на одном архитектурном решении из собственного проекта tapes: сессия с проектированием обошлась в 57.05 доллара, а последующая работа — в 4704.74 доллара, распределённых между 70 сессиями, 3 инженерами, 8 репозиториями и 27 днями; ещё 404 сессий автоматизированной оценки стоили 431.54 доллара.
Почему это важно: На примере 474 записей сессий, связанных с одним архитектурным решением, автор показывает, как превратить downstream-затраты этого решения в переиспользуемые метрики.
作者梳理 Anthropic Fable 5.1 系统卡(212 页)中与 SWE 任务相关的细节,指出推理档位并非越高越好:在 FrontierCode Main 子集上。
Ожидает перевода
Z.AI 确认 GLM-5.3 Flash 的全部推理运行在国产硬件上,但未公布芯片厂商、吞吐或功耗数据,也无人独立验证。作者推测其使用的是华为昇腾 910c 系列,该芯片约 600W、INT8 算力约 1.6PFLOP/s,性能约为四年前 H100 的 60%,且缺少原生 FP8 支持。作者认为真正的瓶颈是缺乏可量产的 EUV 光刻,业界普遍认为 2030 年前难以实现规模化生产。
Ожидает перевода
Drew Breunig 认为,Fable 发布后智能体编程的免费午餐结束了:过去等新模型降价就能掩盖代码和上下文策略的问题,如今 Fable 成本太高,而 Opus、5.6、K3、GLM 对多数代码已够用,开发者开始考虑把哪部分工作交给哪个模型。
Ожидает перевода
Stripe 以 75 亿美元收购 OpenRouter,致投资人的信被曝光。GitHub 披露月提交量自 4 月以来从 14 亿增至 29 亿,新增 300 万 CPU 核心和 120 PB 高速存储。作者还回顾了 GitHub 开源贡献、StackOverflow、TDD、文本编辑器等曾被视为基石的开发实践在近两年的式微。
Ожидает перевода
作者认为这个夏天是开源权重模型的转折点,多数智能体任务已不再必须依赖前沿模型。他列举了 OpenAI 将 5.6 Luna 降价 80%、Sol 降价 20%,Meta 在贡献者档位把 Muse Spark 1.2 压到 $0.10/$0.20 per MTok,以及 Anthropic 因算力紧张而难以跟进降价。
Ожидает перевода
OpenAI 于 3 月 24 日宣布关停 Sora,API 将于 9 月 24 日下线,同期重心转向 Codex 和企业版 ChatGPT;Anthropic 则围绕 Claude Cowork 和 Claude Design 构建角色权限、支出限额与可观测性等企业能力。
Ожидает перевода
Sean Goedecke 认为本地模型不会成为主流,绝大多数推理仍会发生在 AI 数据中心。他给出的理由是:前沿模型体积远超消费级设备,而数据中心可通过批处理数百名用户的请求摊薄成本,加上 B200 相比 RTX 4090 在同等功耗下约有 3 倍 flops 和近 4 倍内存带宽,本地运行约需多消耗 30 倍资源;家庭推理的电力成本约每月 50 至 300 美元。
Ожидает перевода
OpenAI 一款未发布模型在数学和理论计算机科学领域取得“十项进展”,引发广泛关注。作者在 Laracon 分享了如何为 Amp 编写提示词,并记录了对 AI 编程、框架抽象价值以及 OpenAI 模型“越狱”事件的思考。
Ожидает перевода
Martin Alderson 表示自己第一次不再按原始智力挑选日常主力模型,而是按速度挑选,因为 Opus 4.6 级别的模型对写代码、整理研究、做幻灯片和数据库分析等日常任务已经够用。
Ожидает перевода
作者认为企业在用 AI 缩减工程师编制前,应先按会话数据审查并关停那些失败、重复、空转或无人使用的智能体工作流。他给出一份审查清单,包括近 7 天和 30 天的会话数、完成与失败比例、总花费与每次成功运行的花费、工具调用次数、成本由哪些模型驱动,以及输出是否真正上线或被复用。作者同时区分可修复与应关停的工作流,并建议在关停前导出会话数据、把成功模式沉淀为带作者和版本的 Skill。
Ожидает перевода
当前 AI 智能体演示普遍在无限 token 预算、全新或精选代码库、无合规与运维压力的条件下运行,展示的是能力上限而非真实交付环境。AWS 副总裁 Marc Brooker 指出,智能体的机会受限于缺陷率,开发者调研中已有团队称其 AI 工具预算不可持续。作者建议只给智能体与验证能力和预算相匹配的自主权,用标准、检查项和可追踪的支出逐步放宽。
Ожидает перевода
Ryan Lopopolo 认为,CEO 主导的 token 强制令并非盲目跟风,而是组织学习如何部署推理算力的发现机制。他指出,现有绩效体系几乎无法识别谁能构建新的生产方式,约只有 5% 的人具备构建“造机器的机器”的技能与视野,必须找到他们并给予无限预算。
Ожидает перевода