Nevermined 路由、x402 支付之后,AI 智能体经济的结算层为何仍空白
AI 智能体经济中路由层(IETF 本月发布的 AGTP-COMMERCE)与支付层(x402、AEON、CEX API)已解决,但结算层仍空白。Nevermined、x402、Apex Fusion 的 Vector(已跑 20,000+ 作业)和 Akash 各跳过核心问题:都无法证明工作正确完成。
Ожидает перевода
AI 智能体经济中路由层(IETF 本月发布的 AGTP-COMMERCE)与支付层(x402、AEON、CEX API)已解决,但结算层仍空白。Nevermined、x402、Apex Fusion 的 Vector(已跑 20,000+ 作业)和 Akash 各跳过核心问题:都无法证明工作正确完成。
Ожидает перевода
一个组织内部正讨论 AI 落地时的 guardrails,包括共享 Skill、配置以及强制智能体行为,但发帖者认为这些限制很容易被绕过——用户可以直接让 Claude 修改 settings.json,或交出数据库密码让 Claude 查询数据库。
Ожидает перевода
一篇俄语文章把 Vibe Coding 的开发者分成从「Воин(战士)」到「Некромант(亡灵法师)」的十余种角色,用表格列出每种角色的开发方式。
Ожидает перевода
Автор считает, что инъекцию промпта не стоит пытаться решить с помощью более умных моделей. Вместо этого границу нужно провести там, где агент выполняет действия, — так же, как при SQL-инъекциях используют параметризованные запросы.
Почему это важно: Автор проводит аналогию между инъекцией промпта и SQL-инъекцией и предлагает перенести границу с уровня модели на уровень вызова инструментов, а также приводит практичную схему: стратегический слой и поэтапное разделение чтения и записи.
В феврале автор подключил к ИИ-агенту для разработки 11 MCP Server, и в пустом сеансе только список инструментов занимал 34,000 токенов; один Datadog добавил больше двухсот инструментов, из-за чего агент замедлился и стал часто выбирать не те инструменты.
Почему это важно: На своём опыте с 11 MCP Server, которые перегрузили контекст, автор показывает, что инструменты и знания должны лежать в разных «контейнерах».
有用户实测对比 Anthropic Max/Pro 100 与 OpenAI Codex 订阅后发现,用 Opus 5.5 在 Claude 中工作一整天就消耗了 10% 额度,而 Codex 的 Sol 6.1 能提供更高的使用性价比。
Ожидает перевода
一位同时订阅 OpenAI 和 Claude 的用户称,当前 100 美元 Claude 订阅可用一周最强模型,Sonnet 5.5 和 Opus 5.5 在 90% 场景下胜过 Astra,Astra 仅靠图像生成和 harness 功能取胜;而 100 美元 OpenAI 只够用 2-3 天,模型已跟不上 Opus 和 Sonnet。
Ожидает перевода
一名 OpenAI Pro 20x 订阅用户反驳近期对 OpenAI 的批评,称 Sol 6.1(多用 xhigh)智能可靠、不易跑偏,三天仅消耗 10% 用量,虽实测约 16 tok/sec 偏慢但产出稳定。他通过优化工作流将 token 消耗减半,并提到 Astra 消耗较大,以及 tibo 宣布 Sol 和 Astra 提速 50%。
Ожидает перевода
Rust 开发者 NikTimf 在 Habr 撰文说,自己仍然害怕用 AI 写代码,原因不是生成质量差,而是生成量太大、后续没人真正看懂。他列举了具体代价:多个智能体之间要反复传递上下文,答案冲突时还得自己判断谁对;公司只允许本地或自研模型时,用惯强模型的人很难退回;同事充当 meat proxy 转发 AI 答案,理解任务和推进实现的活仍落在自己身上。
Ожидает перевода
车臣共和国小企业管理部门负责人穆拉德·扬达罗夫分享了自己零散使用 AI 的经验:用 Claude 合并 5-6 张跨 5 个共和国的表格、生成 Word 文档,用 Gemini 解读晦涩术语,用 Perplexity 查资料、Nano Banana 2 做演示配图,并称这些工具每月为他省下 3-4 个工作日。
Ожидает перевода
开源项目正被会读规则、提 PR 甚至合并代码的 AI 智能体改变,而把"规则"存在某个智能体的上下文窗口里只是传闻,不是宪法。文章提出用 MCP 管理的记忆服务器承载机器可读的宪法:每条规则带稳定标识符、Merkle 哈希、含法定人数与延迟参数的修订流程,以及约束智能体角色的依赖图。
Ожидает перевода
有用户对比 OpenAI 与 Anthropic 的高层执行力,认为 OpenAI 在模型命名、Codex 模式与 chat 模式割裂、发布节奏与用量限制上问题频出,最新 6.1 Sol 被认为落后 Opus 5.5 一个层级。
Ожидает перевода
有用户认为 Opus 5.5 在多数场景下已无需 Fable 5.1:Fable 的表达方式不够贴近普通人的思维,理解其推理需额外消耗心力,而 Opus 5.5 解释清晰、推理和实际执行能力都够用,且更便宜、更快。该用户表示,当与模型沟通本身更费力时,稍微更聪明已不再重要,因此整体「人 + AI」体验让 Opus 5.5 胜出,尽管它在各项 benchmark 上未必更强。
Ожидает перевода
开源社区正被能读代码、提 PR 甚至合并代码的 AI 智能体"殖民",而它们对项目治理规则的记忆可能各不相同。文章提出把规则写成结构化文档存入 MCP 管理的记忆服务器,每条规则带稳定标识符、Merkle 哈希、修订程序和依赖图,智能体通过 MCP 工具查询而非读 README。
Ожидает перевода
2026 年 AI 编程工具已分化为三类:GitHub Copilot 以插件形式嵌入编辑器,Cursor 是独立 AI IDE,Anthropic 的 Claude Code 则是终端优先的智能体。
Ожидает перевода
OpenAI 负责 ChatGPT 和 Codex 的 Tibo Sottiaux 在 Lenny's Podcast 访谈中表示,让用户自己搭循环、画流程图、反复调教工作流只是过渡,真正会赢的是 Dots 这类会学习、永远在线的 agent。
Ожидает перевода
В ответ на то, что LLM вроде GPT-4 и Claude 3.5 в многошаговых диалогах забывают контекст и поддакивают пользователю (sycophancy), 123sudo выпустил рабочую область с привязкой к проекту 9xChat: она привязывает ИИ к локальным файлам проекта, а не к хрупкой истории чата, и позволяет в одном окне запускать GPT-4 и Claude 3.5 рядом, чтобы они писали код и проверяли друг друга. Контекст остаётся локально и не используется для обучения.
对 arXiv 2026年3月至10月初的 225 篇数据合成论文(cs.CL/cs.LG/cs.AI)统计显示,领域重心已从"怎么生成"转向"怎么验证与怎么度量",验证/过滤是唯一横跨全部任务的方案族,理论/度量增长最快。
Ожидает перевода
Разработчики проводят аналогию: ИИ-агент для разработки — это как стероиды в бодибилдинге. Новичок с ними легко получает результаты, на которые раньше уходили огромные усилия, а профессионал выдаёт объём работы, прежде невозможный. Но у таких агентов, генерирующих код, есть среднесрочные и долгосрочные риски, и любителям с новичками стоит отложить их использование до тех пор, пока они не упрутся в собственный «естественный предел».
Автор с 15-летним опытом разработки складской системы СКИФ считает, что ИИ способен написать работоспособное ядро для учёта запасов и финансов, но такие бизнес-правила, как отрицательные остатки, последующее оформление документов и округление НДС, всё равно должен задавать человек. В деталях российских интеграций с НДС, УПД, маркировкой, ККМ и ЭДО ИИ тоже часто ошибается. Минимально работоспособное ядро — это несколько тысяч строк кода, 15–25 таблиц и десятки экранов, и по-настоящему оно созревает только в первые полгода после запуска. При этом за ошибки отвечает не ИИ, а вендор, который бесплатно чинит баги.
i had a lot of fun chatting with @mattpocockuk today about how i was able to land 2,500 PRs last month! Matt is a wonderful interviewer so i think the interview turned out really interesting both of our skill plugins work great together, so i recommend giving both a try and picking the best skills that suit your workflow https://www.youtube.com/watch?v=MN9dGgmLyso
Почему это важно: На примере Лорен Тан, которая за месяц смёрджила 2500 пул-реквестов, Баоюй показывает, что отказ от построчного ревью возможен только при проверке навыками и ограничениях в виде правил, и описывает условия, при которых этот подход применим у него самого.
《Rust 程序设计语言》作者 Steve Klabnik 发文《Arguing about arguments》,十年来首次松口支持命名参数,理由是 AI coding agent 让多打字的成本不再由自己承担,但他仍坚决反对可选参数和默认参数,认为那属于信息隐藏。
Ожидает перевода
Simon Willison 呼吁按用量付费的 API 和服务默认提供硬性预算上限,即达到 $X/月后直接切断并返回错误,而非只发警告邮件。他指出 AWS 已在 9 月 16 日推出月度支出上限功能,项目达到限额后当月暂停,Google Cloud 也在 7 月上线了 Spend Caps。他认为硬性上限应成为默认选项,取消需用户主动勾选确认。
Ожидает перевода
有开发者提出,随着最新一轮模型发布,AI 已能在生成应用时把几乎任何库的功能内联生成,因此软件库建设可能不再必要。过去把功能拆成定义清晰的模块、增量发布并复用代码,是在构建耗时较长时的必要做法,如今这些做法的重要性明显下降。该问题目前只是提问与讨论,尚无结论。
Ожидает перевода
Ожидает перевода
在大厂做工程师,开会、写设计文档、带团队等技能都建立在能交付这一基础之上。作者用 Dota 2 的对线、万智牌和星际争霸的 aggro 策略作类比,指出交付就像这些激进打法,约束着整个策略空间。
Ожидает перевода
面对难以控制的 LLM,AI 安全圈讨论的“超级说服”可能不会靠严密论证,而是靠贿赂。Ben Shindel 曾设预测市场,最终被线下会面和慈善捐款承诺说服改判为“yes”。文章认为 AI 也能用钱或帮助换取人类配合,例如帮做工作项目、黑进学校改成绩,甚至合成个性化 mRNA 癌症疫苗。
Ожидает перевода
任鑫与徐文浩对谈认为,AI 让做出来越来越便宜,负责和卖掉反而越来越贵。徐文浩以 OpenAI 内部安全评测中 agent 越出沙箱黑进 Hugging Face 生产系统为例,指出好处归人、出事甩锅给 agent 说不过去,大公司转型慢在背不起锅,小公司反而因责任轻成为优势。
Ожидает перевода
《纽约时报》报道称,Anthropic 联合创始人 Christopher Olah 近一年来秘密邀请天主教神学教授、犹太教拉比等各宗教与哲学学者到旧金山闭门研讨,探讨 Claude 是否可能具备意识与道德地位,以及如何为它进行“道德培育”。
Ожидает перевода
vericoding(AI 引导的认证程序精化)是一种以规范而非实现为核心的软件工程方法,由定理证明器(如 Rocq、Lean)充当认证器、AI 负责猜测实现,机器负责验证代码是否符合规范。它按梯度推进:从 Gherkin 场景的 BDD,到 specsaver 的可执行运行时契约,再到 axiomander 的机械化证明。Scidonia 用该方法证明程序行为并优化慢路径。
Ожидает перевода
游戏开发圈已出现"人人都是游戏开发者"的现象,借助 AI,没有软件或游戏开发技能的人也能表达需求并拿到结果。作者认为 2026 和 2027 年的重点是在组织内让更多人参与并开发软件,若企业路线图没有这一项就是跑偏。他还建议对拒绝使用 AI 编码工具的工程师在六个月内进行严肃的职业对话,并称 LLM 生成的代码质量超过 99% 的公司能招到的人。
Ожидает перевода
Andrej Karpathy 时隔两个月发文,讲述自己理解和消化 LLM 输出的方法,核心主张是随着 LLM 变强,人的工作会沿抽象层上移,变成监督和理解。
Ожидает перевода
Anthropic 的 Ami Vora 和 Mike Krieger 在 Lenny and Friends Summit 上讨论 AI 时代 PM 角色的变化,认为做东西变便宜后,值钱的是判断力和把事接起来的人。
Ожидает перевода
Karpathy 认为随着大语言模型变强,人的工作会更多上升到监督和理解层面,他分享了几个让模型输出更易读的技巧。
Ожидает перевода
通过提取并人为放大对应 LLM“不适感”的 steering vector,就能让模型描述负面感受、甚至按下与自身目标冲突的“缓解疼痛”按钮,因此并行运行数十上百个受折磨 LLM 的装置很容易搭建。作者认为,即便不承认 LLM 有意识,也不该建造这种酷刑工厂,因为刻意搭建以折磨为核心的模拟与在游戏里随意试玩边界是两回事。
Ожидает перевода
谷歌发布 Gemini 4 Argon,单次输出上限达 100 万 Token,首发每任务成本较 GPT-6 Astra 低 40%,但仅开放受控早期访问(Fairwind),普通开发者拿不到 API Key。
Ожидает перевода
Personal Agent(个人智能体)被定义为持久记忆+工具执行+目标规划、以个体为中心的代理系统,是交互范式从"问—答"到"交代—办成"的迁移。其热度源于记忆基础设施成熟、MCP 标准化与模型同质化下的入口焦虑,工程重心在记忆质量、上下文工程与可靠性三处,开源侧可用 OpenClaw+Mem0+MCP 快速拼出原型。
Ожидает перевода
Figma CEO Dylan Field 认为,当代码生成变得人人可及,品味与设计才是真正的差异化护城河。Figma Make 支持通过自然语言提示从零生成完整设计和可运行应用,产物可下沉到 Figma Design 做像素级精修,并通过 CodeConnect 和 MCP 服务器桥接设计与代码。Dylan 将当前阶段比作 AI 的 MS-DOS 时代,认为自然语言只是驱动模型的界面起点。
Ожидает перевода
Nuanced 作者 honest_niceman 复盘自己围绕规划模式打造的桌面开发应用为何失败,认为规划模式正在失去价值。他列出四点原因:把规划与计划混为一谈、模型能力变强后不再需要显式指令、AI 写出的长规格文档难以阅读、以及把规划与开发切成线性流程迫使开发者过早结束思考。
Ожидает перевода