浅谈 AI 进化史:从 ChatGPT 到 Agent 工作系统
2022 年 11 月 30 日 ChatGPT 上线,到 2026 年 9 月不到四年,AI 从聊天框走向 Agent 工作系统。
2022 年 11 月 30 日 ChatGPT 上线,到 2026 年 9 月不到四年,AI 从聊天框走向 Agent 工作系统。
作者认为 Jev 这类只输出结构化结果的 System One 模型并非全新范式,普通 LLM 预填充响应后只生成一个受限 token 就能获得大部分速度与并行优势。
Z.AI 确认 GLM-5.3 Flash 的全部推理运行在国产硬件上,但未公布芯片厂商、吞吐或功耗数据,也无人独立验证。作者推测其使用的是华为昇腾 910c 系列,该芯片约 600W、INT8 算力约 1.6PFLOP/s,性能约为四年前 H100 的 60%,且缺少原生 FP8 支持。作者认为真正的瓶颈是缺乏可量产的 EUV 光刻,业界普遍认为 2030 年前难以实现规模化生产。
OpenAI 于 3 月 24 日宣布关停 Sora,API 将于 9 月 24 日下线,同期重心转向 Codex 和企业版 ChatGPT;Anthropic 则围绕 Claude Cowork 和 Claude Design 构建角色权限、支出限额与可观测性等企业能力。
Sean Goedecke 认为本地模型不会成为主流,绝大多数推理仍会发生在 AI 数据中心。他给出的理由是:前沿模型体积远超消费级设备,而数据中心可通过批处理数百名用户的请求摊薄成本,加上 B200 相比 RTX 4090 在同等功耗下约有 3 倍 flops 和近 4 倍内存带宽,本地运行约需多消耗 30 倍资源;家庭推理的电力成本约每月 50 至 300 美元。
Martin Fowler 在 Apple M3 Max 48GB 和 M5 Pro 64GB 两台机器上,用 LM Studio、OpenCode 和 Pi 实测了 Qwen3.6 与 Gemma 4 系列本地模型做智能体编程,结论是仍不够即插即用。
一份面向 AI 工程岗位的面试题追问清单,覆盖代理网关(如 OpenRouter/LiteLLM)、MCP/CLI、从零手写 Agent、多智能体编码流程、自定义 benchmark 以及本地部署约 27B-Q3_K_M.gguf 模型等方向。作者认为,这些题目的通用版本如今谁都能靠 vibe coding 一晚做出来,已失去简历价值,真正稀缺的是把任务打磨到"理想"状态的能力。
DeepSeek 正以开源和极致压缩 KV 缓存换取中国 AI 硬件生态的独立:在 100 万上下文、8-bit KV 精度下,1.6T 参数的 DeepSeek V4 仅需 5.48 GB HBM,而 GLM5 需 60 GB、Qwen3-235B-A22B 需 89 GB。
Martin Alderson 认为未来 18-24 个月将由算力短缺主导,因为需求呈指数增长而供给只是线性增加。他引用 GitHub COO 的数据称 GitHub 近 3 个月提交量年化增长约 14 倍,并提到 OpenAI Codex 团队负责人 Thibault Sottiaux 表示行业正处于需求超过供给的阶段。
作者 Martin Alderson 认为,端侧智能体 AI 在消费级设备上短期内难以实用,瓶颈是内存、KV cache 与推理速度。他指出 3B 模型量化后约需 2GB、7B 约需 5GB,而手机端上下文常被限制在 4K token,仅工具定义就可能占满;即便 32K 上下文,7B Q4 模型的 KV cache 也已超出 iPhone 17 的内存。
Ryan Lopopolo 于 2025 年 11 月 3 日归档了 Artichoke Ruby,并在当月归档了 @artichoke 组织下的大部分仓库。这个用 Rust 重写 mruby 的实验项目历时六年,曾实现纯 Rust 的合规 String 和模块化 VM 架构,但作者因时间精力转向工作与家庭、且缺乏用户基础而不再继续开发。
随着编码智能体和最新模型推动 token 消耗激增,AI 算力正面临严重短缺。作者估算自己三年内每日 token 消耗增长约 50 倍,目前全球约 10 亿活跃 LLM 用户,而超大规模厂商已承诺数千亿美元资本支出。Macquarie 指出当前 DRAM 供应仅能支撑 15GW 的 AI 基础设施部署,内存供应正成为比电力更难解决的瓶颈。