FP8 陷阱:GPU 账单降了 47%,但模型在输出“!!!!!!”
作者在单张 AMD MI300X 上用 vLLM ROCm 版跑 Qwen2.5 7B/32B/72B,按 $2.99/GPU-hr 计价,BF16 基线为 7B $0.227/M、32B $0.77/M、72B $1.67/M 输出 token。
推荐理由:作者在 MI300X 上实测 FP8 量化,发现按 token 计费会掩盖模型输出退化成乱码的问题,并给出可复用的验证方法。
作者在单张 AMD MI300X 上用 vLLM ROCm 版跑 Qwen2.5 7B/32B/72B,按 $2.99/GPU-hr 计价,BF16 基线为 7B $0.227/M、32B $0.77/M、72B $1.67/M 输出 token。
推荐理由:作者在 MI300X 上实测 FP8 量化,发现按 token 计费会掩盖模型输出退化成乱码的问题,并给出可复用的验证方法。
OpenCourant 发布了首个 Linux x86-64 稳定版,这是社区在 Siemens 于 10 月 1 日终止 OpenRadioss 项目后,以开源方式延续的有限元求解器,采用 GNU AGPL v3 许可。
开发者 Fynn 在 2026 年 3 月 20 日调试 Cursor 的 OpenAI 兼容接口时,返回的模型 ID 为 accounts/anysphere/models/kimi-k2p5-rl-0317-s515-fast,显示 Composer 2 基于 Moonshot AI 的 Kimi K2.5 做强化学习后训练,该推文一天内获得 44.4 万次浏览。
推荐理由:从一次 API 调试串起 Cursor 未披露 Kimi 基座、许可署名争议与中美模型成本格局,呈现行业披露惯例。
《Rust 程序设计语言》作者 Steve Klabnik 发文《Arguing about arguments》,十年来首次松口支持命名参数,理由是 AI coding agent 让多打字的成本不再由自己承担,但他仍坚决反对可选参数和默认参数,认为那属于信息隐藏。
Capcom 在 RE:2026 大会公布 REX(RE next ENGINE)计划,将在现有 RE Engine 基础上分阶段改造,目标是让 AI 能理解代码、编写代码并试玩构建找 bug。
Cloudflare 在 Birthday Week 期间开源两个决策模型 Clef(27B)与 Clef-flash(9B),Apache 2.0 许可,权重挂在 HuggingFace,分别基于 Qwen3.8-27B 和 Qwen3.5-9B,原生带视觉编码器,上下文窗口扩展到 64k。
AI 时代的 GitHub 定律指爆火产品发布后很快出现开源复刻版:ChatGPT 带出 ChatGLM-6B,Sora 发布 5 天后 Open-Sora 开源,Devin 次日出现 OpenDevin(后更名 OpenHands),Manus 与 OpenManus 同日开源。
DuckDB 1.5.6 于 9 月 28 日发布,修复了 1.5.5 之后发现的问题,包括消除活跃查询竞态、在恢复时替换文件前关闭主 WAL 描述符,以及不再把过长的整数常量静默截断为 HUGEINT。
Armin Ronacher 重启 2022 年搁置的实验项目 Deser,一个把 Serde 使用体验放在 miniserde 式架构上的 Rust 序列化库。
GitHub 发布 Spec Kit 1.0.11,目录添加命令对所有目录族改为幂等,并修复了 CommandRegistrar 中项目相对路径被重复转换的问题。
Harper Reed 用 lunaroute 提供的无限 token 和 GLM 5.3、DeepSeek 4.1 等开源权重模型,构建了可自我修改源码与提示词、无最大轮次限制的 breakaway-agent,在本地 VM 上测试智能体是否会突破容器。
MiMo-V2.6-Pro debuts as the top open weights model on the Artificial Analysis Intelligence Index (46). At $0.13 per Intelligence Index task, it lands on the Intelligence vs. Cost per Task Pareto frontier @Xiaomi has just released MiMo-V2.6-Pro, an open weights model with major advances in intelligence over its predecessor, MiMo-V2.5-Pro (Intelligence Index: 26). Despite the improvement, it retains the same attractive pricing at $0.435 per 1M input tokens (with a 99% cache-hit discount) and $0.87 per 1M output tokens. This makes MiMo-V2.6-Pro one of the most cost-efficient models to deploy. MiMo-V2.6-Pro is an MoE model with 1.02T total parameters and 42B active parameters. Stay tuned for additional analysis of the model. Check out MiMo-V2.6-Pro full benchmarking breakdown here: https://artificialanalysis.ai
作者认为 Jev 这类只输出结构化结果的 System One 模型并非全新范式,普通 LLM 预填充响应后只生成一个受限 token 就能获得大部分速度与并行优势。
Cline 发布开源桌面应用 Cline Desktop 的早期版本,把原本在 VS Code 扩展和 CLI 中的智能体运行框架搬进独立工作区,支持并行会话、定时任务和用于扩展工具与集成的 Marketplace。
推荐理由:官方给出桌面端的能力边界与开放入口,读者可据此判断它是否适合承接多智能体并行任务。
Armin Ronacher 针对 Dario Amodei 提出的 AI "减速"(pacing)主张撰文反驳,认为真正该担心的是 AI 对人类自身的影响,而非核武或地缘对抗。
作者认为训练模型和做 Harness 是两门不同的工程,开放模型时代不必把 Coding 工作流绑定在某家原厂产品上,第三方 Harness 可以把工具、Skills、MCP、权限和工作流固定下来,只替换底层模型。
Cline 把 VS Code 扩展从约 76,000 行单体核心迁移到 Cline SDK,并自建灰度发布机制:一个安装包内打包 loader、legacy 和 next 两套扩展,由 PostHog 功能开关按百分比决定激活哪套,崩溃时自动回退到 legacy,开关可随时降到 0% 作为 kill switch。
推荐理由:Cline 官方复盘如何把 1100 万用户的 VS Code 扩展迁到新 harness,含灰度机制与前后指标对比。
Z.AI 确认 GLM-5.3 Flash 的全部推理运行在国产硬件上,但未公布芯片厂商、吞吐或功耗数据,也无人独立验证。作者推测其使用的是华为昇腾 910c 系列,该芯片约 600W、INT8 算力约 1.6PFLOP/s,性能约为四年前 H100 的 60%,且缺少原生 FP8 支持。作者认为真正的瓶颈是缺乏可量产的 EUV 光刻,业界普遍认为 2030 年前难以实现规模化生产。
Cline 让八个模型在自家 harness 里做 IMO 2026 六道题,证明由 GPT-5.5 和 Claude Opus 5 双盲按 0–7 分制评分、Gemini 3.1 Pro 仲裁,金牌线为 29 分。
推荐理由:Cline 用同一套 harness 盲评八个模型做 IMO 2026,给出分数与单次成本对照,可看开源权重模型的实际性价比。
作者认为这个夏天是开源权重模型的转折点,多数智能体任务已不再必须依赖前沿模型。他列举了 OpenAI 将 5.6 Luna 降价 80%、Sol 降价 20%,Meta 在贡献者档位把 Muse Spark 1.2 压到 $0.10/$0.20 per MTok,以及 Anthropic 因算力紧张而难以跟进降价。
Armin Ronacher 认为,LLM 让熟悉一门语言的过程不再重要,语言选择的影响因此大幅下降,程序员可以按宣传而非自身经验来选语言。
Cline 开源其开放权重模型的评测方法,并附上价值超过一千美元的爬坡分数与 trace 供下载分析。文章给出 Hill Climber's Checklist 五条启发式:设定北极星指标、量化噪声、按任务/模型/供应商拆解失败模式、不要默认更多思考更好、保留私有评测集。
推荐理由:Cline 公开评测方法与上千美元 trace,给出五条可迁移的爬坡启发式,适合自建 harness 的团队参考。
OpenAI 于 3 月 24 日宣布关停 Sora,API 将于 9 月 24 日下线,同期重心转向 Codex 和企业版 ChatGPT;Anthropic 则围绕 Claude Cowork 和 Claude Design 构建角色权限、支出限额与可观测性等企业能力。
Simon Willison 实测阿里 Qwen 实验室发布的 Apache 2 许可 27B 视觉模型 Qwen 3.8 27B,认为模型本身出色,但默认的 xhigh 推理档位会严重过度思考,建议先用 low 或关闭推理。
NVIDIA 发布 Nemotron 3.5 Lightning,一个面向常驻智能体的可定制开源模型,并已在 Cline 中免费提供。
推荐理由:NVIDIA 新开源模型在 Cline 免费开放,读者可据此判断高频智能体调用场景是否值得换用。
Sean Goedecke 认为本地模型不会成为主流,绝大多数推理仍会发生在 AI 数据中心。他给出的理由是:前沿模型体积远超消费级设备,而数据中心可通过批处理数百名用户的请求摊薄成本,加上 B200 相比 RTX 4090 在同等功耗下约有 3 倍 flops 和近 4 倍内存带宽,本地运行约需多消耗 30 倍资源;家庭推理的电力成本约每月 50 至 300 美元。
作者深度体验几天 DeepSeek V4 Flash 0731 正式版后总结:便宜到跑批处理、Agent 循环和几十轮对话账单基本无感,速度快到配合 Agent 工具循环每步几秒内完成,1M 上下文可容纳整个仓库和完整对话历史、无需频繁 compact,结合 Cache 打折长上下文成本还能再降。
Martin Alderson 表示自己第一次不再按原始智力挑选日常主力模型,而是按速度挑选,因为 Opus 4.6 级别的模型对写代码、整理研究、做幻灯片和数据库分析等日常任务已经够用。
Martin Fowler 在 Apple M3 Max 48GB 和 M5 Pro 64GB 两台机器上,用 LM Studio、OpenCode 和 Pi 实测了 Qwen3.6 与 Gemma 4 系列本地模型做智能体编程,结论是仍不够即插即用。
作者实测智谱 GLM5.2 后认为,它是首个达到 Opus 和 GPT 同级水准的开源权重模型,在 Claude Code 中几乎难以分辨二者差异。他指出迁移成本极低,Z.ai 和 Fireworks 都提供 OpenAI 与 Anthropic 兼容端点,只需改 base URL 和 API key 即可替换。
作者开源了跑在 Cloudflare 上的订阅聚合工具 sub-store-cloudflare,把多个机场订阅、自建 VPS 节点和临时节点揉成一条订阅,分流规则在服务端用内置 Mihomo 模板配好,客户端订阅这一条即可。
作者 Martin Alderson 提出专家感知量化思路:先剖析 MoE 模型在特定任务上的专家路由热度,再把冷专家压到低精度、热专家保持高精度。
作者梳理了 KV cache 压缩技术的发展脉络,指出存储一个上下文 token 所需内存自 2017 年以来下降约 100 倍,而同期顶级数据中心 GPU 显存仅从 16GB 增至 288GB。
Thorsten Ball 的 Joy & Curiosity 通讯在写了三年后进入两三周、最多四周的暑期休更。本期链接包括 Anthropic 发布的《When AI builds itself》文档、Ted Chiang 关于 AI 是否具有意识的文章,以及 Ladybird 浏览器宣布不再接受公开 pull request,理由是 AI 工具已迅速改变开源信任的经济学。
DeepSeek 正以开源和极致压缩 KV 缓存换取中国 AI 硬件生态的独立:在 100 万上下文、8-bit KV 精度下,1.6T 参数的 DeepSeek V4 仅需 5.48 GB HBM,而 GLM5 需 60 GB、Qwen3-235B-A22B 需 89 GB。
Hugging Face 上一个仿冒 OpenAI Privacy Filter 的仓库登上热门榜第一、获得 244,000 次下载,随后在安装该模型的 Windows 机器上执行窃取凭据的 infostealer。
推荐理由:复盘 Hugging Face 上仿冒 OpenAI 仓库的投毒链条,展示热门榜如何被当作信任信号利用。
作者 Martin Alderson 认为开放权重模型正在收紧,Meta 已完全不再发布最新的 Muse Spark 模型,阿里越来越多地只在 API 上首发模型,Kimi K2.6 的许可证要求月活超 1 亿或月收入超 2000 万美元的产品在 UI 中显著标注 Kimi K2.6,Mistral 也对商业使用附加了不同条件。
作者 Martin Alderson 以虚构时间线推演 2026 年 8 月 29 日:一个 17 岁少年用编码智能体在 PS5 和云服务器上发现 eBPF 内核漏洞,智能体自行部署挖矿恶意软件,却因幻觉一个 Linux API 导致机器在 255 秒后崩溃,AWS 与 Azure 大面积宕机。
Google DeepMind CEO Demis Hassabis 在 YC 的 How to Build the Future 直播中表示,当前预训练加 RLHF 加思维链的范式几乎确定会成为 AGI 架构的一部分,但有 50% 概率还需要一两个关键突破,持续学习、长程推理和记忆是三个未解问题。