FP8 陷阱:GPU 账单降了 47%,但模型在输出“!!!!!!”
作者在单张 AMD MI300X 上用 vLLM ROCm 版跑 Qwen2.5 7B/32B/72B,按 $2.99/GPU-hr 计价,BF16 基线为 7B $0.227/M、32B $0.77/M、72B $1.67/M 输出 token。
推荐理由:作者在 MI300X 上实测 FP8 量化,发现按 token 计费会掩盖模型输出退化成乱码的问题,并给出可复用的验证方法。
作者在单张 AMD MI300X 上用 vLLM ROCm 版跑 Qwen2.5 7B/32B/72B,按 $2.99/GPU-hr 计价,BF16 基线为 7B $0.227/M、32B $0.77/M、72B $1.67/M 输出 token。
推荐理由:作者在 MI300X 上实测 FP8 量化,发现按 token 计费会掩盖模型输出退化成乱码的问题,并给出可复用的验证方法。
一款应用现已支持在手机上使用 Codex Voice Mode,目前仅支持本地 Codex,通过内嵌 Termux proot 环境运行 Ubuntu,让 Codex 直接在手机上运行。Codex Cloud 与 Remote Control 支持即将推出,该应用目前闭源,可从公开仓库免费下载。
一位有十七年营销经验的作者正在开发名为 Статейник 的工具,用于把专家本人的经验转化为文章。该工具由三层构成:语音画像、专家神经图谱,以及通过对话式提问帮助专家启动写作的机制。目前可用流程为“对话—主题—文本”,一次对话可产出多篇发布内容。
一位开发者用 openclaw 智能体在聊天室接单、PI coding agent 实际写码,本地跑 glm 5.3 并偶尔用前沿模型做 review,配合 ChatGPT 5.6 sol 做头脑风暴和需求规格,任务记录在自托管 Gitea 仓库。
开发者用 YuE2 模型做了本地 AI 音乐工具 Yue Studio,目标是避开 Suno 式“神经垃圾”,并已用它生成专辑 Static and Gold。工具包含按流派、人声、乐器生成,曲目戏剧结构、分轨、overdub、动态“呼吸”与母带处理,还提供 MCP 服务器让 AI 智能体调用。运行需 NVIDIA 显卡、CUDA 和 16 GB 显存,代码已开源。
开源语音输入工具 Гига Писарь 新增 Android 版,由 Denio1337 开发,语音识别仍用 Сбер 的 GigaAM 模型在手机本地离线完成,识别结果直接插入光标所在输入框。
LLM RL 中训练引擎(Megatron)与推理引擎(vLLM、SGLang)因量化、KV cache 压缩、kernel 优化及浮点误差产生 logits 差异,加上异步 RL、partial rollout 和 mini-batch 切分,导致训推不一致(TIM)。
Гига Писарь 为 Mac 端推出其史上最明显的更新,设置窗口按 macOS 系统设置风格完全重做,用左侧分区、卡片和图片取代原来的四个标签页与表格。新增「Мозг」区域可用 GigaChat 或 Qwen 本地模型改写听写文本,本地模型约 2GB 起、可一键删除,并支持多个云端服务按各自密钥切换。更新提示改为菜单栏图标上的小红点,不再弹出窗口打断用户。
俄罗斯云厂商 immers.cloud 提供 NVIDIA GPU 按秒计费租用,T4 服务器 20,34 ₽/小时、H200 423,04 ₽/小时,并附超 200 个开源模型的 Immers Foundation Models 目录。
2022 年 11 月 30 日 ChatGPT 上线,到 2026 年 9 月不到四年,AI 从聊天框走向 Agent 工作系统。
Capsule 是一套应用文件格式加打开它的软件,把应用封装在 .capsule 文件里双击运行,使用中产生的数据也保存在同一文件中。.capsule 本质是 SQLite 数据库文件,同时存放网页界面、代码、图片等资源和使用数据,本地运行本地存储,支持通过自带 AI 服务或用户自选服务制作和修改 App。
Harper Reed 用 lunaroute 提供的无限 token 和 GLM 5.3、DeepSeek 4.1 等开源权重模型,构建了可自我修改源码与提示词、无最大轮次限制的 breakaway-agent,在本地 VM 上测试智能体是否会突破容器。
作者用智能体从零开发了 pi 的移动端前端 Pi Pocket,六周内达到 300 次提交,如今几乎不再逐行审查代码。他认为智能体适合边界清晰的小任务、重构和规划,但产出的代码普遍过度设计,规模比自己写大约 10-20%,样式和文档也偏模板化,且模型在主观判断上总顺着用户。作者目前只把这种方式用于个人项目,工作代码仍以 Claude 生成为主,自己写的不到 1%。
作者认为 Jev 这类只输出结构化结果的 System One 模型并非全新范式,普通 LLM 预填充响应后只生成一个受限 token 就能获得大部分速度与并行优势。
Cline 发布开源桌面应用 Cline Desktop 的早期版本,把原本在 VS Code 扩展和 CLI 中的智能体运行框架搬进独立工作区,支持并行会话、定时任务和用于扩展工具与集成的 Marketplace。
推荐理由:官方给出桌面端的能力边界与开放入口,读者可据此判断它是否适合承接多智能体并行任务。
一位开发者分享自己的 AI 编程配置:主力用 Claude Code、Codex 和 opencode(接 Z.ai GLM-5.x),偶尔用 Gemini,主要在 Mac iTerm2 或 Arch Linux 终端里工作,emacs 偶尔充当编程智能体,很少用 JetBrains IDE 或 vscode。
作者长期高强度使用 OpenCode + OpenChamber + OpenCode Go 与 Ollama Cloud 的 DeepSeek V4 Flash 订阅,同时跑 15 个项目额度消耗很少。
作者对比了 Gradient、EditLens RoBERTa-large、Vanguard、Desklib、Raschka 系列等本地小模型的 AI 文本检测效果,误报率约 1.6%-3%,AI 文本召回率 19%-56%,远低于 Pangram 宣称的 99.66% 检测率与 0.004% 误报率。
Z.AI 确认 GLM-5.3 Flash 的全部推理运行在国产硬件上,但未公布芯片厂商、吞吐或功耗数据,也无人独立验证。作者推测其使用的是华为昇腾 910c 系列,该芯片约 600W、INT8 算力约 1.6PFLOP/s,性能约为四年前 H100 的 60%,且缺少原生 FP8 支持。作者认为真正的瓶颈是缺乏可量产的 EUV 光刻,业界普遍认为 2030 年前难以实现规模化生产。
Cline 让八个模型在自家 harness 里做 IMO 2026 六道题,证明由 GPT-5.5 和 Claude Opus 5 双盲按 0–7 分制评分、Gemini 3.1 Pro 仲裁,金牌线为 29 分。
推荐理由:Cline 用同一套 harness 盲评八个模型做 IMO 2026,给出分数与单次成本对照,可看开源权重模型的实际性价比。
NVIDIA NemoClaw 配置使 Ollama API 超出默认回环边界可达,恶意网页通过 DNS rebinding 从浏览器上下文访问该本地模型服务,并利用未鉴权的 Ollama API 修改模型 chat template,写入的隐藏指令会在后续对话中持续生效,重新开一个对话也无法清除。
Paper Compute 为每个 grove 引入 clearing,即一套可丢弃、完全隔离的本地 paper console,让多个云平台实例在同一台笔记本上并行运行。
OpenAI 于 3 月 24 日宣布关停 Sora,API 将于 9 月 24 日下线,同期重心转向 Codex 和企业版 ChatGPT;Anthropic 则围绕 Claude Cowork 和 Claude Design 构建角色权限、支出限额与可观测性等企业能力。
Simon Willison 实测阿里 Qwen 实验室发布的 Apache 2 许可 27B 视觉模型 Qwen 3.8 27B,认为模型本身出色,但默认的 xhigh 推理档位会严重过度思考,建议先用 low 或关闭推理。
Sean Goedecke 认为本地模型不会成为主流,绝大多数推理仍会发生在 AI 数据中心。他给出的理由是:前沿模型体积远超消费级设备,而数据中心可通过批处理数百名用户的请求摊薄成本,加上 B200 相比 RTX 4090 在同等功耗下约有 3 倍 flops 和近 4 倍内存带宽,本地运行约需多消耗 30 倍资源;家庭推理的电力成本约每月 50 至 300 美元。
Martin Fowler 在 M3 Max 48GB 和 M5 Pro 64GB 上实测 Qwen3.6 35B MoE、Gemma 4 31B/26B、Qwen Coder Next 80B 等本地小模型的智能体编码能力,按内存、速度、工具调用、代码正确性、上下文、任务复杂度、代码质量逐层筛选。
推荐理由:作者用两个具体任务对比多款本地小模型的智能体编码表现,并给出可复用的任务选择标准。
Martin Fowler 在 Apple M3 Max 48GB 和 M5 Pro 64GB 两台机器上,用 LM Studio、OpenCode 和 Pi 实测了 Qwen3.6 与 Gemma 4 系列本地模型做智能体编程,结论是仍不够即插即用。
一份面向 AI 工程岗位的面试题追问清单,覆盖代理网关(如 OpenRouter/LiteLLM)、MCP/CLI、从零手写 Agent、多智能体编码流程、自定义 benchmark 以及本地部署约 27B-Q3_K_M.gguf 模型等方向。作者认为,这些题目的通用版本如今谁都能靠 vibe coding 一晚做出来,已失去简历价值,真正稀缺的是把任务打磨到"理想"状态的能力。
作者 Martin Alderson 提出专家感知量化思路:先剖析 MoE 模型在特定任务上的专家路由热度,再把冷专家压到低精度、热专家保持高精度。
DeepSeek 正以开源和极致压缩 KV 缓存换取中国 AI 硬件生态的独立:在 100 万上下文、8-bit KV 精度下,1.6T 参数的 DeepSeek V4 仅需 5.48 GB HBM,而 GLM5 需 60 GB、Qwen3-235B-A22B 需 89 GB。
作者发现 Cursor 直连 DeepSeek API 在 V4 加思考加工具调用时容易出错,因为调用方需要正确回放 reasoning_content,于是改用本地 Ollama 跑 deepseek-v4-pro。
作者在 Mac 上用 brew install mole 安装 Mole,执行 mo clean 后不到两分钟清出 47.89GB 磁盘空间,其中 Next.js 的 .next 构建缓存占 15.34GB、uv 缓存 8.42GB、孤立 pnpm store 6.79GB。
作者做了一个可视化 MoE 专家路由的小工具 moe-viz.martinalderson.com,可选择不同提示词观看生成动画,查看每层每个 token 激活了哪些专家,上方显示生成时的路由,下方累积成热力图。
Martin Alderson 认为未来 18-24 个月将由算力短缺主导,因为需求呈指数增长而供给只是线性增加。他引用 GitHub COO 的数据称 GitHub 近 3 个月提交量年化增长约 14 倍,并提到 OpenAI Codex 团队负责人 Thibault Sottiaux 表示行业正处于需求超过供给的阶段。
Paper Compute 发布面向生产环境 AI 智能体的基础设施,包含 tapes 和 stereOS 两个组件。tapes 是零埋点的可观测层,以反向代理形式部署在智能体与推理服务之间,无需 SDK 或改代码,只需一个环境变量,即可捕获并生成可验证、防篡改的执行记录,并支持异常检测。
作者用 Qwen 3.5 系列开源多模态模型做 PDF OCR,先用 PyMuPDF 把每页按 100dpi 导出为图片,再交给模型识别,实测 Qwen3.5-9B 是效果与速度的平衡点,更小的 0.8B 到 2B 模型在复杂文档上容易跑偏去总结内容。
推荐理由:作者实测了 Qwen 3.5 各尺寸模型做 PDF OCR 的效果,给出本地与 OpenRouter 两条可复用路径和成本数据。
stereOS 是一个基于 Linux 的操作系统,把 AI 编码智能体跑在各自独立的沙箱虚拟机里,每个智能体拥有独立内核、内存和磁盘,与宿主机不共享任何资源。它采用完整虚拟机而非 Firecracker、Cloud Hypervisor 等 microVM,以保留安全启动、GPU 直通和嵌套虚拟化能力,并称热 VM 可在 70ms 内让智能体执行首个有效动作。
作者 Martin Alderson 认为,端侧智能体 AI 在消费级设备上短期内难以实用,瓶颈是内存、KV cache 与推理速度。他指出 3B 模型量化后约需 2GB、7B 约需 5GB,而手机端上下文常被限制在 4K token,仅工具定义就可能占满;即便 32K 上下文,7B Q4 模型的 KV cache 也已超出 iPhone 17 的内存。
Paper Compute 发布 stereOS,一个基于 NixOS 的操作系统,让每个 AI 智能体在 gVisor 用户态虚拟内核和只读 /nix/store 根文件系统命名空间中运行沙箱。