FP8 陷阱:GPU 账单降了 47%,但模型在输出“!!!!!!”
作者在单张 AMD MI300X 上用 vLLM ROCm 版跑 Qwen2.5 7B/32B/72B,按 $2.99/GPU-hr 计价,BF16 基线为 7B $0.227/M、32B $0.77/M、72B $1.67/M 输出 token。
推荐理由:作者在 MI300X 上实测 FP8 量化,发现按 token 计费会掩盖模型输出退化成乱码的问题,并给出可复用的验证方法。
用开源权重和本地模型写代码:接入方法、效果对比与部署经验。
作者在单张 AMD MI300X 上用 vLLM ROCm 版跑 Qwen2.5 7B/32B/72B,按 $2.99/GPU-hr 计价,BF16 基线为 7B $0.227/M、32B $0.77/M、72B $1.67/M 输出 token。
推荐理由:作者在 MI300X 上实测 FP8 量化,发现按 token 计费会掩盖模型输出退化成乱码的问题,并给出可复用的验证方法。
开发者 Fynn 在 2026 年 3 月 20 日调试 Cursor 的 OpenAI 兼容接口时,返回的模型 ID 为 accounts/anysphere/models/kimi-k2p5-rl-0317-s515-fast,显示 Composer 2 基于 Moonshot AI 的 Kimi K2.5 做强化学习后训练,该推文一天内获得 44.4 万次浏览。
推荐理由:从一次 API 调试串起 Cursor 未披露 Kimi 基座、许可署名争议与中美模型成本格局,呈现行业披露惯例。
Cline 发布开源桌面应用 Cline Desktop 的早期版本,把原本在 VS Code 扩展和 CLI 中的智能体运行框架搬进独立工作区,支持并行会话、定时任务和用于扩展工具与集成的 Marketplace。
推荐理由:官方给出桌面端的能力边界与开放入口,读者可据此判断它是否适合承接多智能体并行任务。
Cline 把 VS Code 扩展从约 76,000 行单体核心迁移到 Cline SDK,并自建灰度发布机制:一个安装包内打包 loader、legacy 和 next 两套扩展,由 PostHog 功能开关按百分比决定激活哪套,崩溃时自动回退到 legacy,开关可随时降到 0% 作为 kill switch。
推荐理由:Cline 官方复盘如何把 1100 万用户的 VS Code 扩展迁到新 harness,含灰度机制与前后指标对比。
Cline 让八个模型在自家 harness 里做 IMO 2026 六道题,证明由 GPT-5.5 和 Claude Opus 5 双盲按 0–7 分制评分、Gemini 3.1 Pro 仲裁,金牌线为 29 分。
推荐理由:Cline 用同一套 harness 盲评八个模型做 IMO 2026,给出分数与单次成本对照,可看开源权重模型的实际性价比。
Cline 开源其开放权重模型的评测方法,并附上价值超过一千美元的爬坡分数与 trace 供下载分析。文章给出 Hill Climber's Checklist 五条启发式:设定北极星指标、量化噪声、按任务/模型/供应商拆解失败模式、不要默认更多思考更好、保留私有评测集。
推荐理由:Cline 公开评测方法与上千美元 trace,给出五条可迁移的爬坡启发式,适合自建 harness 的团队参考。
NVIDIA 发布 Nemotron 3.5 Lightning,一个面向常驻智能体的可定制开源模型,并已在 Cline 中免费提供。
推荐理由:NVIDIA 新开源模型在 Cline 免费开放,读者可据此判断高频智能体调用场景是否值得换用。
Martin Fowler 在 M3 Max 48GB 和 M5 Pro 64GB 上实测 Qwen3.6 35B MoE、Gemma 4 31B/26B、Qwen Coder Next 80B 等本地小模型的智能体编码能力,按内存、速度、工具调用、代码正确性、上下文、任务复杂度、代码质量逐层筛选。
推荐理由:作者用两个具体任务对比多款本地小模型的智能体编码表现,并给出可复用的任务选择标准。
Hugging Face 上一个仿冒 OpenAI Privacy Filter 的仓库登上热门榜第一、获得 244,000 次下载,随后在安装该模型的 Windows 机器上执行窃取凭据的 infostealer。
推荐理由:复盘 Hugging Face 上仿冒 OpenAI 仓库的投毒链条,展示热门榜如何被当作信任信号利用。
作者用 Qwen 3.5 系列开源多模态模型做 PDF OCR,先用 PyMuPDF 把每页按 100dpi 导出为图片,再交给模型识别,实测 Qwen3.5-9B 是效果与速度的平衡点,更小的 0.8B 到 2B 模型在复杂文档上容易跑偏去总结内容。
推荐理由:作者实测了 Qwen 3.5 各尺寸模型做 PDF OCR 的效果,给出本地与 OpenRouter 两条可复用路径和成本数据。