FP8 陷阱:GPU 账单降了 47%,但模型在输出“!!!!!!”
作者在单张 AMD MI300X 上用 vLLM ROCm 版跑 Qwen2.5 7B/32B/72B,按 $2.99/GPU-hr 计价,BF16 基线为 7B $0.227/M、32B $0.77/M、72B $1.67/M 输出 token。
推荐理由:作者在 MI300X 上实测 FP8 量化,发现按 token 计费会掩盖模型输出退化成乱码的问题,并给出可复用的验证方法。
作者在单张 AMD MI300X 上用 vLLM ROCm 版跑 Qwen2.5 7B/32B/72B,按 $2.99/GPU-hr 计价,BF16 基线为 7B $0.227/M、32B $0.77/M、72B $1.67/M 输出 token。
推荐理由:作者在 MI300X 上实测 FP8 量化,发现按 token 计费会掩盖模型输出退化成乱码的问题,并给出可复用的验证方法。
作者用 629 条 AgentDojo 注入攻击(每条埋在真实工具输出中)和 97 条正常样本,实测 10 个开源提示词注入检测器。
推荐理由:作者用 629 条真实注入攻击实测 10 个开源检测器,给出默认阈值与校准后的完整对比数据。
OpenBlock Labs 的智能体 OB-1 在按正确超时限制重新提交成绩后,重新成为 Terminal-Bench 排行榜得分最高的智能体。此前该提交将数据集中每个任务的超时统一改为固定 30 分钟,而多数任务原本限时 5 分钟,导致 75 个任务超时被放宽、2 个不变、3 个被缩短。