Skip to content
Original
Chen Dahuang · AI Coding 实录·· 08/06/2026AI score38

给 DeepSeek V4 Flash 补上多模态:用 Qwen-3.7-Flash 识图的路由方案

Original title: 给 DeepSeek 补上多模态:Qwen-3.7-Flash 识图方案

The title and summary in the selected language are awaiting translation.

AI overview

DeepSeek V4 Flash 缺多模态能力,可用 Qwen-3.7-Flash 作视觉补充,通过路由组合补齐读图场景。方案是输入带图片走 Qwen-3.7-Flash 识图并输出结构化描述,纯文本继续走 V4 Flash 推理,也可把描述交给 V4 Flash 做深度推理、写代码和总结。

Full text

The full text in the selected language is awaiting translation. The original is shown for now.

很多人吐槽 DeepSeek V4 Flash 没有多模态的功能。这确实是它的短板——但没必要死磕一个模型。

问题

V4 Flash 文本能力拉满,但一遇到读图场景就抓瞎:截图、表格图片、UI 设计稿、扫描件,全都处理不了。

多模态是"便宜"的代价,模型要做视觉编码,参数就膨胀了,成本就上去了。

解法:组合使用

我调研了一圈目前性价比最高的识图模型,结论是 Qwen-3.7-Flash。

识别一张图片的成本,低到可以忽略不计。拿它当视觉专用模型,文本推理继续走 V4 Flash,两头的好处都占。

怎么组合

最简单的思路就是"路由":输入里带图片 → 走视觉模型;纯文本 → 走 V4 Flash。

// 伪代码:按需路由
function route(input) {
  if (hasImage(input)) {
    return qwenVision(input)   // 识图 + 提取关键信息
  }
  return deepseekV4Flash(input) // 文本推理
}

更进阶的玩法是把识图结果直接塞给 V4 Flash 继续推理:

  1. 用 Qwen-3.7-Flash 识别图片,输出结构化描述
  2. 把描述 + 原始问题一起交给 DeepSeek V4 Flash
  3. V4 Flash 基于描述做深度推理、写代码、总结

这样既能看图,又享受 V4 Flash 的便宜和快。

适用场景

  • 截图提问:把报错截图、聊天截图丢进去
  • 表格 / 文档图片转结构化数据
  • UI 设计稿转代码
  • 发票、合同等扫描件的信息提取
  • Agent 需要"看"屏幕的场景

为什么不是别的方案

纯视觉大模型(比如 GPT 系的多模态)很强,但价格摆在那里,日常批量处理不划算。

Qwen-3.7-Flash 赢在性价比:识别质量够用,成本几乎可以忽略,还能跑大批量任务不心疼。

总结

模型组合是常态,别指望一个模型全干。

文本主力 V4 Flash(便宜快上下文大),视觉补充 Qwen-3.7-Flash(便宜够用),这套组合是目前性价比最高的方案。缺什么补什么,比等一个"全能但贵"的模型实际得多。

Source: Chen Dahuang · AI Coding 实录 · chendahuang.com