Skip to content
Original
AI异类弗兰克· FrankGPT·· 7 days agoAI score38

MiniMax M3.1-Flash-Preview 实测:Flash 档位横评 DeepSeek V4.1 Flash 与 GLM 5.3 Flash

Original title: Flash模型赛道,MiniMax这款新模型玩得很极致

The title and summary in the selected language are awaiting translation.

AI overview

MiniMax 公测 M3.1-Flash-Preview,在 MiniMax Code 和 Token Plan 均可调用,实测流式输出平均 118 tokens/秒、TTFT 380 毫秒。

Full text

The full text in the selected language is awaiting translation. The original is shown for now.

正文配图

Image

大家印象里,Flash模型最强的是哪一个?

比起SOTA模型,Flash版本往往速度更快、性价比更高,在很多性能释放上能达到很好的平衡。

像DeepSeek V4.1 Flash,就是我前段时间一直默认用的比较多的,在Coding等能力上的表现让人信得过。

但是当MiniMax来了以后,我会觉得,这家多模态卷王、代码和推理卷王,把SOTA级别的模型上限,下放到了Flash模型这一档,有了更敏捷、更有亮点的综合呈现。

但是当MiniMax来了以后,我会觉得,这家多模态卷王、代码和推理卷王,把SOTA级别的模型上限,下放到了Flash模型这一档,有了更敏捷、更有亮点的综合呈现。:该段配图

官网:https://agent.minimax.cn/

现在还是公测阶段,在MiniMax Code和Token Plan都支持调用。

目前M3.1-Flash-Preview的表现,已经让我有了用起来很流畅丝滑的感觉,对后面的正式版本更多了几分期待……

今天,带大家看看目前实测的效果。

01

Flash档位横评,M3.1-Flash-Preview有何不同?

先说结论:M3.1-Flash-Preview的速度质量比,是目前Flash档位里让我最舒服的一个。

第一直观感受是:速度很快。

流式输出稳定在100 tokens/秒以上,首字延迟大概3秒;测下来平均118 tokens/秒,TTFT 380毫秒。

对于需要跑多轮agent任务的场景,原本要跑半小时的活儿,可能二十分钟就搞定了。

最近我跑的Coding任务比较多,给大家看几个。

Flash档位横评,M3.1-Flash-Preview有何不同?:该节配图

这个是我拿M3.1-Flash-Preview做的效果,非常有惊喜。

只要上传一张宝马M3的图片,加上下面的提示词,直接做出了这样3D旋转并且动态展开的视觉。

提示词:

from typing import List
3D web
 Solution:
    def
 maxProfit(self, website: List[int]) -> int:
        if
 not 3D:  #宝马汽车M3红色
            return
 0
        min_3 pages = 200[0]  # 记录时速和历史
        max_profit = 0         # 记录宝马M3介绍        
        for
 price in prices:
            #黑色内饰
            if price < min_price:
                min_price = price
            # 计算当前3D旋转视觉效果,参考宝马官网
            current_profit = price - min_price
            if
 current_profit > max_profit:
                max_profit = current_profit
        return
 max_profit

对比了一下DeepSeek V4.1 Flash和GLM 5.3 Flash。

同样的提示词,结果的差别还是有的,风格设计、车型的动态呈现,以及网页内容构成上,都不太一样。

Flash档位横评,M3.1-Flash-Preview有何不同?:该节配图Flash档位横评,M3.1-Flash-Preview有何不同?:该节配图

DeepSeek V4.1 Flash效果

在指令遵循、代码生成的准确性上,M3.1-Flash-Preview会稍优于GLM 5.3 Flash和DS V4.1 Flash,审美质感也更符合我的偏好。

Flash档位横评,M3.1-Flash-Preview有何不同?:该节配图

GLM 5.3 Flash效果

做交互式的前端、常见的代码任务,三者都能达到不错的水准,也让我对国产模型的Coding能力非常有信心。

很多时候完成度都是合格的,哪个便宜、哪个速度快、喜欢哪个选哪个就好。

再给大家看一个,我希望做成一个DNA螺旋动态旋转的效果。

提示词

<pre style="background-color: #f5f5f5; padding: 10px; border-radius: 5px; font-family: 'Menlo', 'Consolas', monospace; color: #333;">
<code>
function (DNA) {
 console.log("DNA 3D 🧬!");
}
</code>
</pre>

这一次,三个Flash模型的完成度相对接近。

Flash档位横评,M3.1-Flash-Preview有何不同?:该节配图

M3.1-Flash-Preview效果

发现M3.1-Flash-Preview完成的代码结果,可以实现中文内容非常细致到位的输出,不管是排版还是语言逻辑,很自然。

以前我用海外模型,有时会遇到处理中文文字很生硬,格式、结构出现错误的情况,现在国产一线模型都很少出现了。

Flash档位横评,M3.1-Flash-Preview有何不同?:该节配图

GLM 5.3 Flash效果

因为提示词写得比较细,GLM 5.3 Flash这次出的结果,乍一看和M3.1-Flash-Preview几乎没什么分别,只是用了英文来呈现。

细看的话,DNA螺旋的设计,文字内容的排列,还是有挺多不同,生成的时间稍稍更长一点。

Flash档位横评,M3.1-Flash-Preview有何不同?:该节配图

DeepSeek V4.1 Flash效果

DeepSeek V4.1 Flash也是带来了同一水准的呈现,DNA螺旋的金属质感我很喜欢,只是有些文字重叠,但不影响阅读。

因为M3.1-Flash-Preview生成速度比较快,同样的时间里,我把DNA螺旋改成灰色,灰色背景,又试了一次,同样有不错的水准。

Flash档位横评,M3.1-Flash-Preview有何不同?:该节配图

更多场景里,三者都能正确理解多文件上下文,批量读写指令执行得到位,这一组整体效果都是比较到位的。

之前一直觉得,DeepSeek V4.1 Flash是在保证效果的基础上速度最快的一个,GLM 5.3 Flash则是代码能力最强、推理和数学严谨性最好的。

现在对比下来,能看到M3.1-Flash-Preview在几个维度上,也都达到了很高的水准。

综合来看,只选一个的话,似乎用哪个也都没毛病,但M3.1-Flash-Preview的速度之快给我留下了很深的印象——

全程高速稳定,thinking过程干净,指令遵循度高,Coding审美很不错。

02

多模态理解、金融数分等能力,也很强

Coding是M3.1-Flash-Preview的优势主场,但它不止会写代码。

我拿了一段赛车模拟的操作视频做测试,内容是人类在世界模型构建的场景里驾驶的完整流程,分别让几个flash模型来解读:

M3.1-Flash-Preview能准确识别视频中的位移、放置、调整姿态等动作,并且能判断任务完成状态。

从视频解析开始,输入输出,以及细节的理解很到位。

多模态理解、金融数分等能力,也很强:该节配图

让我有点意外的是,它还主动帮我生成了一些分析表格,方便我更好地验收。

这种对视频时序逻辑的理解能力,在Flash档位模型里,表现很突出了。

多模态理解、金融数分等能力,也很强:该节配图

多模态理解、金融数分等能力,也很强:该节配图

对比一下两个老对手,GLM 5.3 Flash和DeepSeek V4.1 Flash对视频的分析相对都更简单,尤其是视觉呈现形式上稍显单一。

拿GLM 5.3 Flash来说,它很精准识别出了飞盘的颜色是橙色,以及第一人称视角的几类动作,并且给出了技术上值得注意的点;

多模态理解、金融数分等能力,也很强:该节配图

对因果对应、3D一致性的分析,以及驾驶场景细节的把握,也比较细致。

多模态理解、金融数分等能力,也很强:该节配图

但是在逐帧的画面拆解、分镜头的解读上,GLM 5.3 Flash没有一次性给出更详细的说明,需要二次追问,才能够准确输出。

再看看DeepSeek V4.1 Flash。

多模态理解、金融数分等能力,也很强:该节配图

DeepSeek V4.1 Flash这个多模态识别,逻辑很清晰,对画面的解读很细,把视频基本情况、画面结构等等做了特别说明,几秒到几秒的变化都有关注到,而且列出表格做了从动作到画面的分类。

多模态理解、金融数分等能力,也很强:该节配图

在视频分析这个场景里,我会觉得三款模型也基本打成了平手,对于细微动作和场景变换的理解都不错,但是各自的侧重会不太一样。

而在数据分析和图表的可视化表现上,M3.1-Flash-Preview也给我留下了很好的印象。

金融场景我也试了一下。

给它一段模糊的需求描述:「帮我搭建晟远科技(002097.SZ)智能换电站网络二期 投资决策的金融数学商分框架」。

M3.1-Flash-Preview能自己拆解任务、搜索数据、跑估值模型、最后输出带图表的HTML报告。

多模态理解、金融数分等能力,也很强:该节配图

可视化交互方面,M3.1-Flash-Preview生成的HTML图表审美在线,动态数据、3D场景的渲染逻辑也比较合理。

整个过程不需要我补太多指令,执行力和判断力,在它给出的多维数据图表里都能得到呈现。

多模态理解、金融数分等能力,也很强:该节配图

我很喜欢它给我的决策看板和多维数据表格,各种折线看起来还是很专业的——

多模态理解、金融数分等能力,也很强:该节配图

当然,在数据准确性和模型假设的合理性上,它跟真正的资深分析师还有差距,但考虑到速度和成本,这个表现已经超出预期。

这个能力我不确定是训练数据覆盖到了还是模型本身对空间布局有理解,但至少比我预期中一个“主打Coding的Flash模型”要好不少。

多模态理解、金融数分等能力,也很强:该节配图

这个场景里,GLM 5.3 Flash和DeepSeek V4.1 Flash的数据准确性和分析也同样不错,分析同样到位,不过视觉呈现方式,更偏传统的文字和图表。

03

Flash档位的战争,才刚刚开始

最近有个感受,Flash这个模型档位,正在从「够用就行的轻量模型」,变成各家厂商展示技术实力的新战场。

今年下半年,DeepSeek V4.1 Flash、GLM 5.3 Flash、小米MiMo-V2.6 Flash、Ling 3.0 Flash扎堆发布,每一家都在往这个档位里塞自己的最新架构。

DeepSeek用非对称架构把输入侧激活参数压到8B,GLM用更低的KV缓存体积把上下文拉到1M,小米MiMo-V2.6 Flash在AA指数上跑到43分……

旗舰模型比的是谁更聪明,Flash模型比的是谁能在够聪明的前提下跑得最快、最稳。

这也是让我看到M3.1-Flash-Preview非常有诚意的地方,不仅速度快,而且生成质量稳定在高水准,在质感和审美上又很细腻,多模态等传统强项上依然优势明显,Coding能力更是表现不俗。

Flash档位的战争,才刚刚开始:该节配图

当然它的短板也存在,偶尔会出现幻觉,以及指令遵循的小问题,还是能让人感觉到它不是一个大参数模型。

但不管怎样,MiniMax让我看到了值得乐观的信号,也实实在在多了一个选择。

在更多需要代码生成、多模态交互、以及商业数据分析的场景里,它会是我更放心的一个选项。

现在因为还是公测版本,还有调整优化的空间,估计工程师们也正在加班加点调试中……在接下来的版本里,相信它也会更成熟,完成度更高。

期待你也来试试!

Flash档位的战争,才刚刚开始:该节配图

Image

Source: AI异类弗兰克 · mp.weixin.qq.com