Space Bunny 测评:免费 Flash 模型支持 1M 上下文与原生多模态
原文标题:这是目前最好用的 Flash 模型,居然还免费。
匿名 Flash 模型 Space Bunny 在 OpenRouter 和 OpenCode 上调用量很大,支持 1M 上下文和原生多模态,作者实测其能力好过 DeepSeek V4.1 Flash,速度明显快于 GPT 6 Sol,视频理解、长程任务与 Coding 表现不错,遇到 Bug 时会自主调用视觉工具截图验证。
Space Bunny 这个模型居然到现在还没人认领。前两天好多人都说是 MiniMax,结果 M3.1-Flash-Preview 都已经发布了。
Kimi 的话,更不是,虽然听说他们要发 K3.1,但显然 Space Bunny 是个 Flash 级别的模型。
不过也有可能 Space Bunny 是 M3.1-Flash-Preview 的灰度测试版本。
这周中间空着的三天,我和团队不忙,用了大把的时间来测评和收尾另外一个产品,准备节后上线。我们的体感是,Space Bunny 的能力要好过 DeepSeek V4.1 Flash。
无论是在 OpenRouter 还是 OpenCode 上,这个模型的调用量都非常大。当然,它现在是免费的,免费肯定会放大调用量。
但即便免费,能够做到现在这个调用量,我觉得至少说明用户还是认可它的能力。要不然大家发现这个模型什么活都干不了,也不会一直拿着它空转。
毕竟大家拿模型是来干活的,时间成本比 Token 成本贵多了。
至于模型参数、架构这些,因为 Space Bunny 现在还是匿名模型,不知道。我可以确定它支持 1M 上下文,而且原生多模态。
给大家看一个我们团队做的作品。整个效果都是用 HTML 代码搞定的。
灵感来自我最近在 X 上看到的一个作品。正好这段时间我在教孩子玩魔方。
大家都知道,学魔方很多时候就是记口诀、记步骤。
但我看到这个 Case 时就在想,其实完全可以做一个页面,用图形化的方式,让孩子更直观地理解魔方到底是怎么一步一步还原出来的。大家看这是我做完的效果:
在做的过程中,中间有一部分交互一直卡壳,来回调了好多次都不太对。
后来我索性直接说,我也不知道该怎么调了。你就根据现在这个页面和我想要的效果,自己判断应该怎么改,技术方案也由你来定。
然后它自己去研究分析现在的交互问题,重新调整逻辑,最后把这一段做出来了。这一点我还是挺意外的,超出我的预期。
总的来说,这个模型我觉得有几个比较明显的特点。
1、速度比较快。和 GPT 6 Sol 相比体感非常明显,毕竟是 Flash 模型。
2、多模态理解能力很强。特别是对于视频的理解,很不错。
3、长程任务和 Coding。这一块一会儿展开讲。肯定比不过那些超大参数的旗舰闭源模型,但日常的大部分任务,我觉得已经完全够用了。
4、审美很好。审美这个东西非常主观。我们团队这两天用它做出来的东西,我都挺喜欢。
我还顺手做了一个纯代码版本的找星星的故事,大家看看。用了 3000 多万 Token。
X 上有个用户说,他喜欢 Space Bunny 的一个重要原因是, 在遇到 Bug 时,模型会第一时间自主地调用视觉工具。
我也发现了,比如下面这个截图,它就直接自己截图看效果了。
跑完问题后,也会自己主动截图验证。
我们再看下它的多模态能力和审美。注意这个 Case,全部都是代码完成的。
另外我们还做了一个交互式页面。我可以直接手写风、雨、雾这些天气,紧接着页面就会根据我的输入,自动切换成对应的效果。
这个 Case 我也挺喜欢。整个效果都是 Three.js 实现的。
我还花了很多时间继续做另外一个项目,谷雨知识库。
我还给它加了一个 YouTube 频道导入功能。
我把自己平时常看的 45 个 YouTube 频道都录了进去,然后一次性把过去半年里 40 分钟以上的视频全部抓了下来,再把内容完成转写和翻译。
现在的节奏是,它每天早上会自动抓取这些频道最新发布的播客和长视频,再从里面提取一份 AI 洞察。最后出来的效果,就跟刚才截图里差不多。
这样我每天早上打开以后,基本不用再自己一个频道一个频道去刷,就能先看到过去一天有哪些内容值得看。
另外之前这个知识库查询一直特别慢,所以这次我就让 Space Bunny 帮我重新看了一遍这块到底怎么搞。
因为我这个产品里用了阿里云的服务,接的是火山的模型。Space Bunny 自己分析完项目的结构和逻辑之后,会自己去查询相关的文档的实践,然后给我架构建议。
最后它告诉我,可以用阿里云的向量检索服务 DashVector 。
我紧接着追问了一下成本,它会根据目前的数据量以及文档的标价,给出分析。
这是最后优化完的效果,所有的语料都是来自于非常可信的信息源。
点引用的链接,可以直接跳转到对应的视频节点:
再给大家分享一下我这个月的一个决定。我把自己的 ChatGPT 从 Pro 降回了 Plus。当然,我们研发同事还是 Pro。
因为对我来说,现在写的大部分业务代码,我越来越愿意交给 Flash 类的模型去做。甚至很多时候,我感觉体验反而更好。
这个跟我的 Coding 习惯也有关系。我只要开始写代码,基本就会一直专注在这件事上,不太会让模型先跑着,自己去干别的,过一会儿再回来检查。
所以速度对我来说特别重要。模型如果慢,我就得一直在那里等。
而且最近我越来越明显地感觉到,不管是 Space Bunny,还是 DeepSeek V4.1 Flash、GLM 5.3 Flash、Google 的 Gemini Flash,这一类模型处理基础任务已经非常好了。
所以我现在也在尝试换一种使用方式。平时大部分 Coding 任务,优先使用 Flash 模型。
真的碰到一些特别难、需要更强推理能力的任务,再切回硅谷这些旗舰模型。顺便吐槽一下 GPT-6 Sol,最近真的太慢了,等的人心急啊。
话说要是 Space Bunny 真是 MiniMax 家的,那这张牌打的相当不错了。
来源:AI产品阿颖 · mp.weixin.qq.com