匿名模型三天登顶,我让它跟DeepSeek和GLM来一轮硬核实测

路人甲TM阅读约 8 分钟

本文转载自微信公众号「路人甲TM」,点此查看原文。

最近模型圈突然出现了一只兔子,Space Bunny Alpha。

上线三天,就冲到了OpenRouter和OpenCode的调用日榜前列。

社区里一边夸它快、写网页好看,一边忙着给这只兔子查户口。

有人看到Bunny,想到兔子住在月亮上,于是猜它来自月之暗面。

有人觉得它的输出节奏像MiniMax,也有人顺着Space直接把马斯克拉了进来。

我围观了一圈,最大的感受是,大家研究模型身世的热情,已经快超过研究模型能力了,果然八卦是人类的天性。

猜名字挺好玩,但我更关心一个现实问题,这只突然登顶的匿名兔子,真的能干活吗?

我找来目前同属Flash定位的DeepSeek V4.1 Flash和GLM5.3 Flash,准备让三个模型做一轮正面对比,看看实际体验究竟如何。

规则,工具保持一致,只比较模型能力

一个模型用成熟的Coding Agent,另一个只在普通对话框里输出代码,结果自然没有可比性。

所以这次Space Bunny Alpha、DeepSeek V4.1 Flash和GLM 5.3 Flash全部运行在WorkBuddy下,共享一套harness。

Harness可以理解成模型干活时共用的工作台。

它决定模型能看到哪些文件,可以调用什么工具,怎样打开浏览器验收,以及任务中断后如何继续。

三位选手拿到相同的目录、权限、依赖和提示词。

每个任务都先从空文件夹开始,整个过程中我不手动改代码,只处理必要授权,记录模型的耗时、报错、修改过程和最终结果。

第一题,鹈鹕骑自行车(3D版)

匿名模型三天登顶,我让它跟DeepSeek和GLM来一轮硬核实测

鹈鹕骑自行车是模型社区里很有名的非正式测试。

它看着幼稚,实际很容易翻车。

鹈鹕有长嘴、翅膀和两只脚,自行车又有车架、车轮、脚踏和车把。

模型只要没理清空间关系,鹈鹕就会坐在车轮里,脚踩空气,或者连人带车一起向后滑;在此基础上,这一次我把它升级成了3D版。

GLM 5.3 Flash耗时:12min

Space Bunny Alpha耗时:20min

DeepSeek V4.1 Flash耗时:60min

三个模型都理解了题目,鹈鹕、自行车、鱼和海边木栈道全部出现,脚踏、车轮与角色动作也基本能够对应起来。

放在一起看,差距主要出现在画面取舍、交互完成度和交付速度上。

GLM 5.3 Flash只用了12分钟,但速度快是因为它没有堆太多装饰,采用了一套比较统一的低多边形风格,速度调节、暂停、昼夜切换、跟随视角和自由观察都能正常操作,点击以后能看到明确反馈。

画面精细度不算最高,但它在很短时间内把题目要求完整跑通了。

DeepSeek V4.1 Flash用了60分钟,是三款里耗时最长的。

它把海面、木栈道、路灯、栏杆和岸边植被都做了出来,自行车的车架和辐条也更细,整体完成度比较稳。

自由观察和昼夜切换都能正常使用,镜头也支持拖动、缩放和平移。

不过从任务验收的角度看,DeepSeek把提示词中的核心功能基本交齐了,只是用了接近GLM五倍的时间。

Space Bunny Alpha用了20分钟,画面氛围我认为是三款里最突出的。

夕阳、海面反光、木栈道阴影和自行车都充满细节,控制面板甚至提供了侧面、正面、背面、俯视和贴地等多个视角入口。

综合时间、画面和功能完成度,这一轮我会把Space Bunny放在第一位。

GLM依靠最快的交付速度和完整的基础功能排在第二。

DeepSeek的完成度依然稳定,但60分钟的耗时拉低了综合表现,排在第三。

第二题,星际水族箱

匿名模型三天登顶,我让它跟DeepSeek和GLM来一轮硬核实测

第一题考察的是空间和逻辑关系,第二题开始考模型交互。

我让三个模型制作一个透明3D水箱。

水里漂着黄色橡皮鸭和不同密度的小球,用户点击或拖动水面会产生连续波纹,物体也要跟着起伏、碰撞和漂移。

页面提供地球、月球和火星三种重力模式,还要能调整波浪强度、阻尼与物体数量;右侧面板实时显示帧率、当前重力和物体状态。

GLM 5.3 Flash耗时:11min

Space Bunny Alpha耗时:15min

DeepSeek V4.1 Flash耗时:33min

分析结果,GLM只用了11分钟,速度层面领先,深色界面和实时数据面板也做得简洁清楚。

但我调整小球数量之后,水箱里的鸭子直接消失了,画面中显示的小球数量也没有跟着变化,GLM的物体重建和状态显示之间还没有稳定同步,影响了题目明确要求的核心功能。

DeepSeek用了33分钟,依旧是这一轮耗时最长的模型,但完成度也最高。

它的水面更像一整张连续起伏的水体,小球数量能够真实增减,右侧状态面板会同步更新,切换地球、月球和火星后,物体的漂浮状态也会随之改变。

我把参数来回调整了几轮,暂时没有发现明显影响使用的问题,验收通过。

Space Bunny用了15分钟,交互体验是三个成品里最有意思的。

拖动水面时,波浪会沿着水箱扩散,小球和鸭子会被明显推开,切换重力与提高波浪强度后,整个水箱的变化也最有戏剧性。

极端参数下,物体偶尔会被浪推得过猛,甚至飞出水箱,物理边界还可以继续调优,但它确实最容易让人忍不住多玩几次。

综合来看,这一轮DeepSeek的功能闭环最完整,Space Bunny的互动性和趣味性最好,GLM依然展现了极强的生成速度,但核心参数没有可靠生效。

如果按照稳定性和完成度排序,我会把DeepSeek放在第一,Space Bunny第二,GLM第三。

第三题,复刻一款平面后室游戏

匿名模型三天登顶,我让它跟DeepSeek和GLM来一轮硬核实测

前两个案例都和3D有关,第三题我决定换个口味,做一款2D后室逃生游戏。

我一直很喜欢后室、SCP这类设定,平时刷到相关的短片和游戏,我也总会忍不住多看一会儿。

几张昏黄墙纸,一阵没完没了的日光灯噪声,再加上怎么走都像回到原地的走廊,就能让人自己脑补出一整套世界观。

正好游戏很适合拿来检验模型的综合能力。

能画出一个房间只算开头,后面还有随机地图、素材加载、角色状态、敌人逻辑、碰撞判定和完整的通关循环,任何一个环节没接好,成品都会在试玩时露馅。

于是我让三个模型做一款后室逃生游戏,玩家需要在随机生成的地图里找到三盘录像带,拼出密码,打开真正的出口,同时躲避会根据声音和视线追踪的实体。

体力值和理智值会持续变化,死亡后可以重新开始,找到出口则进入结算页面。

GLM 5.3 Flash耗时:53min

Space Bunny Alpha耗时:41min

DeepSeek V4.1 Flash耗时:54min

Space Bunny Alpha用了41分钟,是这一轮最快的模型,也是我实际玩起来最舒服的一版。

它的地图里房间、狭窄走廊、箱子、通风口、编号牌和绿色安全区都有明确的视觉区别,玩家一眼就能判断怎么走、哪里可以进一步探索。

我测试了多个随机Seed,录像带、终端和出口都能保持连通,敌人会游荡、追逐和丢失目标,体力与理智系统也会真实影响游戏过程。

DeepSeek V4.1 Flash用了54分钟,画面细节是三个版本里最丰富的。

不同房间有桌椅、纸张、灯管、污渍和杂物,追逐时还会出现红色暗角与残影。

它对功能的覆盖也最细致,包括随机地图、录像带线索、错误密码、出口解锁、失败重开和结算统计都做了完整验证。

GLM 5.3 Flash用了53分钟,流程同样完整,但它的画面大部分区域被压在很深的黑色里,确实营造了恐怖感,但房间结构、道具和道路边界也更难辨认,和最初想法稍显违背。

综合耗时、画面可读性和游戏体验,这一轮我会把Space Bunny放在第一,DeepSeek第二,GLM第三。

结果汇总,日常工作流中怎么使用

匿名模型三天登顶,我让它跟DeepSeek和GLM来一轮硬核实测

把三轮测试放在一起,三个模型的区别很明显。

Space Bunny速度快且质量在线。

它完成三项任务共用了80分钟。

在保持较快交付速度的同时,Space Bunny做出的成品也更适合直接展示。

鹈鹕骑车的夕阳、海面反光和多机位切换都做得很完整;水族箱的交互设计是三款里最有意思的,点击、拖动和参数变化都能让人自然地继续探索;后室游戏也保持了统一的视觉风格,地图、收集、解谜和逃生流程都能顺利运行,三轮测试下来没有明显偏科。

它的速度与GLM处在同一个档位,工程完成度也没有和DeepSeek拉开太大差距,同时保留了更好的画面氛围和互动体验。

GLM和Space Bunny的交付速度处在同一档。

GLM能够很快做出一个能打开、能操作的首版,适合用来验证想法,但在部分细节上还需要人工检查。

例如水族箱调整小球数量后,画面和状态面板没有同步;鹈鹕骑车做的也相对比较粗糙,细节的打磨程度还可以提升。

相比之下,Space Bunny在相近的时间里,交付了更完整的画面和交互效果。

所以单看速度,两者没有拉开明显差距。

把成品质量也放进来考虑,Space Bunny的综合表现会更有优势。

DeepSeek用时最长,工程完成度相对较高。

三项任务总共耗时147分钟,接近Space Bunny的两倍。

水族箱里的各项参数都能稳定生效,修改后也能正确反映在画面中。

后室游戏的房间细节、角色状态、失败重开和自检项目都做得很完整。

如果项目功能多、规则互相牵连,还有严格的验收清单,DeepSeek依然值得选择。

放进实际工作流以后,Space Bunny更符合我的日常使用需求。

它的交付速度和GLM相近,成品完成度比较可靠,做出的页面也适合直接展示和传播。

写在最后

测完三个项目以后,再回到很多人最关心的问题。

Space Bunny到底是谁?

我也不知道,目前各个评论区里依然只有猜测。

但比起它背后的真实身份,我更在意另一件事。

一个没有品牌光环、没有提前预热的匿名Flash模型,只靠真实调用体验,就在几天内冲进了大家的视野。

这说明大家对模型的判断标准正在变得越来越务实。

响应够快,成本可控,能够把日常任务稳定完成。

参数、榜单和模型背景当然重要。

但真正开始干活以后,我们最后记住的还是哪一个模型更省心,产出的结果让人愿意继续用。

大家觉得这只兔子是谁?

评论区留下你的答案。

我是路人甲,分享实用的AI应用,让AI变成你触手可及的生产力。