2块钱,让Claude Haiku 5.5做了个超级马里奥

聚模合 AI 实测实验室阅读约 4 分钟

我花了两块多钱,让 Claude 做了一个超级马里奥。

前几天,我让三个国产 AI 模型各做了一款城市跑酷游戏。DeepSeek、GLM、Qwen,给它们同样的要求,看看最后能折腾出什么东西。

结果还不错。虽然各有各的问题,但至少游戏都能跑起来,有些地方做得还挺有意思。

玩完以后,我就想着再提高点难度。

做什么呢?

想来想去,干脆做个超级马里奥。

小时候玩过红白机的应该都记得,那个戴帽子的小人,顶砖块、吃蘑菇、踩乌龟,一不小心就掉坑里。操作看起来很简单,真要自己做一个,里面的东西可不少。

我给 AI 写了一份要求:横版地图、像素画风、金币、砖块、水管、敌人、蘑菇道具,还有角色变大、踩怪、跳跃和碰撞检测。游戏要有完整的关卡,能从头玩到尾。

技术上也提了个要求,全部使用 HTML、CSS 和 JavaScript,生成一个独立文件,浏览器打开就能玩。

题目定下来,接着挑模型。

今天找个便宜的试试

Anthropic 昨天刚发布了 Claude Haiku 5.5,我一直想看看这款模型到底怎么样。

Claude 家族有三个档次:Haiku、Sonnet 和 Opus。Opus 是高端型号,价格也高得多。Haiku 则是走便宜、快速的路线。

Haiku 5.5 的标准输入价格是每百万 Token 0.1 美元,输出 0.5 美元。Opus 5.5 分别是 4 美元和 20 美元,单价整整差了 40 倍。当然,Haiku 的长上下文请求还有另一档价格。

差这么多钱,能力到底差多少?

我也没什么概念。排行榜可以参考,但这种事情还是自己试试比较直观。

于是打开 Claude Code 开始工作。

我没有给它准备角色图片,也没有提供游戏素材。所有画面和游戏逻辑,都按照提示词让它自己完成。

过了一会儿,终端里还在不停地跑。

中途我看了一眼,已经执行了 15 分多钟。

又等了几分钟,终于结束。

差不多 19 分钟。

打开生成的 HTML,我还真有点意外。

蓝天、白云、远山、草地,画面就是小时候那种红白机的味道。地面上有砖块,空中悬着金币,前面还有绿色水管和问号方块。

2块钱,让Claude Haiku 5.5做了个超级马里奥

角色也是个像素小人,看起来挺讨喜。

按下方向键,小人开始往前跑。

再按空格,跳起来了。

前面有金币,跳上去吃掉,金币消失,右上角的数量跟着增加。

继续往前,顶一下问号方块,居然还有蘑菇。

吃了蘑菇,小人真的变大了。

我又往前跑了一段,地图跟着滚动,后面还有不同高度的平台、敌人和悬崖。

这一套东西做得挺像那么回事。

尤其是画面,整张地图的风格很统一。那种复古像素的感觉,确实让我想起小时候玩的游戏。

当然,现在还不能说它已经达到商业游戏的水平,后面的关卡也需要进一步测试。但就我录下来的这段实际游戏过程而言,金币收集、角色成长、镜头跟随这些功能都已经跑起来了。

而且它是从零开始生成的。

19 分钟。

我又回头看了一眼时间,确实没看错。

再看看花了多少钱

游戏做完,我打开 OpenRouter 看账单。

这次使用的是 Claude Code,模型只有 Haiku 5.5,没有混用其他模型。

记录显示:

项目数据
模型Claude Haiku 5.5
开发工具Claude Code
开始时间13:54
结束时间14:13
开发耗时约 19 分钟
请求次数32 次
总费用0.342 美元

换成人民币,两块多钱。

看到这个数字,我又把游戏打开玩了一会儿。

两块多钱,19 分钟,做了一个能跑、能跳、能吃金币、能变大的横版游戏。

虽然我知道现在 AI 编程已经很厉害了,但亲眼看到这种成本和成品,感觉还是有点不一样。

过去要做这么一个东西,光是准备素材、处理角色动画、写碰撞逻辑,就够折腾一阵子。现在直接把要求交给模型,等十几分钟就有东西可以玩。

更有意思的是,Haiku 在 Claude 家族里还是最便宜的那个档次。

我原本对它的期待并没有这么高。

同一个模型,换个工具,结果居然不一样

还有件事挺值得说说。

今天最开始用 OpenCode 时,Haiku 几次撞上 32K 输出限制,任务就停在那里了。

后来换成 Claude Code,同样遇到了单次输出 32K 的情况,但后续记录中还能看到模型继续请求、调用工具,最终把游戏做了出来。

这让我有点好奇。

我们平时总喜欢比较哪个 AI 模型更聪明,哪个排行榜分数更高。但真正拿它干活时,除了模型本身,开发工具显然也会影响最后的结果。

当然,今天只做了一次,OpenCode 和 Claude Code 的具体配置也不同,还不能凭这一局就判断谁更厉害。

不过这个问题我准备继续测试。

以后找机会用同一个模型、同一个题目,分别交给不同的 Agent,看看差距究竟有多大。

接下来还想折腾点别的

这次本来准备测两款模型,结果光是 Haiku 就让我折腾了半天。

游戏已经录了视频,大家可以看看实际效果。

2块钱,让Claude Haiku 5.5做了个超级马里奥

吃下蘑菇之后角色变大,镜头也跟着一起滚动。

2块钱,让Claude Haiku 5.5做了个超级马里奥

不同高度的平台、悬空的砖块和敌人,后面还有落差和悬崖。

2块钱,让Claude Haiku 5.5做了个超级马里奥

金币一路收集到 x19,前面的水管和问号方块都还在。

后面准备继续找几款价格差不多的模型,做同样的游戏。开发时间、请求次数、费用都会记录下来,游戏效果也放在一起比较。

我对这种测试还挺有兴趣的。

感兴趣的可以点这个链接试玩:

https://lab.jumohub.com/super-mario/haiku-5.5

—— 聚模合 AI 实测实验室