本文转载自微信公众号「牛马替身计划」,点此查看原文。
我干了件挺好玩的事。
把同一句话,原封不动地发给三个模型:GPT-6(Astra)、DeepSeek V4.1 Flash、GPT-5.6(Terra)。
没有额外提示词,也没告诉它们应该怎么做,三家拿到的要求完全一样:
写一个我的世界demo,web实现
就这一句话。
三个模型做完之后,我把结果放在了一起。先不公布答案,你可以先看看下面这三张图,猜猜 A、B、C 分别是谁做的。



答案下面慢慢揭晓。
一、GPT-6 Astra:一次做完,细节也比较完整
先揭晓答案:
A 是 GPT-6 做的。
从开始到完成用了 22 分 40 秒,中间没有让我返工。

打开之后,它交出来的不只是一个简单的游戏页面,还顺手做了一个落地页。
大字写着“下一块,由你创造”,整体看起来更像一个完整的小产品,而不是单纯把 demo 扔出来。

进入游戏之后,基本的东西也都考虑到了。
第一人称视角、WASD 移动、左键挖掘、右键放置,还有 8 种方块。
操作方法直接放在了游戏画面下面,第一次打开也知道怎么玩。

另外一个明显的细节,是它做了昼夜循环。
测试过程中可以看到,场景会从白天变成夜晚,夜里的水面和整体画面也会跟着变暗。

还有一个挺实用的功能:自动存档。
把页面关掉再重新打开,之前的世界还在,而且页面上还显示了当前的种子号:SEED 240919。

所以 GPT-6 这份给我的感觉是:
不只是把"我的世界"做出了个样子,连一些实际玩起来会用到的功能也一起考虑到了。
一次做完,没有返工,这点很省心。
二、DeepSeek V4.1 Flash:第一眼很像,但操作有问题
B 是 DeepSeek V4.1 Flash,同样一次就做完了。
如果只看第一眼,它是三份里面最像我的世界的。
草方块纹理、九宫格快捷栏,左上角还有 FPS 和坐标,游戏界面的感觉做得挺像。

但真正操作起来之后,问题就出来了。
我按照原版我的世界的操作习惯核对了一遍,发现了一个明显的问题:
右键的功能做反了。
原版里右键是放置方块,但它这里做成了拆除。
比如我对着一棵树按右键,本来想搭个平台,结果直接把树给拆了。
除了这个问题,功能也简单。
没有昼夜变化,也没有存档,关掉页面之后之前的内容就没了。
DeepSeek 这份就有意思了:
界面和视觉元素做得挺像,但真正操作起来,还是能发现一些和原版习惯不一样的地方。
当个小游戏 demo 没什么问题,但如果想继续往"我的世界"这个方向做,还得再改不少东西。
三、GPT-5.6 Terra:第一次直接跑偏了
最后一个 C,是 GPT-5.6(Terra)。
不过它这里特殊一点,因为我叫它重做了一次。
第一次只用了 4 分 44 秒,就告诉我完成了。

结果打开一看,我有点懵。
它做的是一个 2D 横版游戏。
方方正正的角色、横版场景,看起来更像马里奥,和我要求的"我的世界"基本不是一个方向。

所以我直接告诉它:
“这是 2D 版,跟我的世界不符合,重新设计。”
这次它倒是理解了。
大概 7 分 51 秒之后,重新做了一个 3D 版本,至少能跑、能跳了。


但重新做完之后,和前面两个相比,画面还是比较粗糙。
整个场景基本就是一大片绿色草地,树用几个绿色方块叠起来,只有五种方块,基本没有什么纹理和层次。

所以 GPT-5.6 这次最大的问题,不是做不出来,是第一次就理解错了需求。
而且在我纠正之后,虽然从 2D 变成了 3D,但最终效果还是比较简单。
四、三份结果放一起看
GPT-6 Astra
DeepSeek V4.1 Flash
GPT-5.6 Terra
一次做完
✅ 22 分 40 秒
✅
❌ 第一次做成 2D,纠正后重做
画面
有自己的整体设计,还做了落地页
整体风格比较像我的世界
简单,场景较粗糙
玩法
✅ 挖掘 / 放置 / 存档 / 昼夜
❌ 右键功能反了,无存档
⚠️ 重新做成 3D 后可以运行
主要问题
暂未发现明显问题
右键拆除、没有存档
第一次直接做成 2D
最后
同样一句话,让三个模型自己做,最后出来的东西确实差别挺大。
GPT-6 这次基本没让我怎么操心,从页面设计到游戏功能都做得挺完整,存档、昼夜变化、操作提示这些细节也都有。
DeepSeek 第一眼看起来很像,但真正操作之后,右键功能反了,而且没有存档,关掉页面就没了。
GPT-5.6 则是第一步就理解偏了,直接做成了 2D 横版游戏。虽然后来按照我的要求重新做成了 3D,但做出来的效果还是简单。
不过这次测试还有一个挺有意思的地方:
AI 做偏了,不一定非要重新写一遍 Prompt。
像这次的 GPT-5.6,我发现它做成 2D 之后,直接告诉它哪里不对、希望改成什么样,它就能继续往下改。
所以以后让 AI 做东西,如果第一版不对,先把具体问题指出来,往往比重新开一个对话、从头再写一遍要求更省事。
当然,这次每个模型我都只测了一次。
换一个需求、换一种说法,结果都有可能不一样。所以这篇就当作一次实际测试记录,主要是让大家看看,同样一句话交给不同模型,它们到底会怎么做。
你一开始猜对了吗?
— 完 —