GPT-6、DeepSeek V4.1、GPT-5.6实测:同一句话做《我的世界》,谁更强?

牛马替身计划阅读约 4 分钟

本文转载自微信公众号「牛马替身计划」,点此查看原文。

我干了件挺好玩的事。

把同一句话,原封不动地发给三个模型:GPT-6(Astra)、DeepSeek V4.1 Flash、GPT-5.6(Terra)。

没有额外提示词,也没告诉它们应该怎么做,三家拿到的要求完全一样:

写一个我的世界demo,web实现

就这一句话。

三个模型做完之后,我把结果放在了一起。先不公布答案,你可以先看看下面这三张图,猜猜 A、B、C 分别是谁做的。

GPT-6、DeepSeek V4.1、GPT-5.6实测:同一句话做《我的世界》,谁更强?GPT-6、DeepSeek V4.1、GPT-5.6实测:同一句话做《我的世界》,谁更强?GPT-6、DeepSeek V4.1、GPT-5.6实测:同一句话做《我的世界》,谁更强?

答案下面慢慢揭晓。

一、GPT-6 Astra:一次做完,细节也比较完整

先揭晓答案:

A 是 GPT-6 做的。

从开始到完成用了 22 分 40 秒,中间没有让我返工。

GPT-6、DeepSeek V4.1、GPT-5.6实测:同一句话做《我的世界》,谁更强?

打开之后,它交出来的不只是一个简单的游戏页面,还顺手做了一个落地页。

大字写着“下一块,由你创造”,整体看起来更像一个完整的小产品,而不是单纯把 demo 扔出来。

GPT-6、DeepSeek V4.1、GPT-5.6实测:同一句话做《我的世界》,谁更强?

进入游戏之后,基本的东西也都考虑到了。

第一人称视角、WASD 移动、左键挖掘、右键放置,还有 8 种方块。

操作方法直接放在了游戏画面下面,第一次打开也知道怎么玩。

GPT-6、DeepSeek V4.1、GPT-5.6实测:同一句话做《我的世界》,谁更强?

另外一个明显的细节,是它做了昼夜循环。

测试过程中可以看到,场景会从白天变成夜晚,夜里的水面和整体画面也会跟着变暗。

GPT-6、DeepSeek V4.1、GPT-5.6实测:同一句话做《我的世界》,谁更强?

还有一个挺实用的功能:自动存档。

把页面关掉再重新打开,之前的世界还在,而且页面上还显示了当前的种子号:SEED 240919。

GPT-6、DeepSeek V4.1、GPT-5.6实测:同一句话做《我的世界》,谁更强?

所以 GPT-6 这份给我的感觉是:

不只是把"我的世界"做出了个样子,连一些实际玩起来会用到的功能也一起考虑到了。

一次做完,没有返工,这点很省心。

二、DeepSeek V4.1 Flash:第一眼很像,但操作有问题

B 是 DeepSeek V4.1 Flash,同样一次就做完了。

如果只看第一眼,它是三份里面最像我的世界的。

草方块纹理、九宫格快捷栏,左上角还有 FPS 和坐标,游戏界面的感觉做得挺像。

GPT-6、DeepSeek V4.1、GPT-5.6实测:同一句话做《我的世界》,谁更强?

但真正操作起来之后,问题就出来了。

我按照原版我的世界的操作习惯核对了一遍,发现了一个明显的问题:

右键的功能做反了。

原版里右键是放置方块,但它这里做成了拆除。

比如我对着一棵树按右键,本来想搭个平台,结果直接把树给拆了。

除了这个问题,功能也简单。

没有昼夜变化,也没有存档,关掉页面之后之前的内容就没了。

DeepSeek 这份就有意思了:

界面和视觉元素做得挺像,但真正操作起来,还是能发现一些和原版习惯不一样的地方。

当个小游戏 demo 没什么问题,但如果想继续往"我的世界"这个方向做,还得再改不少东西。

三、GPT-5.6 Terra:第一次直接跑偏了

最后一个 C,是 GPT-5.6(Terra)。

不过它这里特殊一点,因为我叫它重做了一次。

第一次只用了 4 分 44 秒,就告诉我完成了。

GPT-6、DeepSeek V4.1、GPT-5.6实测:同一句话做《我的世界》,谁更强?

结果打开一看,我有点懵。

它做的是一个 2D 横版游戏。

方方正正的角色、横版场景,看起来更像马里奥,和我要求的"我的世界"基本不是一个方向。

GPT-6、DeepSeek V4.1、GPT-5.6实测:同一句话做《我的世界》,谁更强?

所以我直接告诉它:

“这是 2D 版,跟我的世界不符合,重新设计。”

这次它倒是理解了。

大概 7 分 51 秒之后,重新做了一个 3D 版本,至少能跑、能跳了。

GPT-6、DeepSeek V4.1、GPT-5.6实测:同一句话做《我的世界》,谁更强?GPT-6、DeepSeek V4.1、GPT-5.6实测:同一句话做《我的世界》,谁更强?

但重新做完之后,和前面两个相比,画面还是比较粗糙。

整个场景基本就是一大片绿色草地,树用几个绿色方块叠起来,只有五种方块,基本没有什么纹理和层次。

GPT-6、DeepSeek V4.1、GPT-5.6实测:同一句话做《我的世界》,谁更强?

所以 GPT-5.6 这次最大的问题,不是做不出来,是第一次就理解错了需求。

而且在我纠正之后,虽然从 2D 变成了 3D,但最终效果还是比较简单。

四、三份结果放一起看

GPT-6 Astra

DeepSeek V4.1 Flash

GPT-5.6 Terra

一次做完

✅ 22 分 40 秒

✅

❌ 第一次做成 2D,纠正后重做

画面

有自己的整体设计,还做了落地页

整体风格比较像我的世界

简单,场景较粗糙

玩法

✅ 挖掘 / 放置 / 存档 / 昼夜

❌ 右键功能反了,无存档

⚠️ 重新做成 3D 后可以运行

主要问题

暂未发现明显问题

右键拆除、没有存档

第一次直接做成 2D

最后

同样一句话,让三个模型自己做,最后出来的东西确实差别挺大。

GPT-6 这次基本没让我怎么操心,从页面设计到游戏功能都做得挺完整,存档、昼夜变化、操作提示这些细节也都有。

DeepSeek 第一眼看起来很像,但真正操作之后,右键功能反了,而且没有存档,关掉页面就没了。

GPT-5.6 则是第一步就理解偏了,直接做成了 2D 横版游戏。虽然后来按照我的要求重新做成了 3D,但做出来的效果还是简单。

不过这次测试还有一个挺有意思的地方:

AI 做偏了,不一定非要重新写一遍 Prompt。

像这次的 GPT-5.6,我发现它做成 2D 之后,直接告诉它哪里不对、希望改成什么样,它就能继续往下改。

所以以后让 AI 做东西,如果第一版不对,先把具体问题指出来,往往比重新开一个对话、从头再写一遍要求更省事。

当然,这次每个模型我都只测了一次。

换一个需求、换一种说法,结果都有可能不一样。所以这篇就当作一次实际测试记录,主要是让大家看看,同样一句话交给不同模型,它们到底会怎么做。

你一开始猜对了吗?

— 完 —