2026-10-04最新国产AI大模型能力排行榜
本页只收录国产模型(DeepSeek、Qwen、GLM、Kimi 等),量的是它们实际做出来的东西好不好,不是跑分。站内国产综合评分榜是基准跑分加权,看能力上限;本页是真人盲测,看干活时的成品质量,口径不同、数值不可互比。
八张榜为网页开发、UI 组件、数据可视化、代码生成、游戏开发、3D 生成、SVG 绘制、ASCII 画,题目各不相同,分数只在同一张榜内成立。
同一道题让两个模型各做一份成品,真人不看名字盲选哪个更好,胜率换算成分数(Elo)。反映的是人的真实偏好,而非 benchmark 能背下来的分数。
网页开发
Kimi K3 (Max) 以 1344 Elo 领先 MiMo-V2.6-Pro(1319),共 53 个国产模型参加。Elo 来自真人盲测投票。
给一句需求,让模型产出一个能跑的落地页或官网。两两对成品盲选投票,胜率换算成 Elo。
共 53 个模型(国产 53),越靠前越强
| # | 模型 | 厂商 | Elo | 胜率 | 生成耗时 |
|---|
| 1 | Kimi K3 (Max) | 月之暗面 | 1344 | 59.9% | 773.2s |
| 2 | MiMo-V2.6-Pro | 小米 | 1319 | 52.0% | 437.3s |
| 3 | GLM-5.3 (Max) | 智谱 AI | 1308 | 55.0% | 378.6s |
| 4 | GLM-5.2 (max) | 智谱 AI | 1295 | 50.6% | 229.4s |
| 5 | GLM-5.1 (Reasoning) | 智谱 AI | 1290 | 55.1% | 302.8s |
| 6 | Qwen3.8 Max | 阿里通义 | 1283 | 51.5% | 629.4s |
| 7 | Qwen3.7 Max | 阿里通义 | 1280 | 54.8% | 282.6s |
| 8 | GLM-5.3-Flash | 智谱 AI | 1280 | 48.5% | 334.5s |
| 9 | Qwen3.7 Plus | 阿里通义 | 1277 | 51.0% | 311.8s |
| 10 | Kimi K2.6 | 月之暗面 | 1276 | 54.2% | 465.6s |
| 11 | MiMo-V2.5-Pro | 小米 | 1275 | 51.2% | 340.2s |
| 12 | Kimi K2.7 Code | 月之暗面 | 1272 | 51.7% | 329.3s |
| 13 | MiMo-V2.5 | 小米 | 1272 | 53.8% | 231.8s |
| 14 | GLM-5-Turbo | 智谱 AI | 1270 | 53.4% | 360.4s |
| 15 | MiniMax M3 | MiniMax | 1264 | 51.9% | 171.0s |
| 16 | Kimi K2.5 (Thinking) | 月之暗面 | 1255 | 55.2% | 245.7s |
| 17 | GLM-5 | 智谱 AI | 1254 | 55.0% | 232.6s |
| 18 | MiniMax M2.7 | MiniMax | 1249 | 51.5% | 215.2s |
| 19 | Qwen3.6 Plus | 阿里通义 | 1248 | 50.4% | 322.2s |
| 20 | DeepSeek V4 Flash 0731 (Reasoning, Max Effort) | 深度求索 | 1245 | 46.7% | 239.3s |
| 21 | DeepSeek V4 Pro 0813 (Reasoning, Max Effort) | 深度求索 | 1241 | 50.5% | 275.0s |
| 22 | GLM-5V-Turbo | 智谱 AI | 1237 | 49.2% | 231.6s |
| 23 | GLM-4.7 (Reasoning) | 智谱 AI | 1232 | 55.3% | 171.7s |
| 24 | MiniMax M2.5 | MiniMax | 1229 | 57.5% | 147.4s |
| 25 | MiMo-V2-Flash (Non-reasoning) | 小米 | 1209 | 49.9% | 65.9s |
| 26 | MiniMax M2.1 | MiniMax | 1208 | 55.4% | 122.7s |
| 27 | Step 3.7 Flash | 阶跃星辰 | 1202 | 44.3% | 117.4s |
| 28 | GLM-4.7-Flash | 智谱 AI | 1201 | 54.0% | 159.0s |
| 29 | Qwen3.5 397B A17B (Reasoning) | 阿里通义 | 1197 | 52.5% | 140.7s |
| 30 | Qwen3.5 Plus 02-15 | 阿里通义 | 1194 | 50.0% | 139.7s |
UI 组件
Kimi K3 (Max) 以 1362 Elo 领先 MiMo-V2.6-Pro(1346),共 49 个国产模型参加。Elo 来自真人盲测投票。
单个组件级产出:表单、卡片、导航、表格。考还原度与精致度 —— 间距、对齐、状态反馈这些细节。
共 49 个模型(国产 49),越靠前越强
| # | 模型 | 厂商 | Elo | 胜率 | 生成耗时 |
|---|
| 1 | Kimi K3 (Max) | 月之暗面 | 1362 | 62.3% | 694.7s |
| 2 | MiMo-V2.6-Pro | 小米 | 1346 | 59.4% | 199.1s |
| 3 | Qwen3.8 Max | 阿里通义 | 1343 | 58.1% | 572.1s |
| 4 | GLM-5.3 (Max) | 智谱 AI | 1329 | 58.4% | 360.4s |
| 5 | GLM-5.3-Flash | 智谱 AI | 1325 | 55.0% | 320.9s |
| 6 | GLM-5.2 (max) | 智谱 AI | 1301 | 55.3% | 274.6s |
| 7 | GLM-5.1 (Reasoning) | 智谱 AI | 1292 | 54.9% | 256.8s |
| 8 | Qwen3.7 Max | 阿里通义 | 1276 | 53.8% | 212.9s |
| 9 | Kimi K2.6 | 月之暗面 | 1273 | 55.6% | 382.4s |
| 10 | Kimi K2.7 Code | 月之暗面 | 1271 | 51.7% | 232.7s |
| 11 | GLM-5-Turbo | 智谱 AI | 1270 | 55.5% | 278.0s |
| 12 | Qwen3.7 Plus | 阿里通义 | 1264 | 48.8% | 222.0s |
| 13 | MiMo-V2.5 | 小米 | 1263 | 53.8% | 153.0s |
| 14 | MiMo-V2.5-Pro | 小米 | 1258 | 51.6% | 276.3s |
| 15 | MiniMax M3 | MiniMax | 1253 | 50.9% | 131.5s |
| 16 | Kimi K2.5 (Thinking) | 月之暗面 | 1243 | 53.6% | 192.1s |
| 17 | DeepSeek V4 Flash 0731 (Reasoning, Max Effort) | 深度求索 | 1242 | 46.8% | 229.0s |
| 18 | Qwen3.6 Plus | 阿里通义 | 1240 | 51.0% | 251.6s |
| 19 | GLM-5 | 智谱 AI | 1237 | 53.6% | 161.4s |
| 20 | MiniMax M2.1 | MiniMax | 1230 | 60.9% | 114.4s |
| 21 | DeepSeek V4 Pro 0813 (Reasoning, Max Effort) | 深度求索 | 1228 | 50.6% | 226.0s |
| 22 | GLM-5V-Turbo | 智谱 AI | 1220 | 48.6% | 157.8s |
| 23 | MiniMax M2.7 | MiniMax | 1216 | 48.5% | 150.2s |
| 24 | GLM-4.7-Flash | 智谱 AI | 1214 | 57.6% | 116.3s |
| 25 | GLM-4.7 (Reasoning) | 智谱 AI | 1206 | 51.1% | 152.1s |
| 26 | MiMo-V2-Flash (Non-reasoning) | 小米 | 1196 | 47.8% | 48.8s |
| 27 | DeepSeek V3.1 (Thinking) | 深度求索 | 1189 | 59.5% | 157.5s |
| 28 | Step 3.7 Flash | 阶跃星辰 | 1185 | 42.3% | 101.6s |
| 29 | Qwen3.5 Plus 02-15 | 阿里通义 | 1184 | 52.2% | 116.9s |
| 30 | MiniMax M2.5 | MiniMax | 1179 | 53.4% | 116.8s |
数据可视化
GLM-5.1 (Reasoning) 以 1366 Elo 领先 Kimi K3 (Max)(1358),共 50 个国产模型参加。Elo 来自真人盲测投票。
图表与仪表盘产出。考可读性与信息层级:轴标不标、图例乱不乱、一眼能不能看出结论。
共 50 个模型(国产 50),越靠前越强
| # | 模型 | 厂商 | Elo | 胜率 | 生成耗时 |
|---|
| 1 | GLM-5.1 (Reasoning) | 智谱 AI | 1366 | 67.0% | 259.7s |
| 2 | Kimi K3 (Max) | 月之暗面 | 1358 | 64.0% | 642.7s |
| 3 | MiMo-V2.6-Pro | 小米 | 1333 | 59.1% | 179.1s |
| 4 | GLM-5.2 (max) | 智谱 AI | 1300 | 53.4% | 275.0s |
| 5 | Qwen3.8 Max | 阿里通义 | 1298 | 54.7% | 610.8s |
| 6 | Qwen3.7 Max | 阿里通义 | 1284 | 54.4% | 221.2s |
| 7 | Qwen3.7 Plus | 阿里通义 | 1284 | 51.2% | 231.0s |
| 8 | GLM-5.3 (Max) | 智谱 AI | 1275 | 53.4% | 372.5s |
| 9 | GLM-5.3-Flash | 智谱 AI | 1272 | 50.5% | 397.5s |
| 10 | GLM-5-Turbo | 智谱 AI | 1272 | 55.1% | 294.2s |
| 11 | MiMo-V2.5-Pro | 小米 | 1266 | 50.5% | 252.2s |
| 12 | Kimi K2.6 | 月之暗面 | 1258 | 52.0% | 377.0s |
| 13 | MiMo-V2.5 | 小米 | 1258 | 53.7% | 156.0s |
| 14 | MiniMax M3 | MiniMax | 1244 | 51.3% | 113.3s |
| 15 | MiniMax M2.7 | MiniMax | 1242 | 52.4% | 152.0s |
| 16 | Qwen3.6 Plus | 阿里通义 | 1238 | 51.0% | 232.4s |
| 17 | GLM-5 | 智谱 AI | 1237 | 53.0% | 150.2s |
| 18 | Kimi K2.7 Code | 月之暗面 | 1233 | 48.7% | 221.4s |
| 19 | Kimi K2.5 (Thinking) | 月之暗面 | 1228 | 51.3% | 186.9s |
| 20 | MiniMax M2.1 | MiniMax | 1215 | 57.0% | 110.8s |
| 21 | DeepSeek V4 Pro 0813 (Reasoning, Max Effort) | 深度求索 | 1212 | 48.7% | 238.5s |
| 22 | GLM-5V-Turbo | 智谱 AI | 1209 | 47.7% | 143.9s |
| 23 | GLM-4.7 (Reasoning) | 智谱 AI | 1204 | 51.2% | 154.0s |
| 24 | GLM-4.5-Air | 智谱 AI | 1195 | 58.5% | 99.9s |
| 25 | DeepSeek-R1 (Jan '25) | 深度求索 | 1190 | 60.9% | 76.0s |
| 26 | DeepSeek V4 Flash 0731 (Reasoning, Max Effort) | 深度求索 | 1190 | 41.1% | 241.0s |
| 27 | Qwen3.5 397B A17B (Reasoning) | 阿里通义 | 1184 | 53.2% | 123.9s |
| 28 | MiniMax M2.5 | MiniMax | 1180 | 51.2% | 107.6s |
| 29 | Step 3.7 Flash | 阶跃星辰 | 1179 | 42.9% | 87.7s |
| 30 | MiMo-V2-Flash (Non-reasoning) | 小米 | 1178 | 46.1% | 53.2s |
代码生成
Kimi K3 (Max) 以 1372 Elo 领先 MiMo-V2.6-Pro(1324),共 49 个国产模型参加。Elo 来自真人盲测投票。
按编程语言分类的代码生成,覆盖面比单一 coding benchmark 宽 —— 同一套题目横跨多种语言,看的是语言无关的工程能力。
共 49 个模型(国产 49),越靠前越强
| # | 模型 | 厂商 | Elo | 胜率 | 生成耗时 |
|---|
| 1 | Kimi K3 (Max) | 月之暗面 | 1372 | 63.4% | 713.8s |
| 2 | MiMo-V2.6-Pro | 小米 | 1324 | 53.5% | 361.3s |
| 3 | GLM-5.3 (Max) | 智谱 AI | 1319 | 56.1% | 440.6s |
| 4 | Qwen3.8 Max | 阿里通义 | 1300 | 53.2% | 683.7s |
| 5 | GLM-5.2 (max) | 智谱 AI | 1296 | 51.3% | 271.7s |
| 6 | GLM-5.3-Flash | 智谱 AI | 1289 | 49.5% | 403.7s |
| 7 | Qwen3.7 Max | 阿里通义 | 1281 | 54.5% | 245.4s |
| 8 | Kimi K2.6 | 月之暗面 | 1278 | 54.8% | 409.3s |
| 9 | Qwen3.7 Plus | 阿里通义 | 1274 | 50.5% | 267.9s |
| 10 | GLM-5.1 (Reasoning) | 智谱 AI | 1274 | 53.4% | 359.9s |
| 11 | MiMo-V2.5-Pro | 小米 | 1272 | 52.0% | 309.0s |
| 12 | GLM-5-Turbo | 智谱 AI | 1269 | 54.0% | 364.0s |
| 13 | MiMo-V2.5 | 小米 | 1265 | 53.6% | 205.7s |
| 14 | Kimi K2.7 Code | 月之暗面 | 1259 | 50.3% | 297.9s |
| 15 | MiniMax M3 | MiniMax | 1254 | 50.9% | 148.0s |
| 16 | GLM-5 | 智谱 AI | 1252 | 55.5% | 197.1s |
| 17 | DeepSeek V4 Pro 0813 (Reasoning, Max Effort) | 深度求索 | 1246 | 51.9% | 284.8s |
| 18 | Kimi K2.5 (Thinking) | 月之暗面 | 1242 | 54.1% | 217.9s |
| 19 | Qwen3.6 Plus | 阿里通义 | 1241 | 50.5% | 270.6s |
| 20 | MiniMax M2.7 | MiniMax | 1239 | 51.0% | 188.6s |
| 21 | DeepSeek V4 Flash 0731 (Reasoning, Max Effort) | 深度求索 | 1236 | 46.4% | 249.8s |
| 22 | GLM-5V-Turbo | 智谱 AI | 1235 | 50.1% | 198.5s |
| 23 | GLM-4.7 (Reasoning) | 智谱 AI | 1223 | 54.8% | 165.2s |
| 24 | MiniMax M2.5 | MiniMax | 1213 | 56.8% | 137.4s |
| 25 | MiMo-V2-Flash (Non-reasoning) | 小米 | 1205 | 49.4% | 62.2s |
| 26 | MiniMax M2.1 | MiniMax | 1196 | 55.3% | 120.4s |
| 27 | Step 3.7 Flash | 阶跃星辰 | 1187 | 42.7% | 116.2s |
| 28 | Qwen3.5 397B A17B (Reasoning) | 阿里通义 | 1186 | 52.6% | 135.7s |
| 29 | Hy3 (Low) | 腾讯 | 1183 | 41.1% | 132.3s |
| 30 | GLM-4.7-Flash | 智谱 AI | 1183 | 53.1% | 150.1s |
游戏开发
Kimi K3 (Max) 以 1379 Elo 领先 GLM-5.3 (Max)(1340),共 48 个国产模型参加。Elo 来自真人盲测投票。
可玩的小游戏产出。考逻辑与交互是否闭环:规则说不说得清、碰撞与计分有没有实现。
共 48 个模型(国产 48),越靠前越强
| # | 模型 | 厂商 | Elo | 胜率 | 生成耗时 |
|---|
| 1 | Kimi K3 (Max) | 月之暗面 | 1379 | 61.8% | 847.9s |
| 2 | GLM-5.3 (Max) | 智谱 AI | 1340 | 55.9% | 603.7s |
| 3 | Qwen3.8 Max | 阿里通义 | 1330 | 53.3% | 836.1s |
| 4 | MiMo-V2.6-Pro | 小米 | 1321 | 53.2% | 300.5s |
| 5 | GLM-5.3-Flash | 智谱 AI | 1294 | 47.2% | 641.3s |
| 6 | GLM-5.2 (max) | 智谱 AI | 1281 | 49.5% | 347.6s |
| 7 | Qwen3.7 Max | 阿里通义 | 1280 | 53.6% | 229.6s |
| 8 | GLM-5.1 (Reasoning) | 智谱 AI | 1275 | 55.6% | 445.2s |
| 9 | Qwen3.7 Plus | 阿里通义 | 1273 | 49.7% | 244.6s |
| 10 | MiMo-V2.5-Pro | 小米 | 1272 | 53.3% | 329.2s |
| 11 | Kimi K2.6 | 月之暗面 | 1263 | 54.9% | 406.8s |
| 12 | GLM-5-Turbo | 智谱 AI | 1260 | 53.2% | 496.2s |
| 13 | MiMo-V2.5 | 小米 | 1257 | 52.7% | 243.1s |
| 14 | GLM-5 | 智谱 AI | 1247 | 57.4% | 189.7s |
| 15 | DeepSeek V4 Pro 0813 (Reasoning, Max Effort) | 深度求索 | 1242 | 52.3% | 331.4s |
| 16 | Kimi K2.7 Code | 月之暗面 | 1232 | 47.4% | 301.0s |
| 17 | GLM-5V-Turbo | 智谱 AI | 1231 | 50.7% | 195.8s |
| 18 | MiniMax M3 | MiniMax | 1225 | 46.1% | 118.3s |
| 19 | Qwen3.6 Plus | 阿里通义 | 1224 | 49.1% | 269.9s |
| 20 | MiniMax M2.7 | MiniMax | 1223 | 50.0% | 197.0s |
| 21 | DeepSeek V4 Flash 0731 (Reasoning, Max Effort) | 深度求索 | 1221 | 44.6% | 293.2s |
| 22 | Kimi K2.5 (Thinking) | 月之暗面 | 1219 | 53.4% | 228.5s |
| 23 | GLM-4.7 (Reasoning) | 智谱 AI | 1201 | 55.2% | 167.7s |
| 24 | MiMo-V2-Flash (Non-reasoning) | 小米 | 1197 | 48.6% | 66.6s |
| 25 | MiniMax M2.5 | MiniMax | 1189 | 55.5% | 140.5s |
| 26 | Step 3.7 Flash | 阶跃星辰 | 1171 | 39.0% | 149.4s |
| 27 | GLM-4.6 (Reasoning) | 智谱 AI | 1163 | 54.8% | 108.7s |
| 28 | GLM-4.5 | 智谱 AI | 1158 | 54.4% | 139.7s |
| 29 | DeepSeek-V3.2-Exp | 深度求索 | 1157 | 53.0% | 228.0s |
| 30 | Qwen3.5 397B A17B (Reasoning) | 阿里通义 | 1153 | 50.2% | 142.5s |
3D 生成
Kimi K3 (Max) 以 1407 Elo 领先 GLM-5.3 (Max)(1373),共 45 个国产模型参加。Elo 来自真人盲测投票。
3D 场景与模型产出,考察空间结构、光照与材质表现。
共 45 个模型(国产 45),越靠前越强
| # | 模型 | 厂商 | Elo | 胜率 | 生成耗时 |
|---|
| 1 | Kimi K3 (Max) | 月之暗面 | 1407 | 68.0% | 635.2s |
| 2 | GLM-5.3 (Max) | 智谱 AI | 1373 | 65.9% | 551.2s |
| 3 | Qwen3.8 Max | 阿里通义 | 1352 | 57.4% | 624.2s |
| 4 | MiMo-V2.6-Pro | 小米 | 1343 | 57.9% | 237.6s |
| 5 | GLM-5.1 (Reasoning) | 智谱 AI | 1336 | 62.6% | 292.3s |
| 6 | GLM-5.3-Flash | 智谱 AI | 1334 | 56.8% | 519.9s |
| 7 | GLM-5.2 (max) | 智谱 AI | 1304 | 53.5% | 356.0s |
| 8 | Kimi K2.6 | 月之暗面 | 1283 | 57.6% | 339.7s |
| 9 | Qwen3.7 Max | 阿里通义 | 1282 | 54.8% | 181.6s |
| 10 | DeepSeek V4 Pro 0813 (Reasoning, Max Effort) | 深度求索 | 1269 | 56.8% | 304.3s |
| 11 | GLM-5-Turbo | 智谱 AI | 1264 | 55.9% | 335.5s |
| 12 | MiMo-V2.5-Pro | 小米 | 1260 | 54.2% | 214.2s |
| 13 | Kimi K2.7 Code | 月之暗面 | 1256 | 50.5% | 249.7s |
| 14 | Qwen3.7 Plus | 阿里通义 | 1253 | 48.5% | 172.7s |
| 15 | GLM-5 | 智谱 AI | 1244 | 56.3% | 134.7s |
| 16 | MiMo-V2.5 | 小米 | 1230 | 50.8% | 132.3s |
| 17 | GLM-5V-Turbo | 智谱 AI | 1225 | 52.8% | 112.3s |
| 18 | DeepSeek V4 Flash 0731 (Reasoning, Max Effort) | 深度求索 | 1224 | 48.6% | 254.6s |
| 19 | MiniMax M3 | MiniMax | 1224 | 50.2% | 96.9s |
| 20 | Kimi K2.5 (Thinking) | 月之暗面 | 1220 | 53.1% | 148.0s |
| 21 | Qwen3.6 Plus | 阿里通义 | 1218 | 50.8% | 172.6s |
| 22 | MiniMax M2.7 | MiniMax | 1209 | 49.9% | 127.8s |
| 23 | GLM-4.7 (Reasoning) | 智谱 AI | 1206 | 54.3% | 143.4s |
| 24 | MiMo-V2-Flash (Non-reasoning) | 小米 | 1193 | 49.2% | 44.7s |
| 25 | Hy3 (Low) | 腾讯 | 1191 | 43.9% | 120.2s |
| 26 | GLM-4.5 | 智谱 AI | 1186 | 59.7% | 108.7s |
| 27 | MiniMax M2.5 | MiniMax | 1185 | 57.6% | 93.2s |
| 28 | MiniMax M2.1 | MiniMax | 1180 | 57.5% | 96.1s |
| 29 | Qwen3.5 397B A17B (Reasoning) | 阿里通义 | 1176 | 56.7% | 104.7s |
| 30 | DeepSeek-V3.2-Exp | 深度求索 | 1164 | 56.4% | 152.4s |
SVG 绘制
Kimi K3 (Max) 以 1299 Elo 领先 GLM-5.3 (Max)(1298),共 39 个国产模型参加。Elo 来自真人盲测投票。
用 SVG 画图形。没有任何渲染工具可用,全靠坐标与路径表达,考矢量构图能力。
共 39 个模型(国产 39),越靠前越强
| # | 模型 | 厂商 | Elo | 胜率 | 生成耗时 |
|---|
| 1 | Kimi K3 (Max) | 月之暗面 | 1299 | 59.4% | 429.2s |
| 2 | GLM-5.3 (Max) | 智谱 AI | 1298 | 57.3% | 280.6s |
| 3 | GLM-5.3-Flash | 智谱 AI | 1290 | 57.1% | 204.7s |
| 4 | GLM-5.2 (max) | 智谱 AI | 1219 | 49.3% | 172.8s |
| 5 | Qwen3.7 Max | 阿里通义 | 1217 | 56.0% | 97.6s |
| 6 | GLM-5.1 (Reasoning) | 智谱 AI | 1217 | 55.9% | 185.5s |
| 7 | Qwen3.7 Plus | 阿里通义 | 1213 | 47.9% | 113.0s |
| 8 | GLM-5-Turbo | 智谱 AI | 1206 | 55.0% | 176.7s |
| 9 | DeepSeek V4 Flash 0731 (Reasoning, Max Effort) | 深度求索 | 1186 | 45.1% | 219.7s |
| 10 | Kimi K2.6 | 月之暗面 | 1181 | 51.2% | 127.0s |
| 11 | MiMo-V2.5-Pro | 小米 | 1178 | 48.1% | 125.7s |
| 12 | MiMo-V2.5 | 小米 | 1177 | 50.5% | 89.7s |
| 13 | Kimi K2.7 Code | 月之暗面 | 1175 | 44.9% | 144.5s |
| 14 | GLM-5 | 智谱 AI | 1167 | 54.4% | 57.0s |
| 15 | MiniMax M3 | MiniMax | 1161 | 45.4% | 55.9s |
| 16 | Qwen3.6 Plus | 阿里通义 | 1161 | 50.7% | 141.8s |
| 17 | GLM-5V-Turbo | 智谱 AI | 1151 | 49.2% | 47.1s |
| 18 | Kimi K2.5 (Thinking) | 月之暗面 | 1149 | 48.4% | 106.9s |
| 19 | MiniMax M2.5 | MiniMax | 1148 | 54.5% | 46.7s |
| 20 | GLM-4.7 (Reasoning) | 智谱 AI | 1142 | 54.3% | 90.4s |
| 21 | DeepSeek V4 Pro 0813 (Reasoning, Max Effort) | 深度求索 | 1139 | 45.4% | 244.9s |
| 22 | Qwen3.5 397B A17B (Reasoning) | 阿里通义 | 1139 | 56.1% | 73.4s |
| 23 | MiniMax M2.7 | MiniMax | 1136 | 47.5% | 54.0s |
| 24 | MiniMax M2.1 | MiniMax | 1131 | 55.4% | 40.7s |
| 25 | GLM-4.6 (Reasoning) | 智谱 AI | 1108 | 52.1% | 33.2s |
| 26 | Qwen3.5 Plus 02-15 | 阿里通义 | 1107 | 48.9% | 64.8s |
| 27 | MiniMax M2 Stable | MiniMax | 1099 | 55.3% | 32.6s |
| 28 | GLM-4.5 | 智谱 AI | 1095 | 50.8% | 36.6s |
| 29 | MiMo-V2-Flash (Non-reasoning) | 小米 | 1085 | 40.5% | 18.8s |
| 30 | Step 3.7 Flash | 阶跃星辰 | 1080 | 37.2% | 63.5s |
ASCII 画
GLM-5.3-Flash 以 1276 Elo 领先 Qwen3.7 Max(1225),共 26 个国产模型参加。Elo 来自真人盲测投票。
纯字符网格作画。没有任何图形工具可用,做得出来说明模型对二维空间、比例、层次有真实理解。
共 26 个模型(国产 26),越靠前越强
| # | 模型 | 厂商 | Elo | 胜率 | 生成耗时 |
|---|
| 1 | GLM-5.3-Flash | 智谱 AI | 1276 | 54.8% | 456.2s |
| 2 | Qwen3.7 Max | 阿里通义 | 1225 | 53.6% | 257.6s |
| 3 | GLM-5.3 (Max) | 智谱 AI | 1220 | 46.9% | 482.4s |
| 4 | Kimi K2.7 Code | 月之暗面 | 1209 | 48.3% | 323.5s |
| 5 | GLM-5.2 (max) | 智谱 AI | 1208 | 46.6% | 287.3s |
| 6 | Qwen3.8 Max | 阿里通义 | 1201 | 43.4% | 445.3s |
| 7 | Kimi K2.5 (Thinking) | 月之暗面 | 1177 | 46.4% | 285.5s |
| 8 | Kimi K2.6 | 月之暗面 | 1176 | 47.5% | 357.9s |
| 9 | GLM-4.7 (Reasoning) | 智谱 AI | 1176 | 48.2% | 156.7s |
| 10 | MiniMax M3 | MiniMax | 1171 | 46.8% | 73.2s |
| 11 | GLM-5-Turbo | 智谱 AI | 1167 | 49.2% | 319.7s |
| 12 | Step 3.7 Flash | 阶跃星辰 | 1163 | 45.1% | 110.0s |
| 13 | MiMo-V2.5-Pro | 小米 | 1163 | 46.0% | 130.1s |
| 14 | DeepSeek V4 Pro 0813 (Reasoning, Max Effort) | 深度求索 | 1160 | 46.4% | 277.0s |
| 15 | GLM-5 | 智谱 AI | 1158 | 47.9% | 83.3s |
| 16 | MiMo-V2.5 | 小米 | 1155 | 45.7% | 152.0s |
| 17 | MiniMax M2.7 | MiniMax | 1148 | 46.7% | 80.4s |
| 18 | GLM-5.1 (Reasoning) | 智谱 AI | 1146 | 43.9% | 326.8s |
| 19 | Qwen3.7 Plus | 阿里通义 | 1145 | 41.2% | 233.0s |
| 20 | Qwen3 Max | 阿里通义 | 1139 | 47.2% | 76.9s |
| 21 | Qwen3.6 Plus | 阿里通义 | 1128 | 42.1% | 147.4s |
| 22 | GLM-5V-Turbo | 智谱 AI | 1128 | 43.0% | 105.5s |
| 23 | DeepSeek V4 Flash 0731 (Reasoning, Max Effort) | 深度求索 | 1122 | 42.8% | 111.5s |
| 24 | Qwen3.5 Plus 02-15 | 阿里通义 | 1105 | 43.2% | 141.1s |
| 25 | DeepSeek V3.2 (Reasoning) | 深度求索 | 1093 | 40.5% | 118.2s |
| 26 | MiMo-V2-Flash (Non-reasoning) | 小米 | 1062 | 33.9% | 166.7s |
数据更新于 2026-10-04 · Design Arena 部分由其官方评测集提供 · 本站仅做聚合与排序