2026-10-04最新大模型实测性价比排行榜
「实测性价比」= 实测准确率 ÷ 实测单任务成本。分子是该次运行的实际准确率,分母是跑完同一次任务的实际花费,两者取自同一条运行记录。按准确率门槛切成两档:够用档是准确率过线的全部模型,机会档是门槛以下按比值排序的前列。两档分开,是因为这个比值在准确率很低时仍然可以很大。
知识推理性价比(GPQA Diamond)
够用档(准确率 70% 以上)第一是 Ling 3.0 Flash VL,性价比 674.3;第二名 GPT-6 Luna (Max) 295.9。这个比值=实测准确率 ÷ 实测任务成本,不设准确率门槛的话排第一的会是「便宜但答错」的模型。
实测性价比=实测准确率 ÷ 实测单任务成本。分母是跑一次任务的实际花费,分子是同一次运行的实际准确率。够用档要求准确率 ≥70%。GPQA Diamond 是研究生难度的科学问答。
够用档 (准确率 70% 以上)
够用档前 30 名
| # | 模型 | 厂商 | 准确率 | 每任务成本 | 性价比 |
|---|---|---|---|---|---|
| 1 | Ling 3.0 Flash VL | 蚂蚁集团 InclusionAI | 84.8% | $0.00126 | 674.3 |
| 2 | GPT-6 Luna (Max) | OpenAI | 87.4% | $0.00295 | 295.9 |
| 3 | Ling 3.0 Flash | 蚂蚁集团 InclusionAI | 74.9% | $0.00261 | 287.2 |
| 4 | Qwen3.5 9B (Reasoning) | 阿里通义 | 77.3% | $0.00593 | 130.4 |
| 5 | Qwen3-235B-A22B | 阿里通义 | 72.8% | $0.00576 | 126.4 |
| 6 | Gemma 4 31B (Reasoning) | 谷歌 | 81.8% | $0.00648 | 126.3 |
| 7 | GPT-5.6 Luna (Max) | OpenAI | 87.9% | $0.00791 | 111.1 |
| 8 | DeepSeek V3.2 (Reasoning) | 深度求索 | 80.4% | $0.00731 | 110.0 |
| 9 | DeepSeek V4 Flash 0731 (Reasoning, Max Effort) | 深度求索 | 86.3% | $0.00798 | 108.1 |
| 10 | GPT-6 Luna Pro | OpenAI | 88.4% | $0.00830 | 106.5 |
| 11 | DeepSeek-V3.2-Exp | 深度求索 | 82.2% | $0.00803 | 102.3 |
| 12 | GPT-OSS 120B (high) | OpenAI | 72.6% | $0.00804 | 90.3 |
| 13 | GLM-5.3-Flash | 智谱 AI | 90.9% | $0.01229 | 74.0 |
| 14 | MiMo-V2.5 | 小米 | 76.1% | $0.01169 | 65.1 |
| 15 | Qwen3 Next 80B A3B Instruct | 阿里通义 | 70.9% | $0.01113 | 63.7 |
| 16 | GPT-5.4 nano (xhigh) | OpenAI | 77.7% | $0.01308 | 59.4 |
| 17 | Jev Router | typesafe | 93.9% | $0.01593 | 59.0 |
| 18 | GPT-5 nano | OpenAI | 70.5% | $0.01337 | 52.7 |
| 19 | Mistral Small 4 (Reasoning) | Mistral | 75.8% | $0.01456 | 52.0 |
| 20 | Switchyard | 英伟达 | 91.4% | $0.01791 | 51.0 |
| 21 | Qwen3 Coder Next | 阿里通义 | 74.6% | $0.01479 | 50.4 |
| 22 | DeepSeek V3.1 Terminus (Reasoning) | 深度求索 | 77.6% | $0.01574 | 49.3 |
| 23 | Gemma 4 26B A4B (Reasoning) | 谷歌 | 73.1% | $0.01563 | 46.7 |
| 24 | DeepSeek V3.1 | 深度求索 | 75.8% | $0.01629 | 46.6 |
| 25 | MiMo-V2.6-Flash | 小米 | 74.7% | $0.01667 | 44.8 |
| 26 | GPT-6.1 Sol (max) | OpenAI | 94.4% | $0.02137 | 44.2 |
| 27 | Kimi K2 | 月之暗面 | 74.5% | $0.01758 | 42.3 |
| 28 | Qwen3.8 Flash | 阿里通义 | 88.6% | $0.02146 | 41.3 |
| 29 | DeepSeek V4 Flash Vision Exp | 深度求索 | 88.0% | $0.02279 | 38.6 |
| 30 | DeepSeek V4.1 Flash (Reasoning, Max Effort) | 深度求索 | 88.9% | $0.02439 | 36.5 |
机会档 (准确率 低于 70%)
机会档前 30 名
| # | 模型 | 厂商 | 准确率 | 每任务成本 | 性价比 |
|---|---|---|---|---|---|
| 1 | Llama 3 8B Lunaris | sao10k | 27.3% | $0.00006 | 4357.7 |
| 2 | Mistral Nemo | Mistral | 33.0% | $0.00012 | 2832.8 |
| 3 | Hy-MT2-30B-A3B | 腾讯 | 38.9% | $0.00023 | 1680.0 |
| 4 | Llama 3.2 3B Instruct | Meta | 11.6% | $0.00015 | 755.3 |
| 5 | Qwen2.5 7B Instruct | 阿里通义 | 32.8% | $0.00053 | 617.3 |
| 6 | GPT-4.1 nano | OpenAI | 50.0% | $0.00084 | 597.9 |
| 7 | Qwen2.5 72B Instruct | 阿里通义 | 46.0% | $0.00103 | 447.1 |
| 8 | GPT-4o mini | OpenAI | 43.2% | $0.00101 | 429.5 |
| 9 | Llama 3.3 Instruct 70B | Meta | 47.3% | $0.00144 | 328.7 |
| 10 | Qwen2.5 VL 72B Instruct | 阿里通义 | 44.4% | $0.00152 | 291.6 |
| 11 | Qwen3 30B A3B Instruct 2507 | 阿里通义 | 64.4% | $0.00260 | 247.4 |
| 12 | Llama 4 Maverick | Meta | 66.0% | $0.00274 | 240.5 |
| 13 | Qwen3 14B (Reasoning) | 阿里通义 | 59.2% | $0.00292 | 202.6 |
| 14 | Llama 3.1 Instruct 8B | Meta | 28.6% | $0.00141 | 202.2 |
| 15 | Qwen3 Coder 480B A35B | 阿里通义 | 60.4% | $0.00349 | 173.2 |
| 16 | DeepSeek V3 0324 | 深度求索 | 62.1% | $0.00383 | 162.1 |
| 17 | GPT-4.1 mini | OpenAI | 64.9% | $0.00408 | 159.3 |
| 18 | Qwen3 Coder 30B A3B Instruct | 阿里通义 | 52.0% | $0.00357 | 145.6 |
| 19 | Qwen3 VL 30B A3B Instruct | 阿里通义 | 64.8% | $0.00700 | 92.6 |
| 20 | Qwen3 VL 235B A22B Instruct | 阿里通义 | 69.5% | $0.00884 | 78.6 |
| 21 | Qwen3 30B-A3B | 阿里通义 | 62.1% | $0.00827 | 75.1 |
| 22 | Qwen3 VL 8B Instruct | 阿里通义 | 51.3% | $0.00688 | 74.6 |
| 23 | Qwen3 32B (Reasoning) | 阿里通义 | 60.9% | $0.00842 | 72.4 |
| 24 | Nemotron 3.5 Lightning | 英伟达 | 69.3% | $0.00990 | 70.0 |
| 25 | GPT-OSS 20B (high) | OpenAI | 64.4% | $0.01045 | 61.6 |
| 26 | Ling-3.0-flash-Fin | 蚂蚁集团 InclusionAI | 50.5% | $0.00976 | 51.8 |
| 27 | Granite 4.2 8B | IBM | 65.7% | $0.01486 | 44.2 |
| 28 | GPT-4.1 | OpenAI | 64.6% | $0.01537 | 42.1 |
| 29 | NVIDIA Nemotron 3 Nano 30B A3B (Reasoning) | 英伟达 | 62.9% | $0.01719 | 36.6 |
| 30 | GLM-4.7-Flash | 智谱 AI | 54.7% | $0.01616 | 33.8 |
Agent 能力性价比(τ-bench 航空客服)
够用档(准确率 70% 以上)第一是 Ling 3.0 Flash VL,性价比 233.0;第二名 Ling-3.0-flash-Fin 146.1。这个比值=实测准确率 ÷ 实测任务成本,不设准确率门槛的话排第一的会是「便宜但答错」的模型。
同一个算法,用在 τ-bench 航空客服:多轮工具调用、查政策、处理改签与退票。
够用档 (准确率 70% 以上)
够用档前 30 名
| # | 模型 | 厂商 | 准确率 | 每任务成本 | 性价比 |
|---|---|---|---|---|---|
| 1 | Ling 3.0 Flash VL | 蚂蚁集团 InclusionAI | 70.0% | $0.00300 | 233.0 |
| 2 | Ling-3.0-flash-Fin | 蚂蚁集团 InclusionAI | 70.7% | $0.00484 | 146.1 |
| 3 | GLM-5.3-Flash | 智谱 AI | 75.6% | $0.00667 | 113.3 |
| 4 | MiMo-V2.5 | 小米 | 71.0% | $0.00848 | 83.7 |
| 5 | DeepSeek V4 Flash 0731 (Reasoning, Max Effort) | 深度求索 | 74.4% | $0.01106 | 67.3 |
| 6 | GPT-5.6 Luna (Max) | OpenAI | 70.0% | $0.01092 | 64.1 |
| 7 | Qwen3.8 Flash | 阿里通义 | 71.3% | $0.01665 | 42.8 |
| 8 | GLM-4.5-Air | 智谱 AI | 70.0% | $0.01755 | 39.9 |
| 9 | MiMo-V2.6-Flash | 小米 | 79.3% | $0.02042 | 38.8 |
| 10 | Step 3.7 Flash | 阶跃星辰 | 77.3% | $0.02012 | 38.4 |
| 11 | MiniMax M3 | MiniMax | 74.1% | $0.02349 | 31.5 |
| 12 | Gemma 4 31B (Reasoning) | 谷歌 | 76.7% | $0.02822 | 27.2 |
| 13 | DeepSeek V3.2 (Reasoning) | 深度求索 | 74.0% | $0.02986 | 24.8 |
| 14 | DeepSeek V4 Flash Vision Exp | 深度求索 | 74.8% | $0.03017 | 24.8 |
| 15 | MiMo-V2.5-Pro | 小米 | 73.6% | $0.03037 | 24.2 |
| 16 | DeepSeek V4.1 Flash (Reasoning, Max Effort) | 深度求索 | 76.2% | $0.03154 | 24.2 |
| 17 | GLM-5.2 (max) | 智谱 AI | 72.7% | $0.03400 | 21.4 |
| 18 | Muse Glimmer 30B | Meta | 74.7% | $0.03743 | 19.9 |
| 19 | Kimi K2.5 (Reasoning) | 月之暗面 | 71.4% | $0.04001 | 17.9 |
| 20 | GLM-5 | 智谱 AI | 77.0% | $0.04467 | 17.2 |
| 21 | Qwen3.6-35B-A3B (Reasoning) | 阿里通义 | 71.1% | $0.04815 | 14.8 |
| 22 | GLM-4.6 (Reasoning) | 智谱 AI | 72.1% | $0.04994 | 14.4 |
| 23 | Kimi K2 | 月之暗面 | 71.3% | $0.05461 | 13.1 |
| 24 | Qwen3.7 Plus | 阿里通义 | 70.3% | $0.05425 | 13.0 |
| 25 | GLM-4.7 (Reasoning) | 智谱 AI | 72.1% | $0.05809 | 12.4 |
| 26 | GLM-5.3 (Max) | 智谱 AI | 76.1% | $0.06195 | 12.3 |
| 27 | DeepSeek V3.1 Terminus (Reasoning) | 深度求索 | 70.4% | $0.05949 | 11.8 |
| 28 | MiMo-V2.6-Pro | 小米 | 71.7% | $0.06701 | 10.7 |
| 29 | Kimi K2.6 | 月之暗面 | 74.1% | $0.07331 | 10.1 |
| 30 | GPT-5.6 Luna Pro | OpenAI | 71.1% | $0.07187 | 9.9 |
机会档 (准确率 低于 70%)
机会档前 30 名
| # | 模型 | 厂商 | 准确率 | 每任务成本 | 性价比 |
|---|---|---|---|---|---|
| 1 | Ling 3.0 Flash | 蚂蚁集团 InclusionAI | 68.7% | $0.00220 | 312.7 |
| 2 | GLM-4.7-Flash | 智谱 AI | 67.9% | $0.00874 | 77.6 |
| 3 | GPT-6 Luna (Max) | OpenAI | 67.3% | $0.00929 | 72.5 |
| 4 | Llama 3.1 Instruct 8B | Meta | 21.5% | $0.00514 | 41.8 |
| 5 | Granite 4.2 8B | IBM | 58.3% | $0.01530 | 38.1 |
| 6 | Nemotron 3.5 Lightning | 英伟达 | 65.6% | $0.01733 | 37.8 |
| 7 | Gemma 4 26B A4B (Reasoning) | 谷歌 | 67.9% | $0.02077 | 32.7 |
| 8 | GPT-OSS 120B (high) | OpenAI | 63.4% | $0.01972 | 32.2 |
| 9 | Mistral Small 4 (Reasoning) | Mistral | 43.7% | $0.01438 | 30.4 |
| 10 | MiniMax M2.5 | MiniMax | 65.7% | $0.02259 | 29.1 |
| 11 | Gemini 2.5 Flash Lite | 谷歌 | 50.3% | $0.01770 | 28.4 |
| 12 | MiniMax M2.7 | MiniMax | 69.8% | $0.02567 | 27.2 |
| 13 | MiniMax M2.1 | MiniMax | 64.3% | $0.02490 | 25.8 |
| 14 | Qwen3.5 9B (Reasoning) | 阿里通义 | 69.3% | $0.03112 | 22.3 |
| 15 | GPT-OSS 20B (high) | OpenAI | 53.4% | $0.02434 | 21.9 |
| 16 | Qwen3 32B (Reasoning) | 阿里通义 | 47.8% | $0.02211 | 21.6 |
| 17 | GPT-5.4 nano (xhigh) | OpenAI | 65.3% | $0.03210 | 20.4 |
| 18 | Gemini 2.5 Flash | 谷歌 | 57.1% | $0.02866 | 19.9 |
| 19 | Qwen3 Next 80B A3B Instruct | 阿里通义 | 47.0% | $0.02475 | 19.0 |
| 20 | NVIDIA Nemotron 3 Nano 30B A3B (Reasoning) | 英伟达 | 51.8% | $0.02827 | 18.3 |
| 21 | Qwen3 Coder 30B A3B Instruct | 阿里通义 | 43.1% | $0.02360 | 18.3 |
| 22 | GPT-6 Luna Pro | OpenAI | 66.7% | $0.03876 | 17.2 |
| 23 | GPT-4.1 mini | OpenAI | 43.8% | $0.02595 | 16.9 |
| 24 | Qwen3-235B-A22B | 阿里通义 | 41.6% | $0.02470 | 16.9 |
| 25 | GPT-4.1 nano | OpenAI | 10.9% | $0.00678 | 16.1 |
| 26 | Qwen3 30B A3B Instruct 2507 | 阿里通义 | 38.8% | $0.02571 | 15.1 |
| 27 | Qwen3 14B (Reasoning) | 阿里通义 | 43.1% | $0.02977 | 14.5 |
| 28 | GPT-4o mini | OpenAI | 28.4% | $0.02081 | 13.7 |
| 29 | Qwen3 Coder Next | 阿里通义 | 55.0% | $0.04101 | 13.4 |
| 30 | Inkling Small | thinkingmachines | 60.7% | $0.04651 | 13.0 |
数据更新于 2026-10-04 · 底表更新于 2026-10-04 00:00 · 来源 OpenRouter · 本站仅做聚合与排序,测量方为 OpenRouter