2026-10-04最新大模型实测性价比排行榜

「实测性价比」= 实测准确率 ÷ 实测单任务成本。分子是该次运行的实际准确率,分母是跑完同一次任务的实际花费,两者取自同一条运行记录。按准确率门槛切成两档:够用档是准确率过线的全部模型,机会档是门槛以下按比值排序的前列。两档分开,是因为这个比值在准确率很低时仍然可以很大。

知识推理性价比(GPQA Diamond)

够用档(准确率 70% 以上)第一是 Ling 3.0 Flash VL,性价比 674.3;第二名 GPT-6 Luna (Max) 295.9。这个比值=实测准确率 ÷ 实测任务成本,不设准确率门槛的话排第一的会是「便宜但答错」的模型。

实测性价比=实测准确率 ÷ 实测单任务成本。分母是跑一次任务的实际花费,分子是同一次运行的实际准确率。够用档要求准确率 ≥70%。GPQA Diamond 是研究生难度的科学问答。

#1 Ling 3.0 Flash VL 厂商:蚂蚁集团 InclusionAI 实测准确率:84.8% 每任务成本:$0.001261.Ling 3.0 Flash VL674.3#2 GPT-6 Luna (Max) 厂商:OpenAI 实测准确率:87.4% 每任务成本:$0.002952.GPT-6 Luna (Max)295.9#3 Ling 3.0 Flash 厂商:蚂蚁集团 InclusionAI 实测准确率:74.9% 每任务成本:$0.002613.Ling 3.0 Flash287.2#4 Qwen3.5 9B (Reasoning) 厂商:阿里通义 实测准确率:77.3% 每任务成本:$0.005934.Qwen3.5 9B…130.4#5 Qwen3-235B-A22B 厂商:阿里通义 实测准确率:72.8% 每任务成本:$0.005765.Qwen3-235B-A22B126.4#6 Gemma 4 31B (Reasoning) 厂商:谷歌 实测准确率:81.8% 每任务成本:$0.006486.Gemma 4 31B…126.3#7 GPT-5.6 Luna (Max) 厂商:OpenAI 实测准确率:87.9% 每任务成本:$0.007917.GPT-5.6 Luna (Max)111.1#8 DeepSeek V3.2 (Reasoning) 厂商:深度求索 实测准确率:80.4% 每任务成本:$0.007318.DeepSeek V3.2…110.0#9 DeepSeek V4 Flash 0731 (Reasoning, Max Effort) 厂商:深度求索 实测准确率:86.3% 每任务成本:$0.007989.DeepSeek V4 Flash…108.1#10 GPT-6 Luna Pro 厂商:OpenAI 实测准确率:88.4% 每任务成本:$0.0083010.GPT-6 Luna Pro106.5#11 DeepSeek-V3.2-Exp 厂商:深度求索 实测准确率:82.2% 每任务成本:$0.0080311.DeepSeek-V3.2-Exp102.3#12 GPT-OSS 120B (high) 厂商:OpenAI 实测准确率:72.6% 每任务成本:$0.0080412.GPT-OSS 120B (high)90.3#13 GLM-5.3-Flash 厂商:智谱 AI 实测准确率:90.9% 每任务成本:$0.0122913.GLM-5.3-Flash74.0#14 MiMo-V2.5 厂商:小米 实测准确率:76.1% 每任务成本:$0.0116914.MiMo-V2.565.1#15 Qwen3 Next 80B A3B Instruct 厂商:阿里通义 实测准确率:70.9% 每任务成本:$0.0111315.Qwen3 Next 80B A3B…63.7#16 GPT-5.4 nano (xhigh) 厂商:OpenAI 实测准确率:77.7% 每任务成本:$0.0130816.GPT-5.4 nano (xhigh)59.4#17 Jev Router 厂商:typesafe 实测准确率:93.9% 每任务成本:$0.0159317.Jev Router59.0#18 GPT-5 nano 厂商:OpenAI 实测准确率:70.5% 每任务成本:$0.0133718.GPT-5 nano52.7#19 Mistral Small 4 (Reasoning) 厂商:Mistral 实测准确率:75.8% 每任务成本:$0.0145619.Mistral Small 4…52.0#20 Switchyard 厂商:英伟达 实测准确率:91.4% 每任务成本:$0.0179120.Switchyard51.0

够用档 (准确率 70% 以上)

够好且最便宜 —— 绝大多数场景直接看这一段 · 共 111 个模型(国产 49)

够用档前 30 名
#模型厂商准确率每任务成本性价比
1Ling 3.0 Flash VL蚂蚁集团 InclusionAI84.8%$0.00126674.3
2GPT-6 Luna (Max)OpenAI87.4%$0.00295295.9
3Ling 3.0 Flash蚂蚁集团 InclusionAI74.9%$0.00261287.2
4Qwen3.5 9B (Reasoning)阿里通义77.3%$0.00593130.4
5Qwen3-235B-A22B阿里通义72.8%$0.00576126.4
6Gemma 4 31B (Reasoning)谷歌81.8%$0.00648126.3
7GPT-5.6 Luna (Max)OpenAI87.9%$0.00791111.1
8DeepSeek V3.2 (Reasoning)深度求索80.4%$0.00731110.0
9DeepSeek V4 Flash 0731 (Reasoning, Max Effort)深度求索86.3%$0.00798108.1
10GPT-6 Luna ProOpenAI88.4%$0.00830106.5
11DeepSeek-V3.2-Exp深度求索82.2%$0.00803102.3
12GPT-OSS 120B (high)OpenAI72.6%$0.0080490.3
13GLM-5.3-Flash智谱 AI90.9%$0.0122974.0
14MiMo-V2.5小米76.1%$0.0116965.1
15Qwen3 Next 80B A3B Instruct阿里通义70.9%$0.0111363.7
16GPT-5.4 nano (xhigh)OpenAI77.7%$0.0130859.4
17Jev Routertypesafe93.9%$0.0159359.0
18GPT-5 nanoOpenAI70.5%$0.0133752.7
19Mistral Small 4 (Reasoning)Mistral75.8%$0.0145652.0
20Switchyard英伟达91.4%$0.0179151.0
21Qwen3 Coder Next阿里通义74.6%$0.0147950.4
22DeepSeek V3.1 Terminus (Reasoning)深度求索77.6%$0.0157449.3
23Gemma 4 26B A4B (Reasoning)谷歌73.1%$0.0156346.7
24DeepSeek V3.1深度求索75.8%$0.0162946.6
25MiMo-V2.6-Flash小米74.7%$0.0166744.8
26GPT-6.1 Sol (max)OpenAI94.4%$0.0213744.2
27Kimi K2月之暗面74.5%$0.0175842.3
28Qwen3.8 Flash阿里通义88.6%$0.0214641.3
29DeepSeek V4 Flash Vision Exp深度求索88.0%$0.0227938.6
30DeepSeek V4.1 Flash (Reasoning, Max Effort)深度求索88.9%$0.0243936.5

机会档 (准确率 低于 70%)

只列出前 30 名;本档准确率低于 70% · 共 35 个模型(国产 18)

机会档前 30 名
#模型厂商准确率每任务成本性价比
1Llama 3 8B Lunarissao10k27.3%$0.000064357.7
2Mistral NemoMistral33.0%$0.000122832.8
3Hy-MT2-30B-A3B腾讯38.9%$0.000231680.0
4Llama 3.2 3B InstructMeta11.6%$0.00015755.3
5Qwen2.5 7B Instruct阿里通义32.8%$0.00053617.3
6GPT-4.1 nanoOpenAI50.0%$0.00084597.9
7Qwen2.5 72B Instruct阿里通义46.0%$0.00103447.1
8GPT-4o miniOpenAI43.2%$0.00101429.5
9Llama 3.3 Instruct 70BMeta47.3%$0.00144328.7
10Qwen2.5 VL 72B Instruct阿里通义44.4%$0.00152291.6
11Qwen3 30B A3B Instruct 2507阿里通义64.4%$0.00260247.4
12Llama 4 MaverickMeta66.0%$0.00274240.5
13Qwen3 14B (Reasoning)阿里通义59.2%$0.00292202.6
14Llama 3.1 Instruct 8BMeta28.6%$0.00141202.2
15Qwen3 Coder 480B A35B阿里通义60.4%$0.00349173.2
16DeepSeek V3 0324深度求索62.1%$0.00383162.1
17GPT-4.1 miniOpenAI64.9%$0.00408159.3
18Qwen3 Coder 30B A3B Instruct阿里通义52.0%$0.00357145.6
19Qwen3 VL 30B A3B Instruct阿里通义64.8%$0.0070092.6
20Qwen3 VL 235B A22B Instruct阿里通义69.5%$0.0088478.6
21Qwen3 30B-A3B阿里通义62.1%$0.0082775.1
22Qwen3 VL 8B Instruct阿里通义51.3%$0.0068874.6
23Qwen3 32B (Reasoning)阿里通义60.9%$0.0084272.4
24Nemotron 3.5 Lightning英伟达69.3%$0.0099070.0
25GPT-OSS 20B (high)OpenAI64.4%$0.0104561.6
26Ling-3.0-flash-Fin蚂蚁集团 InclusionAI50.5%$0.0097651.8
27Granite 4.2 8BIBM65.7%$0.0148644.2
28GPT-4.1OpenAI64.6%$0.0153742.1
29NVIDIA Nemotron 3 Nano 30B A3B (Reasoning)英伟达62.9%$0.0171936.6
30GLM-4.7-Flash智谱 AI54.7%$0.0161633.8

Agent 能力性价比(τ-bench 航空客服)

够用档(准确率 70% 以上)第一是 Ling 3.0 Flash VL,性价比 233.0;第二名 Ling-3.0-flash-Fin 146.1。这个比值=实测准确率 ÷ 实测任务成本,不设准确率门槛的话排第一的会是「便宜但答错」的模型。

同一个算法,用在 τ-bench 航空客服:多轮工具调用、查政策、处理改签与退票。

#1 Ling 3.0 Flash VL 厂商:蚂蚁集团 InclusionAI 实测准确率:70.0% 每任务成本:$0.003001.Ling 3.0 Flash VL233.0#2 Ling-3.0-flash-Fin 厂商:蚂蚁集团 InclusionAI 实测准确率:70.7% 每任务成本:$0.004842.Ling-3.0-flash-Fin146.1#3 GLM-5.3-Flash 厂商:智谱 AI 实测准确率:75.6% 每任务成本:$0.006673.GLM-5.3-Flash113.3#4 MiMo-V2.5 厂商:小米 实测准确率:71.0% 每任务成本:$0.008484.MiMo-V2.583.7#5 DeepSeek V4 Flash 0731 (Reasoning, Max Effort) 厂商:深度求索 实测准确率:74.4% 每任务成本:$0.011065.DeepSeek V4 Flash…67.3#6 GPT-5.6 Luna (Max) 厂商:OpenAI 实测准确率:70.0% 每任务成本:$0.010926.GPT-5.6 Luna (Max)64.1#7 Qwen3.8 Flash 厂商:阿里通义 实测准确率:71.3% 每任务成本:$0.016657.Qwen3.8 Flash42.8#8 GLM-4.5-Air 厂商:智谱 AI 实测准确率:70.0% 每任务成本:$0.017558.GLM-4.5-Air39.9#9 MiMo-V2.6-Flash 厂商:小米 实测准确率:79.3% 每任务成本:$0.020429.MiMo-V2.6-Flash38.8#10 Step 3.7 Flash 厂商:阶跃星辰 实测准确率:77.3% 每任务成本:$0.0201210.Step 3.7 Flash38.4#11 MiniMax M3 厂商:MiniMax 实测准确率:74.1% 每任务成本:$0.0234911.MiniMax M331.5#12 Gemma 4 31B (Reasoning) 厂商:谷歌 实测准确率:76.7% 每任务成本:$0.0282212.Gemma 4 31B…27.2#13 DeepSeek V3.2 (Reasoning) 厂商:深度求索 实测准确率:74.0% 每任务成本:$0.0298613.DeepSeek V3.2…24.8#14 DeepSeek V4 Flash Vision Exp 厂商:深度求索 实测准确率:74.8% 每任务成本:$0.0301714.DeepSeek V4 Flash…24.8#15 MiMo-V2.5-Pro 厂商:小米 实测准确率:73.6% 每任务成本:$0.0303715.MiMo-V2.5-Pro24.2#16 DeepSeek V4.1 Flash (Reasoning, Max Effort) 厂商:深度求索 实测准确率:76.2% 每任务成本:$0.0315416.DeepSeek V4.1 Flash…24.2#17 GLM-5.2 (max) 厂商:智谱 AI 实测准确率:72.7% 每任务成本:$0.0340017.GLM-5.2 (max)21.4#18 Muse Glimmer 30B 厂商:Meta 实测准确率:74.7% 每任务成本:$0.0374318.Muse Glimmer 30B19.9#19 Kimi K2.5 (Reasoning) 厂商:月之暗面 实测准确率:71.4% 每任务成本:$0.0400119.Kimi K2.5…17.9#20 GLM-5 厂商:智谱 AI 实测准确率:77.0% 每任务成本:$0.0446720.GLM-517.2

够用档 (准确率 70% 以上)

够好且最便宜 —— 绝大多数场景直接看这一段 · 共 76 个模型(国产 38)

够用档前 30 名
#模型厂商准确率每任务成本性价比
1Ling 3.0 Flash VL蚂蚁集团 InclusionAI70.0%$0.00300233.0
2Ling-3.0-flash-Fin蚂蚁集团 InclusionAI70.7%$0.00484146.1
3GLM-5.3-Flash智谱 AI75.6%$0.00667113.3
4MiMo-V2.5小米71.0%$0.0084883.7
5DeepSeek V4 Flash 0731 (Reasoning, Max Effort)深度求索74.4%$0.0110667.3
6GPT-5.6 Luna (Max)OpenAI70.0%$0.0109264.1
7Qwen3.8 Flash阿里通义71.3%$0.0166542.8
8GLM-4.5-Air智谱 AI70.0%$0.0175539.9
9MiMo-V2.6-Flash小米79.3%$0.0204238.8
10Step 3.7 Flash阶跃星辰77.3%$0.0201238.4
11MiniMax M3MiniMax74.1%$0.0234931.5
12Gemma 4 31B (Reasoning)谷歌76.7%$0.0282227.2
13DeepSeek V3.2 (Reasoning)深度求索74.0%$0.0298624.8
14DeepSeek V4 Flash Vision Exp深度求索74.8%$0.0301724.8
15MiMo-V2.5-Pro小米73.6%$0.0303724.2
16DeepSeek V4.1 Flash (Reasoning, Max Effort)深度求索76.2%$0.0315424.2
17GLM-5.2 (max)智谱 AI72.7%$0.0340021.4
18Muse Glimmer 30BMeta74.7%$0.0374319.9
19Kimi K2.5 (Reasoning)月之暗面71.4%$0.0400117.9
20GLM-5智谱 AI77.0%$0.0446717.2
21Qwen3.6-35B-A3B (Reasoning)阿里通义71.1%$0.0481514.8
22GLM-4.6 (Reasoning)智谱 AI72.1%$0.0499414.4
23Kimi K2月之暗面71.3%$0.0546113.1
24Qwen3.7 Plus阿里通义70.3%$0.0542513.0
25GLM-4.7 (Reasoning)智谱 AI72.1%$0.0580912.4
26GLM-5.3 (Max)智谱 AI76.1%$0.0619512.3
27DeepSeek V3.1 Terminus (Reasoning)深度求索70.4%$0.0594911.8
28MiMo-V2.6-Pro小米71.7%$0.0670110.7
29Kimi K2.6月之暗面74.1%$0.0733110.1
30GPT-5.6 Luna ProOpenAI71.1%$0.071879.9

机会档 (准确率 低于 70%)

只列出前 30 名;本档准确率低于 70% · 共 59 个模型(国产 26)

机会档前 30 名
#模型厂商准确率每任务成本性价比
1Ling 3.0 Flash蚂蚁集团 InclusionAI68.7%$0.00220312.7
2GLM-4.7-Flash智谱 AI67.9%$0.0087477.6
3GPT-6 Luna (Max)OpenAI67.3%$0.0092972.5
4Llama 3.1 Instruct 8BMeta21.5%$0.0051441.8
5Granite 4.2 8BIBM58.3%$0.0153038.1
6Nemotron 3.5 Lightning英伟达65.6%$0.0173337.8
7Gemma 4 26B A4B (Reasoning)谷歌67.9%$0.0207732.7
8GPT-OSS 120B (high)OpenAI63.4%$0.0197232.2
9Mistral Small 4 (Reasoning)Mistral43.7%$0.0143830.4
10MiniMax M2.5MiniMax65.7%$0.0225929.1
11Gemini 2.5 Flash Lite谷歌50.3%$0.0177028.4
12MiniMax M2.7MiniMax69.8%$0.0256727.2
13MiniMax M2.1MiniMax64.3%$0.0249025.8
14Qwen3.5 9B (Reasoning)阿里通义69.3%$0.0311222.3
15GPT-OSS 20B (high)OpenAI53.4%$0.0243421.9
16Qwen3 32B (Reasoning)阿里通义47.8%$0.0221121.6
17GPT-5.4 nano (xhigh)OpenAI65.3%$0.0321020.4
18Gemini 2.5 Flash谷歌57.1%$0.0286619.9
19Qwen3 Next 80B A3B Instruct阿里通义47.0%$0.0247519.0
20NVIDIA Nemotron 3 Nano 30B A3B (Reasoning)英伟达51.8%$0.0282718.3
21Qwen3 Coder 30B A3B Instruct阿里通义43.1%$0.0236018.3
22GPT-6 Luna ProOpenAI66.7%$0.0387617.2
23GPT-4.1 miniOpenAI43.8%$0.0259516.9
24Qwen3-235B-A22B阿里通义41.6%$0.0247016.9
25GPT-4.1 nanoOpenAI10.9%$0.0067816.1
26Qwen3 30B A3B Instruct 2507阿里通义38.8%$0.0257115.1
27Qwen3 14B (Reasoning)阿里通义43.1%$0.0297714.5
28GPT-4o miniOpenAI28.4%$0.0208113.7
29Qwen3 Coder Next阿里通义55.0%$0.0410113.4
30Inkling Smallthinkingmachines60.7%$0.0465113.0

数据更新于 2026-10-04 · 底表更新于 2026-10-04 00:00 · 来源 OpenRouter · 本站仅做聚合与排序,测量方为 OpenRouter