MMMU Pro

Multimodal Multi-task Benchmark

ModelsModels with a result.90
Top resultBest result on this test.90.6%Claude Fable 5.1
Top-3 spreadPoints from first to third.1.3 pts
UpdatedDate the source changed the results.1 Sept 2026

Result and cost

020406080100$0.00003$0.0001$0.0003$0.001$0.003$0.01$0.03$0.1$0.3RESULTUS DOLLARS PER TASK ยท LOG SCALE

Results

90 results
#ModelResultThe score from the source.CostUS dollars to run one task.TimeTime to run one task.
01Claude Fable 5.190.6%$0.16637 s
02Claude Opus 589.9%$0.06930 s
03Claude Fable 589.3%$0.16161 s
04Gemini 3.8 Flash89.1%<$0.0112 s
05Gemini 3.7 Flash89.0%$0.0146 s
06GPT-5.6 Sol88.8%$0.05626 s
07Gemini 3.6 Flash88.4%$0.01911 s
08GPT-5.588.3%$0.04354 s
08Gemini 3.5 Flash88.3%$0.02512 s
10Gemini 3.1 Pro Preview88.2%$0.06477 s
11Qwen3.8 Max88.0%$0.01644 s
12Gemini 3 Flash Preview87.6%$0.01428 s
13GPT-5.487.5%$0.04766 s
13Gemini 3 Pro87.5%$0.0148 s
15Muse Spark87.4%<$0.0148 s
16GPT-5.286.7%$0.0612 min
17Claude Opus 4.886.6%$0.12149 s
17Muse Spark 1.186.6%$0.01432 s
19GPT-5.6 Terra86.5%$0.01613 s
20Muse Spark 1.286.1%$0.01874 s
21GLM-5.3-Flash86.0%<$0.0128 s
22Claude Opus 4.785.5%$0.1771 s
23GPT-5.6 Luna85.0%<$0.0135 s
24Kimi K2.5 Thinking84.3%$0.022 min
25Qwen3.6 Plus84.2%$0.0172 min
26Qwen3.8-27B83.9%$0.01343 s
27Claude Opus 4.6 (Adaptive)83.9%$0.1162 min
28Claude Sonnet 4.683.6%$0.1442 min
28Gemini 3.5 Flash-Lite83.6%<$0.018 s
30Grok 4.20 (Reasoning)83.5%$0.02744 s
31GPT-5.183.2%<$0.0175 s
32Grok 4.383.1%$0.0223 min
33Claude Sonnet 583.0%$0.03319 s
34Claude Opus 4.5 Thinking82.9%$0.12775 s
36Qwen3.5 Flash81.9%<$0.0146 s
37GPT-581.5%$0.03372 s
38Gemini 2.5 Pro Exp 03.2581.3%<$0.0124 s
39MiniMax M381.2%<$0.0168 s
40Claude Opus 4.581.1%$0.02220 s
42o380.4%$0.01539 s
43MiMo-V2.580.0%<$0.0142 s
44o4-mini (high)79.7%$0.01120 s
47GPT-5.4 mini79.2%<$0.0151 s
48GPT-5 mini78.9%<$0.0127 s
49Inkling78.5%$0.0312 min
50Claude Opus 4.1 Thinking77.5%$0.1692 s
51o177.4%$0.14626 s
52Grok 476.3%$0.0982 min
55Claude Sonnet 4 Thinking74.9%$0.05149 s
56Claude Opus 4.173.7%$0.04446 s
57GPT-5.4 nano73.6%<$0.0122 s
58Claude Opus 473.3%$0.06214 s
59Grok 4 Fast (Reasoning)72.8%<$0.0119 s
60Grok 4.1 Fast (Reasoning)72.7%<$0.012 min
62Claude Sonnet 472.4%$0.01311 s
62GPT-4.172.4%<$0.0112 s
66Claude 3.7 Sonnet71.5%$0.0128 s
67GPT-5 nano70.9%<$0.0131 s
68GPT-4.1 mini70.5%<$0.018 s
69Gemini 2.0 Flash 00169.8%<$0.0145 s
70Claude 3.5 Sonnet68.8%$0.0146 s
72Mistral Large66.2%<$0.0114 s
73Gemini 1.5 Pro 00265.5%<$0.0144 s
74Magistral Small65.2%<$0.0119 s
75Magistral Medium64.6%$0.02142 s
78GPT-4o63.1%<$0.0148 s
79Mistral Medium63.0%<$0.0113 s
80Grok 4.561.8%$0.0312 min
81Mistral Small60.1%<$0.0113 s
83Grok 2 Vision57.3%<$0.0118 s
84Gemini 1.5 Flash 00257.2%<$0.0141 s
85GPT-4o mini56.6%<$0.0145 s
86GPT-4.1 nano55.1%<$0.017 s
88Claude Haiku 4.5 Thinking46.1%$0.02740 s
90Qwen3.5 Plus Thinking22.8%$0.0152 min