GPQA diamond

Evaluated by Epoch AI on their own harness.

ModelsModels with a result.186
Top resultBest result on this test.95.8%GPT-6 Astra
Top-3 spreadPoints from first to third.0.9 pts
YearYear of release.N/A

Result and price

020406080100$0.01$0.03$0.1$0.3$1$3$10$30$100$300RESULTOUTPUT PRICE PER 1M TOKENS · LOG SCALE

Results

186 results
#ModelResultThe score from the source.
07GPT-5.5xhigh effort94.0% ±1.5
11Grok 4.5high effort93.4% ±1.4
13GPT-5.4xhigh effort93.3% ±1.8
17Gemini 3 Pro92.6% ±1.7
19GLM-5.2max effort91.9% ±1.6
21GPT-5.2xhigh effort91.4% ±1.8
23GLM-5.3max effort90.9% ±1.6
23Qwen3.7 Max90.9% ±2.0
26GLM-5.189.9% ±2.1
27Muse Spark89.8% ±2.2
30Grok 4.2089.3% ±1.9
33Qwen3.6 Plus88.4% ±2.3
36Kimi K2.7 Code87.9% ±2.3
37GLM-587.8% ±2.3
38GPT-5.1high effort87.6% ±1.9
39Kimi K2.587.6% ±1.9
41Grok 487.0% ±2.0
45GPT-5high effort86.2% ±2.1
47Claude Opus 4.585.5% ±2.2
52Kimi K2 Thinking84.2% ±2.1
54GLM-4.783.3% ±2.4
54Qwen3.6 Flash83.3% ±2.7
57GPT-5.5 Instant82.5% ±2.3
59o3high effort81.8% ±2.1
66Claude Sonnet 4.580.3% ±2.9
72DeepSeek V3.277.3% ±2.0
73Claude Sonnet 477.0% ±2.9
73o3-minihigh effort77.0% ±2.6
75Claude Opus 4.176.8% ±3.0
75o1high effort76.8% ±3.0
75Claude 3.7 Sonnet76.8% ±3.0
79Grok 3 [Beta]75.8% ±2.7
85Claude Opus 472.7% ±3.0
86Qwen3 Max72.6% ±2.7
87DeepSeek-R171.7% ±3.1
88Qwen3 235B A22B70.7% ±2.7
90GPT-4.568.7% ±3.3
92Llama 4 Maverick67.0% ±2.8
93GPT-4.166.9% ±2.8
95Claude Haiku 4.565.8% ±3.2
95GPT-4.1 mini65.8% ±2.7
97Gemini 2.0 Pro65.7% ±3.4
98QWQ Plus65.4% ±2.8
99QwQ 32B65.3% ±2.8
100Gemini 2.0 Flash64.1% ±2.7
103O1 Minihigh effort62.4% ±2.7
104Mistral Medium 359.5% ±2.8
106DeepSeek V356.5% ±2.8
107Qwen2.5 Max56.1% ±2.8
108Phi-456.1% ±2.6
108Magistral Small 1.056.1% ±3.5
110R1 Distill Llama 70B55.7% ±3.0
112Qwen3 32Bnone effort54.1% ±2.8
113Claude 3.5 Sonnet54.0% ±2.8
114Grok 253.8% ±2.7
115Qwen3 14Bnone effort53.4% ±2.8
116Llama 4 Scout51.8% ±3.2
117Gemini 1.5 Pro51.5% ±2.6
118Llama 3.1 405B50.9% ±2.6
120o1-preview50.3% ±2.8
121Mistral Large 250.2% ±2.7
122Qwen2.5-72B49.1% ±2.7
123Mistral Small 3.249.1% ±2.8
124GPT-4.1 nano48.9% ±2.5
125GPT-4o48.9% ±2.6
126Qwen Plus 072848.1% ±2.7
127Gemma 3 27B47.7% ±2.7
128Magistral Small 1.247.6% ±2.6
129Qwen3 8Bnone effort47.5% ±2.6
130Llama 3.3 70B47.4% ±2.9
131Claude 3 Opus47.2% ±2.6
133Mistral Small 346.3% ±2.5
135Qwen2.5 32B46.1% ±2.6
137Mistral Small 3.144.7% ±2.3
139Llama 3.1-70B44.2% ±2.5
140Gemini 1.5 Flash43.8% ±2.4
141Qwen3 4Bnone effort43.6% ±2.7
142WizardLM-2 8x22B43.4% ±2.3
144Qwen Turbo41.8% ±2.6
145Llama 3.2 90B41.0% ±2.3
146Qwen2 72B40.8% ±2.6
147Claude 3 Sonnet40.6% ±2.4
148Llama 3 70B40.6% ±2.6
149Gemma 3 12B39.5% ±2.5
150Mistral Large38.8% ±2.5
151Claude 3.5 Haiku38.1% ±2.6
152GPT-4o mini37.7% ±2.4
154Gemma 2 27B36.5% ±2.4
155Claude 3 Haiku36.3% ±2.4
156GPT-4 (Mar 2023)35.7% ±2.4
157Qwen2.5 7B35.5% ±2.3
158Claude 234.7% ±2.5
159Mixtral 8x22B34.1% ±2.1
160Gemini 1.0 Pro34.0% ±2.0
161Eurus 2 7B PRIME33.9% ±2.1
163Claude 2.133.0% ±2.3
163Gemini 1.5 Flash 8B33.0% ±2.4
165DBRX32.9% ±3.3
166Yi 1.5 34B32.0% ±2.0
167Qwen1.5 32B30.7% ±2.0
168GPT-4 (Jun 2023)30.7% ±2.3
169Qwen3 1.7Bnone effort30.6% ±2.3
170Mixtral 8x7B30.2% ±1.9
171Mistral Nemo29.9% ±2.1
172Qwen1.5 72B28.8% ±2.0
173GPT-3.5 Turbo27.6% ±2.0
174phi-3-medium 14B27.6% ±1.6
175Gemma 2 9B27.5% ±2.3
176Ministral 8B27.1% ±2.1
177Llama 3.1-8B27.0% ±1.9
178Llama 2-70B26.3% ±2.0
179Llama 3-8B26.1% ±1.7
180Ministral 3B25.3% ±1.9
181DeepSeek LLM 67B24.6% ±1.4
182Llama 3.2 1B23.9% ±1.6
183Gemma 3 4B23.2% ±1.9
184Gemma 3 1B19.9% ±1.5
185Yi 34B14.7% ±1.1
186Mistral 7B14.2% ±1.0