OTIS Mock AIME 2024-2025

Evaluated by Epoch AI on their own harness.

ModelsModels with a result.168
Top resultBest result on this test.100.0%GPT-6 Astra
Top-3 spreadPoints from first to third.0.0 pts
YearYear of release.N/A

Result and price

020406080100$0.1$0.3$1$3$10$30$100$300RESULTOUTPUT PRICE PER 1M TOKENS · LOG SCALE

Results

168 results
#ModelResultThe score from the source.
16Grok 4.5high effort97.8% ±1.3
19GPT-5.2xhigh effort96.1% ±2.7
20Qwen3.7 Max95.6% ±3.1
20Kimi K2.7 Code95.6% ±3.1
25GPT-5.4xhigh effort95.3% ±3.2
28GLM-5.193.3% ±3.8
28Qwen3.6 Plus93.3% ±3.8
31Grok 4.2092.2% ±3.3
32Kimi K2.592.2% ±3.9
33Gemini 3 Pro91.4% ±3.7
33GPT-5high effort91.4% ±3.7
35GLM-5.3max effort91.1% ±3.5
39Muse Spark88.9% ±4.7
43GPT-5.1high effort88.6% ±4.0
49GLM-5.2max effort86.4% ±4.2
51Qwen3.6 Flash84.4% ±5.5
53Grok 484.0% ±5.0
54o3high effort83.9% ±4.4
55GLM-4.783.3% ±4.8
56Kimi K2 Thinking83.1% ±4.8
59Claude Opus 4.581.7% ±5.0
62GLM-580.0% ±6.0
68o3-minihigh effort76.9% ±5.2
69Claude Sonnet 4.574.4% ±6.3
70o1high effort73.3% ±6.7
70Qwen3 Max73.3% ±5.9
73Gemini 2.5 Flash71.9% ±5.5
78DeepSeek V3.268.4% ±7.5
79GPT-5.5 Instant68.1% ±6.2
83Claude Opus 4.164.4% ±7.2
85Claude Sonnet 461.1% ±7.0
86Claude Opus 460.0% ±7.4
87QwQ 32B59.2% ±6.3
90Grok 3 [Beta]55.6% ±7.5
92DeepSeek-R153.3% ±7.5
94Claude Haiku 4.551.3% ±7.1
97Claude 3.7 Sonnet50.0% ±7.5
98O1 Minihigh effort46.9% ±6.5
99GPT-4.1 mini44.7% ±6.1
100GPT-4.138.3% ±6.3
101GPT-4.537.8% ±7.3
103Mistral Medium 332.2% ±6.0
104Gemini 2.0 Flash31.1% ±6.3
104o1-preview31.1% ±7.0
106Mistral Small 3.230.3% ±5.8
107Magistral Small 1.030.0% ±5.9
108GPT-4.1 nano28.9% ±6.0
109Magistral Small 1.228.1% ±5.6
110MiniMax M3none effort26.7% ±6.7
111Qwen3 14Bnone effort25.8% ±4.8
113Qwen3 32Bnone effort23.1% ±5.1
114Gemma 3 27B22.5% ±5.3
115Qwen3 8Bnone effort22.2% ±4.5
117Llama 4 Maverick20.6% ±4.9
118Qwen Plus 072817.8% ±4.4
119Gemma 3 12B16.7% ±4.2
120Qwen2.5 Max16.1% ±4.1
121DeepSeek V315.8% ±4.3
122Gemini 1.5 Pro14.9% ±5.2
123Phi-413.8% ±3.7
124Grok 211.5% ±3.4
125Gemini 1.5 Flash10.1% ±4.1
126Llama 3.1 405B9.7% ±3.2
128Mistral Large 28.1% ±2.5
129Qwen2.5-72B8.1% ±2.6
131Llama 4 Scout7.8% ±3.0
132Gemma 3 4B7.5% ±2.8
133Qwen2.5 32B7.4% ±2.1
134GPT-4o mini6.9% ±2.7
136Claude 3.5 Sonnet6.5% ±2.2
137GPT-4o6.3% ±2.3
138Qwen Turbo6.1% ±2.2
139Mistral Small 36.0% ±2.7
140Llama 3.3 70B5.1% ±2.4
141Mistral Small 3.14.9% ±1.5
142Claude 3 Opus4.7% ±2.0
143Gemini 1.5 Flash 8B4.6% ±2.0
145Claude 3.5 Haiku4.3% ±1.6
145Llama 3 70B4.3% ±2.2
147Llama 3.1-70B3.6% ±1.7
148Llama 3.2 90B2.6% ±0.9
149Claude 22.5% ±1.5
149Claude 3 Sonnet2.5% ±2.0
149Qwen2.5 7B2.5% ±0.9
153GPT-3.5 Turbo2.2% ±2.2
154Mistral Large1.9% ±0.9
154Claude 2.11.9% ±1.0
154Llama 3-8B1.9% ±1.0
157Claude 3 Haiku1.8% ±0.8
158Llama 3.1-8B1.7% ±0.9
159Gemma 2 27B1.4% ±0.9
160Gemini 1.0 Pro1.1% ±0.6
160Gemma 3 1B1.1% ±0.5
160GPT-4 (Jun 2023)1.1% ±0.5
163DeepSeek LLM 67B0.8% ±0.5
164Gemma 2 9B0.6% ±0.4
164GPT-4 (Mar 2023)0.6% ±0.4
164Llama 3.2 1B0.6% ±0.4
167Mistral 7B0.3% ±0.3