FrontierMath-2025-02-28-Private

Evaluated by Epoch AI on their own harness.

ModelsModels with a result.68
Top resultBest result on this test.51.7%GPT-5.5
Top-3 spreadPoints from first to third.1.7 pts
YearYear of release.N/A

Result and price

020406080100$0.1$0.3$1$3$10$30$100$300RESULTOUTPUT PRICE PER 1M TOKENS · LOG SCALE

Results

68 results
#ModelResultThe score from the source.
01GPT-5.5xhigh effort51.7% ±2.9
04GPT-5.4xhigh effort47.6% ±2.9
07GPT-5.2xhigh effort40.7% ±2.9
09Muse Spark39.0% ±2.9
11Gemini 3 Pro37.6% ±2.8
12Gemini 3.1 Pro36.9% ±2.8
13Gemini 3 Flash35.6% ±2.8
14GLM-5.133.4% ±2.8
15GPT-5high effort32.4% ±2.8
16Claude Sonnet 4.632.4% ±2.8
17GPT-5.1high effort31.0% ±2.7
20Kimi K2.527.9% ±2.6
22Qwen3.6 Plus26.2% ±2.6
26DeepSeek V3.222.1% ±4.1
27Kimi K2 Thinking21.4% ±2.4
29Claude Opus 4.520.7% ±2.4
30Grok 419.7% ±2.3
31o3high effort18.7% ±2.3
32GLM-516.4% ±2.2
33Claude Sonnet 4.513.5% ±2.0
34o3-minihigh effort12.4% ±1.9
36Qwen3.6 Flash10.3% ±1.8
37o1high effort9.3% ±1.7
40Claude Opus 4.16.6% ±1.5
43GPT-4.15.5% ±1.3
44Claude Haiku 4.55.0% ±1.4
45Gemini 2.5 Flash4.8% ±1.3
46GPT-4.1 mini4.5% ±1.2
47Claude Opus 44.3% ±1.2
48Claude Sonnet 44.1% ±1.2
49GLM-4.63.8% ±1.1
50Grok 3 [Beta]3.8% ±1.1
51Claude 3.7 Sonnet3.3% ±1.0
52GLM-4.72.4% ±0.9
54DeepSeek V31.7% ±0.8
54Gemini 2.0 Flash1.7% ±0.8
54Qwen Plus 07281.7% ±0.8
57O1 Minihigh effort1.4% ±0.7
58Claude 3.5 Sonnet1.0% ±0.6
58GPT-4.1 nano1.0% ±0.6
58Qwen2.5 Max1.0% ±0.6
61Llama 4 Maverick0.7% ±0.5
61Grok 20.7% ±0.5
63Mistral Medium 30.3% ±0.3
64GPT-4o0.3% ±0.3
64Mistral Large 20.3% ±0.3
64Claude 3.5 Haiku0.3% ±0.3