FrontierMath-Tiers-1-3-v2-Private

Evaluated by Epoch AI on their own harness.

ModelsModels with a result.71
Top resultBest result on this test.93.7%GPT-6 Astra
Top-3 spreadPoints from first to third.4.6 pts
YearYear of release.N/A

Result and price

020406080100$0.1$0.3$1$3$10$30$100$300RESULTOUTPUT PRICE PER 1M TOKENS · LOG SCALE

Results

71 results
#ModelResultThe score from the source.
08GPT-5.5xhigh effort85.3% ±2.1
12GPT-5.4xhigh effort78.6% ±2.4
18GLM-5.3max effort68.8% ±2.7
20GPT-5.2xhigh effort67.4% ±2.8
25Qwen3.7 Max64.6% ±2.8
27Gemini 3.1 Pro59.6% ±2.9
28GLM-5.2max effort59.2% ±3.0
30Grok 4.5high effort57.2% ±2.9
33GPT-5high effort55.4% ±2.9
34Kimi K2.7 Code54.0% ±3.0
35Gemini 3 Flash51.2% ±3.0
40Grok 4.2044.9% ±3.0
44Claude Opus 4.534.4% ±2.8
47o3high effort33.3% ±2.8
52GPT-5.5 Instant26.3% ±2.6
54GLM-5.1none effort24.9% ±2.6
56Claude Sonnet 4.523.9% ±2.5
61Qwen3 Max18.9% ±2.3
62o3-minihigh effort18.6% ±2.3
64o1high effort14.7% ±2.1
65Claude Opus 4.112.6% ±2.0
66GPT-4.1 mini6.7% ±1.5
67GPT-4.16.0% ±1.4
68GPT-4o mini0.7% ±0.5
70GPT-4o0.4% ±0.4