FrontierMath-Tier-4-2025-07-01-Private

Evaluated by Epoch AI on their own harness.

ModelsModels with a result.54
Top resultBest result on this test.47.9%AI Co-Mathematician
Top-3 spreadPoints from first to third.10.4 pts
YearYear of release.N/A

Result and price

020406080100$0.3$1$3$10$30$100$300RESULTOUTPUT PRICE PER 1M TOKENS · LOG SCALE

Results

54 results
#ModelResultThe score from the source.
03GPT-5.4 Pro37.5% ±7.0
04GPT-5.5xhigh effort35.4% ±6.9
05GPT-5.2 Pro31.3% ±6.7
07GPT-5.4xhigh effort27.1% ±6.4
10GPT-5.2xhigh effort18.8% ±5.6
11Gemini 3 Pro18.8% ±5.7
12Gemini 3.1 Pro16.7% ±5.4
13Muse Spark14.6% ±5.1
16GLM-5.112.5% ±4.8
16GPT-5.1high effort12.5% ±4.8
16GPT-5high effort12.5% ±4.8
20Qwen3.6 Plus8.3% ±4.0
21Claude Sonnet 4.68.3% ±4.0
25Kimi K2.54.2% ±2.9
26Gemini 3 Flash4.2% ±2.9
26Claude Opus 4.54.2% ±2.9
26Claude Opus 4.14.2% ±2.9
26o3-minihigh effort4.2% ±2.9
26Gemini 2.5 Flash4.2% ±2.9
32Claude Sonnet 4.53.1% ±2.9
34GLM-4.62.1% ±2.1
35GLM-52.1% ±2.1
35DeepSeek V3.22.1% ±2.1
37o3high effort2.1% ±2.1
37Grok 42.1% ±2.1
37Claude Haiku 4.52.1% ±2.1
42Grok 4 Heavy2.1% ±2.1
44GLM-4.70.0%
44GPT-4.10.0%