FrontierMath-2025-02-28-Public

Evaluated by Epoch AI on their own harness.

ModelsModels with a result.63
Top resultBest result on this test.100.0%Claude Fable 5
Top-3 spreadPoints from first to third.10.0 pts
YearYear of release.N/A

Result and price

020406080100$0.1$0.3$1$3$10$30$100$300RESULTOUTPUT PRICE PER 1M TOKENS · LOG SCALE

Results

63 results
#ModelResultThe score from the source.
04Gemini 3.1 Pro88.9% ±11.1
05GPT-5.4high effort80.0% ±13.3
05Gemini 3 Pro80.0% ±13.3
05GLM-5.180.0% ±13.3
05Claude Sonnet 4.680.0% ±13.3
10GPT-5.2medium effort60.0% ±16.3
10GPT-5high effort60.0% ±16.3
10Gemini 3 Flash60.0% ±16.3
10GPT-5 Prohigh effort60.0% ±16.3
15Qwen3.6 Plus50.0% ±16.7
19o3-minihigh effort40.0% ±16.3
21Claude Opus 4.530.0% ±16.3
21GPT-5 minihigh effort30.0% ±15.3
21Kimi K2 Thinking30.0% ±16.3
25GPT-5 nanohigh effort20.0% ±13.3
25Qwen3.6 Flash20.0% ±13.3
28o3low effort10.0% ±10.0
28GPT-4.1 mini10.0% ±10.0
31GLM-52.1% ±2.1
32GLM-4.50.0%
32GLM-4.60.0%
32GPT-4.10.0%
32GPT-4o0.0%
32Mistral Large 20.0% ±10.0
32Grok 20.0%