SimpleQA Verified

Evaluated by Epoch AI on their own harness.

ModelsModels with a result.67
Top resultBest result on this test.75.6%GPT-6 Astra
Top-3 spreadPoints from first to third.4.8 pts
YearYear of release.N/A

Result and price

020406080100$0.3$1$3$10$30$100$300RESULTOUTPUT PRICE PER 1M TOKENS · LOG SCALE

Results

67 results
#ModelResultThe score from the source.
11GPT-5.5xhigh effort63.0% ±1.5
14Muse Spark 1.157.8% ±1.6
15Qwen3.7 Max55.8% ±1.6
19GPT-5high effort50.1% ±1.6
20o3high effort49.4% ±1.6
22Qwen3 Max48.7% ±1.6
23Grok 4.5high effort48.3% ±1.6
24GPT-5.1high effort48.0% ±1.6
30Claude Opus 4.545.7% ±1.6
31GPT-5.4xhigh effort45.1% ±1.6
32Qwen3.6 Plus44.1% ±1.6
34o1high effort41.1% ±1.6
35GLM-5.3max effort41.0% ±1.6
39GPT-5.2xhigh effort37.1% ±1.5
40Kimi K2.7 Code36.5% ±1.5
41Kimi K2.534.3% ±1.5
42GLM-5.2max effort34.2% ±1.5
43GLM-5.134.0% ±1.5
47GLM-4.732.2% ±1.5
48GPT-4.131.1% ±1.5
49Grok 4.2030.2% ±1.5
51Claude Sonnet 4.527.2% ±1.5
52GPT-4o26.0% ±1.4
58Qwen3.6 Flash15.9% ±1.2
59o3-minihigh effort15.3% ±1.1
60Claude Haiku 4.512.9% ±1.0
61GPT-4.1 mini12.7% ±1.1
62Claude 3 Opus12.6% ±1.0
65Gemma 4 31B10.4% ±1.0
66GPT-4o mini8.3% ±0.9
67GPT-4.1 nano6.0% ±0.8