ARC-AGI-2 (semi-private)

Abstract reasoning puzzles held out from training data.

ModelsModels with a result.113
Top resultBest result on this test.95.0%GPT-6 Astra
Top-3 spreadPoints from first to third.4.6 pts
YearYear of release.N/A

Result and cost

020406080100$0.003$0.01$0.03$0.1$0.3$1$3$10$30$100RESULTUS DOLLARS PER TASK · LOG SCALE

Results

113 results
#ModelResultThe score from the source.CostUS dollars to run one task.
16GPT-5.2 (Refine.)72.9%$38.99
36Inkling36.5%$0.642
38Gemini 3 Pro31.1%$0.811
39Grok 4 (Refine.)29.4%$30.4
41GLM-5.222.8%$0.25
43GPT-5 Pro18.3%$7.14
45Grok 4 (Thinking)16.0%$2.17
48Kimi K2.511.8%$0.28
50GPT-5high effort9.9%$0.73
55o3high effort6.5%$0.834
63GLM-54.9%$0.27
63MiniMax M2.54.9%$0.17
69DeepSeek V3.24.0%$0.12
73o3-minihigh effort3.0%$0.547
85DeepSeek-R11.3%$0.08
85Gemini 2.0 Flash1.3%<$0.01
87Claude Opus 41.3%$0.639
87Claude Sonnet 41.3%$0.127
90Claude Haiku 4.51.3%$0.043
95O1 Mini0.8%$0.191
96Gemini 1.5 Pro0.8%$0.04
96GPT-4.50.8%$2.1
99GPT-4.10.4%$0.069
102Grok 3 [Beta]0.0%$0.142
102Magistral Medium0.0%$0.108
102Magistral Small0.0%$0.049
102GPT-4.1 mini0.0%$0.014
102Llama 4 Maverick0.0%$0.012
102GPT-4o0.0%$0.08
102Llama 4 Scout0.0%<$0.01
102GPT-4.1 nano0.0%<$0.01
102GPT-4o mini0.0%$0.01