Chess Puzzles

Evaluated by Epoch AI on their own harness.

ModelsModels with a result.122
Top resultBest result on this test.72.0%GPT-6 Astra
Top-3 spreadPoints from first to third.11.0 pts
YearYear of release.N/A

Result and price

020406080100$0.1$0.3$1$3$10$30$100$300RESULTOUTPUT PRICE PER 1M TOKENS · LOG SCALE

Results

122 results
#ModelResultThe score from the source.
06GPT-5.5xhigh effort54.0% ±5.0
09GPT-5.2xhigh effort49.0% ±5.0
13GPT-5.4xhigh effort44.0% ±5.0
21GPT-5high effort37.0% ±4.9
22Grok 4.5high effort36.0% ±4.8
23o3high effort34.0% ±4.8
25GPT-5.1high effort32.0% ±4.7
26Gemini 3 Pro31.0% ±4.6
31Grok 428.0% ±4.5
35Grok 4.2024.0% ±4.3
39GLM-5.3max effort21.0% ±4.1
39GLM-5.2max effort21.0% ±4.1
39Kimi K2.7 Code21.0% ±4.1
44Kimi K2 Thinking20.0% ±4.0
44Qwen3.6 Flash20.0% ±4.0
51Qwen3.7 Max19.0% ±3.9
51GLM-5.119.0% ±3.9
54Qwen3.6 Plus17.0% ±3.8
54o3-minihigh effort17.0% ±3.8
57o1high effort15.0% ±3.6
60GPT-4o13.0% ±3.4
62Kimi K2.512.0% ±3.3
62GPT-5.5 Instant12.0% ±3.3
66GLM-510.0% ±3.0
71Claude Opus 4.58.0% ±2.0
71Claude Sonnet 4.58.0% ±2.0
71Claude Haiku 4.58.0% ±2.7
74DeepSeek V3.27.5% ±1.0
75Claude Opus 4.17.0% ±2.6
75GPT-4.1 mini7.0% ±2.6
78GLM-4.76.0% ±1.6
78GPT-4.16.0% ±2.4
82Claude 3 Opus5.0% ±2.2
82QwQ 32B5.0% ±2.2
86Qwen3 Max4.0% ±2.0
86GPT-4 (Jun 2023)4.0% ±2.0
92Phi-41.0% ±1.0
92Mistral Small 3.11.0% ±1.0
92Mistral Small 3.21.0% ±1.0
100Gemma 3 1B0.0%
100Gemma 3 4B0.0%
100Llama 2 7B0.0%
100Llama 3-8B0.0%
100Mistral 7B0.0%
100Qwen2.5 7B0.0%