Artificial Analysis Long Context Reasoning

An Artificial Analysis long-context reasoning evaluation.

  • In index
  • Reasoning
ModelsModels with a result.177
Top resultBest result on this test.88.7%Kimi K3
Top-3 spreadPoints from first to third.2.4 pts
YearYear of release.N/A

Result and price

020406080100$0.03$0.1$0.3$1$3$10$30$100RESULTOUTPUT PRICE PER 1M TOKENS ยท LOG SCALE

Results

177 results
#ModelResultThe score from the source.
01Kimi K388.7%
06GPT-5.584.3%
09GPT-6 Sol83.7%
11GPT-6 Luna83.3%
14MiniMax M383.0%
17GPT-5.282.7%
20GPT-5.482.0%
29Grok 4.680.3%
32GPT-5.180.0%
34GLM-5.379.7%
38Grok 4.579.3%
43Hy379.0%
47GLM-5.278.3%
52Muse Spark78.0%
59Inkling77.3%
64Grok 4.776.7%
72GLM-575.7%
76o374.7%
78GLM-5.173.7%
87GLM-4.771.0%
97GPT-4.168.3%
100Grok 468.0%
105A.X K266.0%
108o165.0%
109Grok 4.364.3%
109Qwen3.5 397B64.3%
112Gemma 4 12B63.7%
114K-Exaone61.3%
119DeepSeek-R155.7%
121Kimi K253.0%
123Command A+52.7%
124GPT-OSS 120B52.0%
125Qwen3 Max50.0%
129GPT-4o49.3%
133GLM-4.5-Air46.7%
136GPT-4.1 mini44.0%
139Celeris-138.0%
146GPT-OSS 20B34.7%
148Gemma 4 E4B32.0%
152DeepSeek V329.3%
155GLM-4.626.3%
158Nova Pro21.0%
159GPT-4.1 nano20.3%
160Gemma 4 E2B16.3%
166Phi-40.0%