Terminal-Bench 2.0

State-of-the-art set of difficult terminal-based tasks

ModelsModels with a result.65
Top resultBest result on this test.73.2%GPT-5.5
Top-3 spreadPoints from first to third.4.7 pts
UpdatedDate the source changed the results.4 Jun 2026

Result and cost

020406080100$0.01$0.03$0.1$0.3$1$3$10RESULTUS DOLLARS PER TASK · LOG SCALE

Results

65 results
#ModelResultThe score from the source.CostUS dollars to run one task.TimeTime to run one task.
01GPT-5.573.2%$1.8238 min
02Claude Opus 4.870.0%$0.8848 min
03Claude Opus 4.768.5%$0.97611 min
04Gemini 3.5 Flash67.4%$1.197 min
04Gemini 3.1 Pro Preview67.4%$0.5169 min
06GPT-5.3 Codex64.0%$0.3458 min
07Muse Spark59.6%$0.079 min
07Claude Sonnet 4.659.6%$0.51910 min
09Qwen3.7 Max59.2%$0.71911 min
10GPT-5.458.4%$0.51217 min
10Claude Opus 4.6 (Adaptive)58.4%$1.1415 min
10Claude Opus 4.558.4%$1.1810 min
13DeepSeek V4 Pro 042356.2%$0.1814 min
14Gemini 3 Pro55.1%$0.4567 min
15GLM-5.153.9%$0.15815 min
15Claude Opus 4.5 Thinking53.9%$1.1211 min
17GPT-5.251.7%$0.4712 min
17Gemini 3 Flash Preview51.7%$0.1698 min
17Qwen 3.6 Max (preview)51.7%$0.3215 min
20GLM-5 Thinking49.4%$0.24715 min
21MiniMax M2.747.2%$0.07414 min
22MiniMax M346.1%$0.21617 min
23GPT-5.144.9%$0.40815 min
23GPT-5.4 mini44.9%$0.91437 min
23Qwen3.6 Plus44.9%$0.14614 min
23Qwen3.6-27B44.9%$0.29833 min
27Grok 4.343.4%$1.1233 min
28Claude Sonnet 4.5 Thinking41.6%$0.75112 min
28MiniMax M2.541.6%$0.08513 min
28Qwen3.5 Plus Thinking41.6%$0.32231 min
31Grok 4.20 (Reasoning)40.4%$0.1543 min
31Kimi K2.5 Thinking40.4%$0.1413 min
33GPT-5.4 nano39.9%$0.22442 min
34Gemma 4 31B39.3%14 min
35GLM-4.738.2%$0.18413 min
35Claude Haiku 4.5 Thinking38.2%$0.32811 min
37GPT-537.1%$0.47716 min
37MiniMax M2.137.1%$0.0713 min
37Kimi K2 Thinking37.1%$0.11616 min
40DeepSeek V3.2 (Thinking)36.0%$0.16617 min
41DeepSeek V3.234.8%$0.06313 min
42Laguna M.131.5%0 s
43Gemini 2.5 Pro30.3%$0.47213 min
43Mistral Medium 3.530.3%$4.7121 min
45Grok 4 Fast (Reasoning)29.2%$0.0347 min
46Grok 428.1%$0.55315 min
46GLM-4.628.1%$0.14410 min
46Laguna XS.228.1%0 s
49GPT-5 mini27.0%$0.11717 min
50Kimi K2 Instruct25.8%$1.1112 min
51Grok 4.1 Fast (Reasoning)24.7%$0.0568 min
51Qwen3.5 Flash24.7%$0.1112 min
54Qwen3 Max22.5%$0.42315 min
54DeepSeek V3.122.5%$0.50214 min
57GPT-OSS 120B19.1%$0.1328 min
58Trinity-Large-Thinking18.0%$0.32617 min
58Grok 4.1 Fast Non Reasoning18.0%$0.0334 min
60Mistral Small16.9%$0.1067 min
61GPT-4.114.6%$1.0810 min
62Magistral Medium13.5%$0.56715 min
63Mistral Large9.0%$0.0320 min
64Command A2.2%$2.4413 min