LegalBench

Evaluating language models on a wide range of open source legal reasoning tasks.

ModelsModels with a result.139
Top resultBest result on this test.88.6%Claude Fable 5
Top-3 spreadPoints from first to third.1.2 pts
UpdatedDate the source changed the results.21 Sept 2026

Result and cost

020406080100$0.00003$0.0001$0.0003$0.001$0.003$0.01$0.03$0.1RESULTUS DOLLARS PER TASK · LOG SCALE

Results

140 results
#ModelResultThe score from the source.CostUS dollars to run one task.TimeTime to run one task.
01Claude Fable 588.6%$0.0319.0 s
02Claude Fable 5.188.5%$0.05212 s
03Gemini 3.1 Pro Preview87.4%<$0.0110 s
04Gemini 3.7 Flash87.3%<$0.012.2 s
05Gemini 3 Pro87.0%$0.018.3 s
06Gemini 3.8 Flash87.0%<$0.013.3 s
07Claude Opus 587.0%$0.0124.4 s
08GPT-5.6 Sol87.0%$0.0136.2 s
09Gemini 3 Flash Preview86.9%<$0.014.7 s
10Gemini 3.6 Flash86.7%<$0.013.0 s
11GPT-5.586.5%$0.01518 s
12Grok 4.686.3%$0.01527 s
13GPT-5.486.0%$0.02328 s
14GPT-586.0%—19 s
15Grok 4.586.0%<$0.0168 s
16GPT-5.185.7%<$0.017.0 s
17MiniMax M385.4%<$0.018.2 s
18Claude Opus 4.6 (Adaptive)85.3%<$0.013.8 s
19Muse Spark 1.285.3%<$0.0130 s
20Claude Opus 4.785.3%<$0.0127 s
21GPT-5.6 Terra85.1%<$0.012.8 s
22Qwen3.5 Plus Thinking85.1%<$0.0130 s
23Muse Spark 1.185.0%<$0.0117 s
24Qwen3.7 Max84.9%<$0.0112 s
25GLM-5.384.8%<$0.0122 s
26Claude Opus 4.5 Thinking84.6%$0.0377.6 s
27Grok 4.384.5%<$0.016 min
28GLM-5.184.4%<$0.0114 s
29Grok 4.784.4%$0.01126 s
31Qwen3.5 Flash84.3%<$0.0117 s
32Qwen3.6 Plus84.2%<$0.0119 s
33Muse Spark84.2%<$0.0134 s
35GLM-5.284.1%<$0.015.8 s
35Gemini 3.5 Flash-Lite84.1%<$0.011.7 s
37GLM-5 Thinking84.1%<$0.0116 s
38GPT-5.6 Luna84.0%<$0.015.9 s
39MiniMax M2.784.0%<$0.018.9 s
40GLM-5.3-Flash83.9%<$0.0113 s
41Claude Sonnet 583.9%<$0.014.9 s
44o383.8%—6.0 s
45Hy4 preview83.8%$0.0132 min
46Qwen3.8 Max83.6%$0.0136 s
47Gemini 3.5 Flash83.6%<$0.0135 s
48Claude Opus 4.883.6%<$0.013.1 s
49Claude Opus 4.183.5%—2.8 s
50GLM-4.783.4%<$0.0131 s
51DeepSeek V4.1 Flash83.3%<$0.016.5 s
52Grok 483.2%—27 s
54GPT-4.183.1%—0.5 s
55Claude Opus 483.1%—3.7 s
56Mercury 2.583.1%<$0.013.9 s
57Inkling-Small83.0%<$0.0118 s
58Claude Sonnet 483.0%—4.8 s
59Inkling82.9%$0.01323 s
60Claude Opus 4.582.8%$0.0132.4 s
61GPT-5.282.8%$0.01817 s
63Grok 3 [Beta]82.6%—0.7 s
66Grok 4.1 Fast (Reasoning)82.5%<$0.018.6 s
67Qwen3.8-27B82.4%<$0.0148 s
68Claude Sonnet 4.682.1%<$0.0122 s
72Qwen3 Maxqwen3-max81.9%—0.0 s
73GPT-5 mini81.8%—9.4 s
74Kimi K2 Instruct81.5%—1.2 s
75DeepSeek V4 Pro 042381.3%<$0.0120 s
77GPT-4o81.2%—0.5 s
79GPT-4 Turbo80.5%—1.4 s
80o180.4%—8.3 s
82Kimi K2 Thinking80.2%<$0.0144 s
83Qwen3 235B A22B80.2%—12 s
84Claude 3.7 Sonnet80.0%—1.2 s
85MiniMax M2.580.0%<$0.0116 s
86Command A79.7%—0.8 s
87Ling 3.0 Flash79.7%<$0.013.9 s
88GLM-4.679.6%—30 s
90DeepSeek V379.2%—4.4 s
91o4-mini (high)79.2%—4.0 s
92Mistral Large79.1%<$0.011.7 s
93Grok 4.1 Fast Non Reasoning79.1%<$0.011.8 s
95MiMo-V2.578.9%<$0.0111 s
97Gemini 2.0 Flash 00178.4%—0.4 s
98GPT-4.1 mini78.0%—0.5 s
99GPT-5.4 nano77.9%<$0.012.7 s
101Grok 4.20 (Reasoning)77.7%<$0.017.6 s
102DeepSeek V4 Flash 042377.7%<$0.013.9 s
104MiMo-V2.5-Pro77.1%<$0.0127 s
105DeepSeek V3.2 (Thinking)76.1%<$0.0131 s
106GPT-OSS 120B75.9%—7.9 s
107GLM-4.575.6%—16 s
108MiniMax M2.175.4%<$0.0111 s
109Laguna M.175.1%—42 s
110Jamba 1.5 Large74.2%—0.8 s
112Jamba Large 1.672.0%—0.8 s
113o3-mini71.5%—12 s
114Laguna XS.271.0%—12 s
115GPT-OSS 20B70.8%—7.2 s
116Claude 3.5 Haiku70.3%—1.1 s
117Gemini 1.0 Pro 00270.2%—0.5 s
118Jamba Mini 1.669.7%—0.3 s
120Mistral Small69.2%—0.6 s
121Gemini 1.5 Pro 00269.1%—0.9 s
122Command R Plus68.3%—0.4 s
123Gemma 2 9B IT68.1%—0.6 s
124Gemma 2 27B68.0%—0.9 s
125DeepSeek-R167.3%—19 s
126Jamba 1.5 Mini66.6%—0.3 s
127DeepSeek V3.266.0%<$0.012.2 s
128GPT-3.5 Turbo64.4%—0.5 s
129Gemini 1.5 Flash 00263.2%—0.5 s
130Llama 2 70B Hf62.4%—14 s
131Mistral Medium62.0%—0.7 s
132GPT-4.1 nano61.1%—0.4 s
133Mixtral 8x7B V0.155.8%—14 s
134Magistral Medium54.8%—12 s
135Mistral 7B V0.153.8%—1.7 s
136Llama 2 13B53.7%—1.7 s
137Llama 2 7B51.9%—1.0 s
138GPT-5 nano50.1%—22 s
139Magistral Small40.0%—6.7 s
140Command R33.0%—0.2 s