CorpFin v2

A private benchmark evaluating understanding of long-context credit agreements

ModelsModels with a result.126
Top resultBest result on this test.73.2%Claude Opus 5
Top-3 spreadPoints from first to third.1.9 pts
UpdatedDate the source changed the results.12 Aug 2026

Result and cost

020406080100$0.001$0.003$0.01$0.03$0.1$0.3$1$3RESULTUS DOLLARS PER TASK · LOG SCALE

Results

127 results
#ModelResultThe score from the source.CostUS dollars to run one task.TimeTime to run one task.
01Claude Opus 573.2%$0.8629 s
02Claude Fable 571.8%$1.7453 s
03Muse Spark 1.171.3%$0.10928 s
04Muse Spark 1.270.9%$0.10830 s
05Inkling-Small69.6%$0.02545 s
06Inkling68.6%$0.08429 s
07Grok 4.368.5%$0.13436 s
08GPT-5.568.4%$0.43223 s
09Kimi K2.5 Thinking68.3%$0.05281 s
10MiniMax M368.1%$0.0524 s
11Grok 4.567.4%$0.2212 min
13Claude Sonnet 567.0%$0.51619 s
14Grok 4 Fast (Reasoning)66.9%$0.0412 s
15Claude Opus 4.866.7%$0.85620 s
16Qwen 3.6 Max (preview)66.5%$0.15647 s
17Gemini 3 Flash Preview66.4%$0.04711 s
18Grok 4.666.2%$0.16624 s
19GLM-5.266.1%$0.12225 s
20Claude Opus 4.766.1%$0.81618 s
21Grok 466.0%$0.19130 s
22Grok 4.1 Fast (Reasoning)66.0%$0.01628 s
23GPT-5.265.9%$0.15426 s
24Qwen3.8 Max65.9%$0.17947 s
25GPT-5.6 Terra65.3%$0.1717.7 s
25Claude Sonnet 4.665.3%$0.30718 s
25Qwen3.5 Plus Thinking65.3%$0.0583 min
28GPT-5.465.3%$0.23582 s
29Muse Spark65.1%$0.01240 s
30Claude Opus 4.5 Thinking65.1%$0.17318 s
31Gemini 3.5 Flash64.7%$0.148.7 s
32Gemini 3.1 Pro Preview64.5%$0.18225 s
33GLM-5.164.5%$0.07968 s
34GPT-5.6 Sol64.4%$0.48516 s
35GPT-5.6 Luna64.2%$0.01917 s
36GPT-5.163.8%$0.09235 s
37Qwen3.7 Max63.7%$0.2220 s
38Gemini 3 Pro63.7%$0.17920 s
38Grok 4.20 (Reasoning)63.7%$0.1639.7 s
40Qwen3.5 Flash63.6%<$0.0135 s
41DeepSeek V4 Pro 042363.4%<$0.0133 s
42Gemini 3.6 Flash63.3%$0.1376.3 s
43GPT-4.163.1%$0.13210 s
44GLM-5 Thinking62.9%$0.06869 s
45Qwen3.6-27B62.3%$0.05463 s
48Qwen3.6 Plus61.9%$0.04736 s
48Ling 3.0 Flash61.9%<$0.0112 s
50DeepSeek V4 Flash 042361.8%$0.01216 s
51MiMo-V2.5-Pro61.4%$0.03719 s
52Claude Opus 4.561.3%$0.159.4 s
53Claude Sonnet 4 Thinking61.2%$0.2373 min
54MiniMax M2.761.2%$0.02311 s
54GPT-5.4 nano61.2%$0.0169.4 s
57GPT-561.1%$0.0863 min
58Mistral Large61.0%$0.02449 s
59GLM-4.561.0%$0.0382 min
60GPT-5.4 mini60.9%$0.07652 s
61Claude Sonnet 4.560.8%$0.23713 s
61Gemini 2.5 Pro60.8%$0.09527 s
63Gemini 3.5 Flash-Lite60.7%$0.0293.8 s
64Claude Haiku 4.5 Thinking60.6%$0.08914 s
65Kimi K2 Thinking60.6%$0.0382 min
67Claude Haiku 4.560.3%$0.0768.0 s
68GPT-5 mini60.2%$0.02174 s
69MiMo-V2.559.9%$0.01218 s
70Gemini 2.5 Pro Exp 03.2559.8%$0.08616 s
72o359.7%$0.13319 s
72Grok 3 [Beta]59.7%$0.1724 s
74MiniMax M2.559.6%$0.02417 s
77o4-mini (high)59.0%$0.07418 s
79MiniMax M2.158.9%$0.02222 s
80Mistral Medium 3.558.8%$0.14644 s
81Grok 4 Fast Non Reasoning58.4%$0.049.4 s
82GPT-OSS 120B58.2%<$0.0143 s
83Laguna M.158.2%—4 min
84GPT-4.1 mini57.9%$0.0266.4 s
86GLM-4.656.8%$0.04578 s
87Laguna XS.256.3%—3 min
89Claude Sonnet 454.7%$0.2273 min
90Trinity-Large-Thinking54.7%$0.01912 s
93DeepSeek-R154.1%$0.08747 s
94Claude 3.5 Sonnet53.6%$0.2380.0 s
94DeepSeek V353.6%$0.05237 s
96GPT-OSS 20B53.1%<$0.0134 s
97Qwen3 Maxqwen3-max-preview53.0%$0.0974 min
99DeepSeek V3.151.5%$0.03763 s
100Grok 251.1%$0.11587 s
101DeepSeek V3.2 (Thinking)51.0%$0.0382 min
102Claude 3.5 Haiku50.8%$0.0630.0 s
103Mistral Medium50.7%$0.02430 s
104Kimi K2 Instruct50.4%$0.05941 s
106DeepSeek V3.247.9%$0.0372 min
107Magistral Medium47.4%$0.12555 s
109GLM-4.746.4%$0.03966 s
110Command A46.0%$0.20614 s
111GPT-4o mini45.5%<$0.010.0 s
112o3-mini45.3%$0.07831 s
113Mistral Small44.2%<$0.0111 s
114Magistral Small44.0%$0.0314 s
115Gemini 2.0 Pro Exp 02.0543.4%$0.10519 s
116GPT-4o42.7%—6.5 s
117GPT-4.1 nano42.1%<$0.015.0 s
118Jamba Large 1.641.5%$0.1527 s
119Gemini 1.5 Pro 00240.5%$0.13138 s
120Jamba 1.5 Large39.4%$0.14911 s
122Gemini 1.5 Flash 00238.2%<$0.0128 s
123Jamba Mini 1.638.0%$0.0154.2 s
125Jamba 1.5 Mini33.9%$0.0152.3 s
126Gemini 2.0 Flash 00133.7%$0.0130 s
127Gemini 1.5 Flash 00128.6%<$0.011.2 s