MedCode

Can models support the medical billing process?

ModelsModels with a result.90
Top resultBest result on this test.63.6%Claude Opus 5
Top-3 spreadPoints from first to third.7.5 pts
UpdatedDate the source changed the results.21 Sept 2026

Result and cost

020406080100$0.0003$0.001$0.003$0.01$0.03$0.1$0.3$1$3RESULTUS DOLLARS PER TASK · LOG SCALE

Results

90 results
#ModelResultThe score from the source.CostUS dollars to run one task.TimeTime to run one task.
01Claude Opus 563.6%$0.15725 s
02Gemini 3.1 Pro Preview59.1%$0.02539 s
03Claude Fable 556.1%$0.5912 min
04Gemini 3 Flash Preview55.9%<$0.0144 s
05Gemini 3.5 Flash55.8%$0.07425 s
06Claude Opus 4.754.9%$0.22654 s
07Claude Fable 5.153.5%$1.124 min
08Gemini 3.7 Flash53.4%$0.0389.2 s
09Claude Opus 4.853.2%$0.3512 min
10Gemini 3.6 Flash53.2%$0.04417 s
11GPT-5.152.7%$0.01455 s
12Gemini 3 Pro52.2%$0.02856 s
13Muse Spark51.3%<$0.012 min
14Gemini 2.5 Pro50.6%$0.01527 s
15GPT-5.249.7%$0.0193 min
16GPT-549.6%$0.04658 s
17Grok 4.749.6%$0.1054 min
18Muse Spark 1.249.3%$0.03960 s
19Claude Opus 4.5 Thinking49.2%$0.09661 s
20Claude Opus 4.6 (Adaptive)49.1%$0.2443 min
21GPT-5.549.1%$0.1613 min
22GPT-6 Astra48.5%$0.4512 min
23Claude Opus 4.648.2%<$0.014.1 s
24Gemini 3.8 Flash48.1%$0.01843 s
26Claude Sonnet 547.5%$0.2792 min
27o347.3%$0.0318 s
28Claude Opus 4.1 Thinking47.2%$0.26933 s
29MiniMax M346.3%$0.01263 s
30Claude Opus 4.545.2%<$0.015.0 s
31Grok 4.644.7%$0.052 min
33GPT-5.6 Sol44.0%$0.2812 min
34Gemini 3.5 Flash-Lite43.5%<$0.016.0 s
35GPT-5.6 Terra43.4%$0.04718 s
36Grok 4.543.3%$0.04860 s
37Hy4 preview43.2%$0.0627 min
38GPT-5 mini43.0%<$0.0128 s
39GLM-5.342.9%$0.0823 min
40GPT-5.6 Luna42.4%$0.01681 s
41GLM-5.141.6%$0.02478 s
42DeepSeek V4 Pro 042341.5%$0.0613 min
43DeepSeek V4 Flash 042341.4%$0.022 min
44Claude Opus 4.141.4%$0.20613 s
45GPT-5.441.3%$0.2123 min
46Inkling41.2%$0.1273 min
47DeepSeek V4.1 Flash41.2%$0.01235 s
48GPT-5.4 nano41.0%<$0.018.0 s
49GLM-5.240.8%$0.0452 min
50Qwen3.8 Max40.7%$0.1216 min
51Claude Sonnet 4.540.6%$0.04212 s
53Gemini 2.5 Flash Thinking40.4%<$0.0123 s
55Kimi K2.5 Thinking39.3%$0.01775 s
56Qwen3.7 Max38.8%$0.04229 s
57Gemini 2.5 Flash38.4%<$0.0122 s
58Grok 438.1%$0.03489 s
59Grok 4.338.1%$0.02244 s
60Inkling-Small37.9%$0.0173 min
61Grok 4 Fast (Reasoning)37.4%<$0.0118 s
62Qwen3.6 Plus36.9%$0.01656 s
64Claude Sonnet 4 Thinking35.0%$0.0740 s
65MiniMax M2.734.4%<$0.0130 s
67MiniMax M2.134.1%—20 s
68Claude Sonnet 433.9%$0.0397.3 s
69o4-mini (high)33.8%$0.01821 s
70Mistral Medium 3.533.8%$0.05335 s
71Qwen3.5 Flash33.0%<$0.0163 s
72GLM-4.732.8%<$0.012 min
74MiMo-V2.5-Pro32.5%<$0.0138 s
75Ling 3.0 Flash32.3%<$0.019.6 s
76Grok 4.20 (Reasoning)32.2%$0.03617 s
77MiMo-V2.531.9%<$0.0118 s
78Qwen3 VL Plus31.7%<$0.0110.0 s
79Qwen3 Max31.4%$0.0153 min
80Mercury 2.531.3%<$0.017.9 s
81GPT-5 nano30.4%<$0.0130 s
82Grok 4 Fast Non Reasoning30.0%<$0.0118 s
83Qwen3.8-27B28.7%$0.0589 s
84Grok 4.1 Fast Non Reasoning28.3%<$0.014.5 s
85Grok 4.1 Fast (Reasoning)28.1%<$0.0147 s
86Gemini 2.5 Flash Lite27.1%<$0.015.7 s
89Laguna M.123.1%<$0.0171 s
90Laguna XS.221.3%<$0.0133 s