MedScribe

Can models support doctors with their administrative work?

ModelsModels with a result.93
Top resultBest result on this test.91.3%Claude Fable 5.1
Top-3 spreadPoints from first to third.1.2 pts
UpdatedDate the source changed the results.21 Sept 2026

Result and cost

020406080100$0.0003$0.001$0.003$0.01$0.03$0.1$0.3$1$3RESULTUS DOLLARS PER TASK ยท LOG SCALE

Results

93 results
#ModelResultThe score from the source.CostUS dollars to run one task.TimeTime to run one task.
01Claude Fable 5.191.3%$0.9643 min
02Claude Opus 591.0%$0.23677 s
03Muse Spark 1.290.1%$0.03861 s
04Grok 4.789.4%$0.0753 min
05GLM-5.3-Flash88.9%<$0.0187 s
06Muse Spark 1.188.9%$0.03563 s
07GLM-5.388.8%$0.0572 min
08Claude Fable 588.5%$0.5832 min
09GPT-5.188.1%$0.09778 s
10GPT-6 Astra87.9%$0.5823 min
11MiniMax M387.3%$0.0142 min
12Grok 4.586.9%$0.03312 min
13GPT-5.586.9%$0.1432 min
14Claude Opus 4.686.7%$0.11554 s
15Grok 4.686.5%$0.03771 s
16Claude Opus 4.6 (Adaptive)86.1%$0.2252 min
17Muse Spark85.9%<$0.013 min
18Claude Opus 4.885.8%$0.25982 s
19DeepSeek V4.1 Flash85.5%$0.01554 s
20Inkling85.4%$0.1664 min
21Claude Opus 4.5 Thinking85.3%$0.4172 s
22GPT-5.6 Sol85.2%$0.2772 min
23Claude Haiku 4.5 Thinking85.2%$0.04266 s
24Qwen3.8 Max84.9%$0.094 min
25Claude Sonnet 4.584.5%$0.05544 s
26Gemini 3.8 Flash84.5%$0.02521 s
27GPT-5.6 Luna84.4%$0.0232 min
28GPT-5.284.4%$0.1152 min
29Inkling-Small84.1%$0.0194 min
31Gemini 3.7 Flash83.9%$0.05917 s
32Qwen3.8-27B83.8%$0.04790 s
33MiMo-V2.5-Pro83.7%<$0.012 min
34GPT-583.7%$0.1023 min
35Hy4 preview83.6%$0.0536 min
36GLM-5.283.5%$0.0452 min
37Claude Opus 4.583.2%$0.28243 s
38Gemini 2.5 Flash Thinking83.0%$0.01523 s
39Claude Opus 4.783.0%$0.17867 s
40GPT-5.6 Terra82.9%$0.06336 s
40Gemini 2.5 Flash82.9%$0.01523 s
42Grok 4 Fast (Reasoning)81.6%<$0.0112 s
43Ling 3.0 Flash80.9%<$0.0112 s
44MiniMax M2.180.8%<$0.0153 s
45GPT-5 mini80.6%$0.0335 min
46DeepSeek V4 Flash 042380.4%$0.01478 s
47MiniMax M2.779.9%<$0.0127 s
48Grok 4 Fast Non Reasoning79.7%<$0.018.5 s
49Gemini 3.6 Flash79.7%$0.07334 s
50Qwen3.7 Max79.4%$0.0692 min
51Grok 4.1 Fast (Reasoning)78.7%<$0.0139 s
53Grok 478.2%$0.06474 s
55DeepSeek V4 Pro 042377.7%$0.0413 min
56GPT-5.477.5%$0.6395 min
58Qwen3 VL Plus77.1%$0.0271 s
59GPT-5.4 nano77.1%<$0.0121 s
60Qwen3.6 Plus77.0%$0.0293 min
61o376.7%$0.0446 s
62Gemini 3.5 Flash76.6%$0.16657 s
63Kimi K2.5 Thinking76.4%$0.0252 min
64Gemini 3.1 Pro Preview76.1%$0.09869 s
65Claude Sonnet 576.1%$0.4344 min
67Grok 4.374.4%$0.0152 min
68Claude Opus 4.1 Thinking73.9%$0.26357 s
69Gemini 2.5 Pro73.6%$0.04636 s
70GPT-5 nano72.9%<$0.012 min
71Gemini 2.5 Flash Lite72.8%<$0.014.8 s
72Qwen3 Max72.7%$0.0856 min
73Claude Sonnet 472.4%$0.03926 s
74GLM-5.172.3%$0.0242 min
75MiMo-V2.572.2%<$0.0120 s
76Gemini 3 Pro72.0%$0.06143 s
77Claude Opus 4.171.8%$0.18738 s
78Gemini 3.5 Flash-Lite70.9%$0.0219 s
79Qwen3.5 Flash70.6%<$0.0180 s
80Gemini 3 Flash Preview69.9%$0.01423 s
81Claude Sonnet 4 Thinking69.4%$0.05340 s
82o4-mini (high)69.1%$0.04182 s
83GLM-4.768.6%$0.0193 min
84Mistral Medium 3.567.7%$0.1582 min
86Laguna M.165.9%<$0.012 min
88Grok 4.20 (Reasoning)63.4%$0.03119 s
89Laguna XS.261.4%<$0.0169 s
90Mercury 2.555.1%<$0.0110.0 s