Tax Agent Bench

Evaluating agents on research-grade US tax questions using the Tax Agent Bench harness

ModelsModels with a result.21
Top resultBest result on this test.77.6%Claude Fable 5.1
Top-3 spreadPoints from first to third.4.6 pts
UpdatedDate the source changed the results.21 Sept 2026

Result and cost

020406080100$0.01$0.03$0.1$0.3$1$3$10$30RESULTUS DOLLARS PER TASK · LOG SCALE

Results

21 results
#ModelResultThe score from the source.CostUS dollars to run one task.TimeTime to run one task.
01Claude Fable 5.177.6%$13.1829 min
02Claude Opus 575.1%$5.1417 min
03GLM-5.373.1%$1.851 min
04Muse Spark 1.371.9%$0.328 min
05Grok 4.670.8%$0.97811 min
06GPT-5.6 Sol68.0%$7.5145 min
07Gemini 3.8 Flash66.8%$0.8573 min
08Qwen3.8 Max66.0%$1.5541 min
09Grok 4.765.6%$3.5817 min
10GPT-5.6 Terra65.2%$4.8361 min
11Hy4 preview63.7%$0.58541 min
12GPT-6 Astra63.3%$5.815 min
13DeepSeek V4.1 Flash62.5%$0.1356 min
14Claude Sonnet 562.3%$2.6919 min
15GPT-5.6 Luna60.8%$0.46543 min
16GPT-5.560.5%$4.0716 min
17DeepSeek V4 Pro 042358.7%$0.72927 min
18Gemini 3.7 Flash57.7%$0.48487 s
19MiniMax M349.7%$0.1645 min
20Inkling43.5%$0.35414 min
21Mercury 2.512.8%$0.02430 s