Inference
Explore
Leaderboard
Benchmarks
Labs
Methodology
Search
⌘K
6 Oct 2026
Benchmarks
/
jevBench14
jevBench14
In index
Reasoning
Models
?
Models with a result.
89
Top result
?
Best result on this test.
70.8
%
classifier.dev (fast)
Top-3 spread
?
Points from first to third.
5.0
pts
Year
?
Year of release.
N/A
Result and price
0
20
40
60
80
100
$0.3
$1
$3
RESULT
PARETO
OUTPUT PRICE PER 1M TOKENS · LOG SCALE
Results
89 results
#
Model
Result
?
The score from the source.
01
CL
classifier.dev (fast)
70.8
%
02
MO
Imajev-4B
67.4
%
03
CR
Plumb-4B
65.8
%
04
MA
decider-4b v2
64.1
%
05
TA
Jev 1.13.0
63.3
%
06
AL
JevK5 v0.2.0
62.0
%
07
BL
Cygnet
61.8
%
08
HO
Hopper
59.4
%
09
ER
Winnow-12B Q8
55.6
%
10
KS
reflex 4B
54.0
%
11
MA
djev
52.2
%
12
AK
Jev-Omni
51.3
%
13
W(
metask-jev-4b
47.8
%
14
TL
SemIf Qwen3.5-4B
47.7
%
15
MA
Jobe Qwen3.5-4B
46.9
%
16
AC
local-jev Qwen3.5-4B
46.8
%
17
MI
system-one-open
45.1
%
18
AR
spark-s1-4b-v6
44.6
%
19
N(
Malkuth-4B
44.5
%
20
OC
jqv Qwen3-32B
44.4
%
21
MA
decider-35b-a3b
41.2
%
22
Raw Qwen3 4B Instruct 2507 direct logits
41.0
%
23
SA
OpenSourceJev Qwen3.5-4B Q4_K_M
40.9
%
24
ZE
ZeroEntropy zerank-2
40.2
%
25
MI
decision-machine-1
39.9
%
26
N(
Malkuth-2B
38.9
%
27
Raw Phi-4 mini direct logits
38.0
%
28
WI
JEV Qwen3.5-9B Base NVFP4
37.7
%
29
R/
OpenJev DiffusionGemma 26B-A4B NVFP4
36.9
%
30
JP
kev 4B
36.1
%
31
FL
Decision 2B v59
35.8
%
32
JS
Qwen3.5-9B Jev-like data-mix v2
35.2
%
33
GPT-6 Luna (low)
35.1
%
34
FA
SimpleJev Qwen3.8-27B
34.6
%
35
IL
NInfer Qwen3.8-Flash-Next mixed
34.0
%
36
BL
swanOne
33.6
%
37
GPT-6 Luna (medium)
33.3
%
38
IK
open-alternative-jev Qwen3.5-4B
33.2
%
39
U(
jev-local Qwen3.5-9B
32.5
%
39
FL
Decision Fast v53a
32.5
%
41
MA
decider-2b
30.7
%
42
LM
jeff
30.6
%
43
CI
Laya
30.3
%
44
AU
Autoloops Gemma 4 31B IT
30.0
%
45
ST
Standard One 8B
29.1
%
46
FV
lev-350m
28.5
%
47
EK
openjev-sglang Qwen3.6-35B-A3B
27.7
%
48
W(
Von 395M
27.5
%
49
IL
NInfer Qwen3.8-27B NVFP4 (T=1.5)
26.9
%
50
IL
NInfer Qwen3.8-27B NVFP4
26.3
%
51
JP
kev 8B
25.6
%
52
JU
JevOne
25.5
%
53
MG
typecastlm
25.3
%
54
FA
SimpleJev Qwen3.6-35B-A3B
24.9
%
55
JP
kev 0.6B
24.8
%
56
Raw Qwen3 8B direct logits
23.7
%
57
SG
system-one Qwen3-8B
23.4
%
58
DW
OpenDecision ModernBERT-large
21.6
%
59
ZY
LitJev Qwen3.8-27B
19.5
%
60
H(
openJev Verdict 1.4
19.0
%
61
JP
kev 0.5B
18.9
%
62
BL
Bespoke Nimble 9B
18.7
%
63
GPT-5.6 Luna (low)
18.5
%
64
H(
openJev Verdict
18.1
%
64
Raw Qwen3 1.7B direct logits
18.1
%
66
KS
reflex-27b
17.8
%
67
EI
JevAct
16.9
%
68
MA
djev (thinking)
15.2
%
69
FA
GLiNER2 large
15.1
%
70
RA
OpenJev (thinking, BF16)
14.8
%
71
MG
Qwen3.5-0.8B Decision Model
14.5
%
72
Gemini 3.1 Flash-Lite
14.3
%
73
KL
open-jev-deberta-v3-large
12.6
%
74
A(
smalljev semantic-v9
12.3
%
75
FA
GLiNER2.5 base
11.8
%
76
ZO
Instinct Qwen3.8-27B
11.4
%
77
ZC
Open-Jev 9B
11.2
%
78
ZC
Open-Jev 2B
10.0
%
79
FA
GLiNER2.5 multi
9.8
%
80
CO
CLM-8B
8.6
%
81
FA
SimpleJev Qwen3.5-0.8B
7.5
%
82
FA
GLiNER2.5 small
7.2
%
83
Raw Qwen3 0.6B direct logits
7.1
%
84
M(
verdict-small
5.7
%
85
DeepSeek V4.1 Flash
4.8
%
86
BL
Mirror
2.1
%
87
AL
Certo v1
0.0
%
87
JO
Open Jev JSON Canvas
0.0
%
87
Qwen3.8-27B (Chutes TEE)
0.0
%