Inference
Explore
Leaderboard
Benchmarks
Labs
Methodology
Search
⌘K
6 Oct 2026
Benchmarks
/
jevBench15
jevBench15
In index
Reasoning
Models
?
Models with a result.
104
Top result
?
Best result on this test.
74.7
%
classifier.dev (fast)
Top-3 spread
?
Points from first to third.
1.4
pts
Year
?
Year of release.
N/A
Result and price
0
20
40
60
80
100
$0.3
$1
$3
RESULT
PARETO
OUTPUT PRICE PER 1M TOKENS · LOG SCALE
Results
104 results
#
Model
Result
?
The score from the source.
01
CL
classifier.dev (fast)
74.7
%
02
BL
Cygnet
73.7
%
03
ER
Winnow-12B Q8
73.2
%
04
TA
Jev 1.13.0
72.1
%
05
AL
JevK5 v0.3 4B
71.9
%
06
CR
Plumb-4B
71.6
%
07
AK
Jev-Omni
71.5
%
08
MA
decider-4b v2
71.3
%
09
FL
Decision 4B v1.2
70.8
%
10
MO
Imajev-4B (RTX 5090)
70.4
%
10
FL
Decision 4B v1.1
70.4
%
12
OR
Manchego v2.1
68.8
%
13
TL
SemIf Qwen3.5-4B
68.7
%
14
AR
spark-s1-4b-v6
68.2
%
15
W(
metask-jev-4b
67.5
%
15
HO
Hopper
67.5
%
17
N(
Malkuth-4B
66.8
%
18
SU
Surogate Rune 26B-A4B v3 (RTX PRO 6000)
66.5
%
19
KS
reflex 4B
65.2
%
19
U(
jev-local Qwen3.5-9B
65.2
%
21
MA
djev
64.2
%
22
Raw Qwen3 4B Instruct 2507 direct logits
62.1
%
23
OC
jqv Qwen3-32B
60.8
%
24
AL
JevK5 v0.2.0
58.1
%
25
JS
Qwen3.5-9B Jev-like data-mix v2
53.0
%
26
ST
Standard One 8B
47.8
%
27
IL
NInfer Qwen3.8-Flash-Next mixed
47.5
%
28
ZO
Instinct Dual 4B
47.0
%
29
BL
swanOne
46.6
%
30
Raw Qwen3 8B direct logits
45.2
%
31
MA
decider-2b
45.1
%
32
SG
system-one Qwen3-8B
44.1
%
33
MI
system-one-open
42.4
%
34
AU
Autoloops Gemma 4 31B IT
40.5
%
34
GPT-6 Luna (low)
40.5
%
36
GPT-6 Luna (medium)
38.8
%
37
JU
JevOne
38.2
%
38
JP
kev 4B
38.1
%
39
JP
kev 8B
34.2
%
40
IK
open-alternative-jev Qwen3.5-4B
33.6
%
41
BL
Bespoke Nimble 9B
31.8
%
42
N(
Malkuth-2B
29.9
%
43
EK
openjev-sglang Qwen3.6-35B-A3B
29.0
%
44
MA
decider-35b-a3b
27.5
%
45
AC
local-jev Qwen3.5-4B
25.8
%
46
PS
Nemotron Diffusion 8B (optimized vLLM)
25.7
%
47
ZC
Open-Jev 9B
24.4
%
48
FL
Decision 2B v59
22.5
%
49
GPT-5.6 Luna (low)
22.4
%
50
MG
typecastlm
21.8
%
51
WI
JEV Qwen3.5-9B Base NVFP4
20.1
%
52
Gemini 3.1 Flash-Lite
19.6
%
53
DE
AutoJev-27B
19.5
%
53
DE
AutoJev-27B (RTX PRO 6000)
19.5
%
55
IL
NInfer Qwen3.8-27B NVFP4
18.7
%
56
CA
Eikos-27B
18.5
%
56
IL
NInfer Qwen3.8-27B NVFP4 (T=1.5)
18.5
%
58
ZO
Instinct Qwen3.8-27B
18.3
%
59
RA
OpenJev (thinking, BF16)
17.9
%
60
MA
djev (thinking)
17.4
%
61
ZY
LitJev Qwen3.8-27B
16.3
%
62
RS
Bev / Bonsai 27B
15.8
%
63
Raw Phi-4 mini direct logits
15.2
%
64
SA
OpenSourceJev Qwen3.5-4B Q4_K_M
13.2
%
64
KS
reflex-27b
13.2
%
66
ZC
Open-Jev 2B
9.1
%
67
FA
GLiNER2 large
8.4
%
68
DeepSeek V4.1 Flash
6.6
%
69
FA
SimpleJev Qwen3.5-0.8B
4.0
%
70
FA
SimpleJev Qwen3.8-27B
3.4
%
71
MI
decision-machine-1
3.2
%
72
FA
GLiNER2.5 multi
2.7
%
73
CL
Bosun v3.1 0.6B
2.5
%
74
FA
GLiNER2.5 base
2.3
%
75
LI
Deem 0.8B v1
2.1
%
76
EI
JevAct
1.5
%
76
CO
CLM-8B
1.5
%
78
JP
kev 0.6B
1.3
%
79
Raw Qwen3 0.6B direct logits
1.1
%
80
FA
GLiNER2.5 small
0.9
%
80
Raw Qwen3 1.7B direct logits
0.9
%
82
BL
Mirror
0.2
%
83
ZE
ZeroEntropy zerank-2
0.1
%
83
LM
jeff
0.1
%
83
A(
smalljev semantic-v9
0.1
%
86
CI
Laya multilingual
0.0
%
86
DW
OpenDecision ModernBERT-large
0.0
%
86
AL
Certo v1
0.0
%
86
FL
Decision Fast v53a
0.0
%
86
JP
kev 0.5B
0.0
%
86
CI
Laya
0.0
%
86
CI
Laya typed-decisions
0.0
%
86
FV
lev-350m
0.0
%
86
CC
Needle 3 (2-bit)
0.0
%
—
CC
Needle 3 (options as tools)
0.0
%
86
JO
Open Jev JSON Canvas
0.0
%
86
KL
open-jev-deberta-v3-large
0.0
%
86
H(
openJev Verdict
0.0
%
86
H(
openJev Verdict 1.4
0.0
%
86
MG
Qwen3.5-0.8B Decision Model
0.0
%
86
Qwen3.8-27B (Chutes TEE)
0.0
%
86
FA
SimpleJev Qwen3.6-35B-A3B
0.0
%
86
M(
verdict-small
0.0
%
86
W(
Von 395M
0.0
%