DataLearner logo

Phi-4-mini-instruct (3.8B) Benchmark Details

Phi-4-mini-instruct (3.8B) currently shows benchmark results led by GSM8K (16 / 70, score 88.60), HumanEval (47 / 140, score 74.40), MBPP (45 / 96, score 65.30).

Benchmark Results

Phi-4-mini-instruct (3.8B)

Benchmark Results

Thinking
Tool usage

General Knowledge

3 evaluations
Benchmark / mode
Score
Rank/total
MMLU
Standard Mode
67.30
80 / 124
MMLU Pro
Standard Mode
52.80
134 / 176
HLE
Standard Mode
4.50
500 / 563

Math and Reasoning

5 evaluations
Benchmark / mode
Score
Rank/total
GSM8K
Standard Mode
88.60
16 / 70
MATH-500
Standard Mode
71.80
45 / 45
MATH
Standard Mode
64
27 / 42
AIME 2024
Standard Mode
10
60 / 62
AIME2025
Standard Mode
6.70
211 / 215

Coding and Software Engineer

3 evaluations
Benchmark / mode
Score
Rank/total
HumanEval
Standard Mode
74.40
47 / 140
MBPP
Standard Mode
65.30
45 / 96
LiveCodeBench
Standard Mode
12.60
244 / 250

Other

1 evaluations
Benchmark / mode
Score
Rank/total
GPQA Diamond
Standard Mode
36
439 / 462

Agent Level Benchmark

1 evaluations
Benchmark / mode
Score
Rank/total
τ²-Bench - Telecom
Standard ModeTools
8.20
264 / 264

Instruction Following

1 evaluations
Benchmark / mode
Score
Rank/total
IF Bench
Standard Mode
21.10
278 / 282

AI Agent - Tool Usage

1 evaluations
Benchmark / mode
Score
Rank/total
Terminal-Bench 2.1
Standard ModeTools
0.40
191 / 192
Phi-4-mini-instruct (3.8B) Benchmark Results & Rankings | DataLearnerAI