DataLearner logo

Llama3.3-70B-Instruct Benchmark Details

Llama3.3-70B-Instruct currently shows benchmark results led by MBPP (3 / 69, score 87.60), HumanEval (14 / 101, score 88.40), MMLU (35 / 124, score 86).

Benchmark Results

Llama3.3-70B-Instruct

Benchmark Results

Thinking

Knowledge Exams

3 evaluations
Benchmark / mode
Score
Rank/total
MMLU
Standard Mode
86
35 / 124
MMLU-Pro
Standard Mode
68.90
105 / 175
MMLU-Pro
unknown
65.92
113 / 175

Code Generation & Editing

2 evaluations
Benchmark / mode
Score
Rank/total
HumanEval
Standard Mode
88.40
14 / 101
MBPP
Standard Mode
87.60
3 / 69

Mathematics

1 evaluations
Benchmark / mode
Score
Rank/total
MATH
Standard Mode
77
13 / 42

Scientific Reasoning

1 evaluations
Benchmark / mode
Score
Rank/total
GPQA Diamond
Standard Mode
50.50
227 / 253

Algorithmic Coding

1 evaluations
Benchmark / mode
Score
Rank/total
LiveCodeBench
Standard Mode
33.30
114 / 125

Commonsense

1 evaluations
Benchmark / mode
Score
Rank/total
SimpleBench
Standard Mode
19.90
91 / 96