DataLearner 标志

Llama3.1-70B-Instruct 评测详情

Llama3.1-70B-Instruct 当前已收录的代表性评测结果包括 MBPP(5 / 70,得分 86)、HumanEval(24 / 101,得分 80.50)、MMLU(35 / 124,得分 86)。

评测结果

Llama3.1-70B-Instruct

评测结果

思考模式
工具使用

综合评估

共 2 项评测
评测名称 / 模式
得分
排名/总数
MMLU
常规模式
86
35 / 124
MMLU Pro
常规模式
66.40
104 / 133

编程与软件工程

共 4 项评测
评测名称 / 模式
得分
排名/总数
MBPP
常规模式
86
5 / 70
HumanEval
常规模式
80.50
24 / 101
LiveCodeBench
常规模式
33.30
115 / 126
WeirdML v2
常规模式工具
8.97
52 / 52

数学推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
MATH
常规模式
67.80
26 / 42

科学与综合推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
48
201 / 224

Agent能力评测

共 1 项评测
评测名称 / 模式
得分
排名/总数
BALROG
常规模式工具
27.90
11 / 12