DataLearner 标志

GPT-4o 评测详情

GPT-4o 当前已收录的代表性评测结果包括 HumanEval(8 / 101,得分 90)、MMLU(16 / 124,得分 88.70)、BBH(5 / 21,得分 91.70)。

评测结果

GPT-4o

评测结果

思考模式
工具使用

综合评估

共 4 项评测
评测名称 / 模式
得分
排名/总数
BBH
常规模式
91.70
5 / 21
MMLU
常规模式
88.70
16 / 124
MMLU Pro
常规模式
77.90
76 / 133
HLE
常规模式
5.30
173 / 181

编程与软件工程

共 4 项评测
评测名称 / 模式
得分
排名/总数
HumanEval
常规模式
90
8 / 101
LiveCodeBench
常规模式
35.10
111 / 126
SWE-bench Verified
常规模式
31
109 / 114
23.30
6 / 8

数学推理

共 5 项评测
评测名称 / 模式
得分
排名/总数
MATH
常规模式
75.90
16 / 42
MATH-500
常规模式
75.90
43 / 44
AIME2025
常规模式工具
42.10
93 / 106
AIME 2024
常规模式
9.30
61 / 62
FrontierMath
常规模式
0.30
57 / 60

科学与综合推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
70.10
156 / 224

常识问答

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleQA
常规模式
38.20
22 / 47

Agent能力评测

共 1 项评测
评测名称 / 模式
得分
排名/总数
Aider-Polyglot
常规模式
23.10
47 / 59

OpenClaw智能体能力综合测评

共 1 项评测
评测名称 / 模式
得分
排名/总数
Pinch Bench
思考模式工具
71.10
31 / 38