DataLearner 标志

Gemini 3.0 Pro (Preview 11-2025) 评测深度分析

Gemini 3.0 Pro (Preview 11-2025) 当前已收录的代表性评测结果包括 MMLU Pro(2 / 133,得分 90)、LiveCodeBench(2 / 126,得分 92)、GPQA Diamond(10 / 226,得分 93.80)。并附有 1 个数据来源链接供参考。

谷歌发布的Gemini 3.0系列中最强的模型

评测结果

Gemini 3.0 Pro (Preview 11-2025)

评测结果

思考模式
工具使用

综合评估

共 11 项评测
评测名称 / 模式
得分
排名/总数
90
2 / 133
87.50
20 / 68
75
27 / 68
LiveBench
思考水平·低
63.90
54 / 115
LiveBench
思考水平·高
73.39
24 / 115
45.80
42 / 181
41
63 / 181
37.50
72 / 181
37.20
74 / 181
45.10
26 / 62
31.10
32 / 62

科学与综合推理

共 3 项评测
评测名称 / 模式
得分
排名/总数
93.80
10 / 226
91.90
25 / 226
91
31 / 226

常识问答

共 1 项评测
评测名称 / 模式
得分
排名/总数
72.10
6 / 47

编程与软件工程

共 2 项评测
评测名称 / 模式
得分
排名/总数
92
2 / 126
76.20
36 / 114

数学推理

共 5 项评测
评测名称 / 模式
得分
排名/总数
95
25 / 107
90.60
15 / 19
38
10 / 60
18.80
16 / 80

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
思考模式
76.40
5 / 67

Agent能力评测

共 4 项评测
评测名称 / 模式
得分
排名/总数

指令跟随

共 2 项评测
评测名称 / 模式
得分
排名/总数
70
15 / 33
70
15 / 33

AI Agent - 信息收集

共 1 项评测
评测名称 / 模式
得分
排名/总数
59.20
38 / 54

AI Agent - 工具使用

共 3 项评测
评测名称 / 模式
得分
排名/总数
MCP-Atlas
常规模式工具
70.30
25 / 38
56.90
26 / 48
54.20
30 / 48

生产力知识

共 1 项评测
评测名称 / 模式
得分
排名/总数
35
18 / 21

长上下文能力

共 1 项评测
评测名称 / 模式
得分
排名/总数
71
4 / 18

OpenClaw智能体能力综合测评

共 1 项评测
评测名称 / 模式
得分
排名/总数
Pinch Bench
思考模式工具
70.70
32 / 38

数据来源