DataLearnerAI
切换导航菜单
搜索博客
最新AI资讯
大模型排行榜
大模型评测基准
大模型列表
大模型对比
资源中心
工具
语言
中文
中
中文
EN
English
搜索博客
中
EN
大模型列表
Gemini 3 Pro
评测分析
Gemini 3 Pro 评测详情
Gemini 3 Pro 当前已收录的代表性评测结果包括 VPCT(1 / 24,得分 91)、BALROG(1 / 12,得分 58.10)、MedCode(10 / 64,得分 52.20)。
评测结果
Gemini 3 Pro
评测结果
思考模式
全部
常规
思考
工具使用
全部
使用工具
不使用工具
写作与创意表达
共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1524.50
52 / 110
客服与业务流程
共 3 项评测
评测名称 / 模式
得分
排名/总数
τ²-Bench - Telecom
思考水平·高
工具
91.01
16 / 30
SAGE
思考水平·高
工具
47.62
24 / 64
τ³-Banking
思考水平·高
工具
18.04
97 / 167
数学
共 1 项评测
评测名称 / 模式
得分
排名/总数
IMO-ProofBench Advanced
开启思考
30
7 / 24
自主开发与终端任务
共 1 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 2.1
思考水平·高
工具
73.93
37 / 57
维护、优化与工程管理
共 1 项评测
评测名称 / 模式
得分
排名/总数
GSO
常规模式
工具
18.60
11 / 21
机器学习工程
共 1 项评测
评测名称 / 模式
得分
排名/总数
WeirdML v2
常规模式
工具
69.93
19 / 52
图像感知与视觉推理
共 2 项评测
评测名称 / 模式
得分
排名/总数
VPCT
常规模式
91
1 / 24
GeoBench ACW
常规模式
84
4 / 20
综合偏好评测
共 1 项评测
评测名称 / 模式
得分
排名/总数
Text Arena (Coding)
常规模式
1471
22 / 35
逻辑与规划
共 1 项评测
评测名称 / 模式
得分
排名/总数
BALROG
常规模式
工具
58.10
1 / 12
能力边界度量
共 1 项评测
评测名称 / 模式
得分
排名/总数
METR Time Horizons v1.1
常规模式
工具
224.33
8 / 22
事实可靠性与幻觉
共 1 项评测
评测名称 / 模式
得分
排名/总数
AA-Omniscience
unknown
15.30
1 / 3
程序生成与编辑
共 1 项评测
评测名称 / 模式
得分
排名/总数
Vibe Code Bench v1.1
思考水平·高
工具
14.30
52 / 61
临床工作与医疗决策
共 2 项评测
评测名称 / 模式
得分
排名/总数
MedScribe
思考水平·高
工具
72.04
58 / 66
MedCode
思考水平·高
工具
52.20
10 / 64
跨能力聚合指数
共 1 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
152.96
36 / 167
与其他模型对比