DataLearner 标志

GPT-6.1 Sol 评测详情

GPT-6.1 Sol 当前已收录的代表性评测结果包括 AA-Briefcase(—,得分 1564.21)、HealthBench Consensus (length-adjusted)(—,得分 96)、MMMU-Pro(—,得分 85.95)。

评测结果

GPT-6.1 Sol

评测结果

思考模式
工具使用

综合知识考试

共 1 项评测
评测名称 / 模式
得分
排名/总数
HLE
最高
52.92
—

跨长文理解与整合

共 1 项评测
评测名称 / 模式
得分
排名/总数
AA-LCR
最高
83
—

仓库修复与多文件工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
DeepSWE
高工具
75.20
—

桌面工作流

共 1 项评测
评测名称 / 模式
得分
排名/总数
OSWorld 2.0
最高工具
71.40
—

办公与文档流程

共 2 项评测
评测名称 / 模式
得分
排名/总数
AA-Briefcase
最高工具
1564.21
—
31.70
—

图像感知与视觉推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
MMMU-Pro
最高
85.95
—

科学知识与推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
CritPt
最高
31.71
—

科学计算与科研编程

共 2 项评测
评测名称 / 模式
得分
排名/总数
58.10
—
SciCode
最高
54.17
—

文档与图表理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDP.pdf
最高
31
—

自主开发与终端任务

共 1 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 4.0
最高工具
56.06
—

医学知识与健康咨询

共 5 项评测
评测名称 / 模式
得分
排名/总数

漏洞利用

共 2 项评测
评测名称 / 模式
得分
排名/总数

漏洞发现与分析

共 1 项评测
评测名称 / 模式
得分
排名/总数
78.80
—

临床工作与医疗决策

共 1 项评测
评测名称 / 模式
得分
排名/总数

跨能力聚合指数

共 1 项评测
评测名称 / 模式
得分
排名/总数
51.83
—

事实可靠性与幻觉

共 1 项评测
评测名称 / 模式
得分
排名/总数
41.53
—