DataLearner 标志

Qwen3-VL-235B-A22B-Instruct 评测详情

Qwen3-VL-235B-A22B-Instruct 当前已收录的代表性评测结果包括 MMMU(20 / 74,得分 78.70)、LiveCodeBench(132 / 251,得分 59.40)、AIME2025(118 / 215,得分 70.70)。

评测结果

Qwen3-VL-235B-A22B-Instruct

评测结果

思考模式
工具使用

综合知识考试

共 1 项评测
评测名称 / 模式
得分
排名/总数
HLE
常规模式
6.60
456 / 568

科学知识与推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
71.20
312 / 461

算法与竞赛编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
LiveCodeBench
常规模式
59.40
132 / 251

数学

共 2 项评测
评测名称 / 模式
得分
排名/总数
AIME2025
常规模式
70.70
118 / 215
IMO-ProofBench
常规模式
5.20
14 / 16

图像感知与视觉推理

共 3 项评测
评测名称 / 模式
得分
排名/总数
MMMU
unknown
78.70
20 / 74
MMMU-Pro
常规模式
67.60
146 / 229
MMMU-Pro
unknown
68.10
144 / 229

客服与业务流程

共 1 项评测
评测名称 / 模式
得分
排名/总数
τ²-Bench - Telecom
常规模式工具
35.10
196 / 264

指令与格式遵循

共 1 项评测
评测名称 / 模式
得分
排名/总数
IF Bench
常规模式
42.70
199 / 282

自主开发与终端任务

共 1 项评测
评测名称 / 模式
得分
排名/总数
Terminal Bench Hard
常规模式工具
6.80
194 / 244
Qwen3-VL-235B-A22B-Instruct 评测结果与排名详情 | DataLearnerAI