大模型评测基准与性能对比

快速查看大模型在各项评测基准上的表现,包括MMLU Pro、HLE、SWE-Bench等多个标准数据集,帮助开发者和用户了解不同大模型在通用知识、编程能力、推理能力等方面的表现。

用户可以选择自定义模型与评测基准进行对比,快速获取不同模型在实际应用中的优劣势。

各个评测基准的详细介绍可见: LLM 评测基准列表与介绍

大模型性能评测结果

数据来源:DataLearnerAI

筛选条件

大模型排名数据表格

排名
模型
MMLU Pro
GPQA Diamond
SWE-bench Verified
MATH-500
AIME 2024
LiveCodeBench
参数(亿)
开源情况
1 MistralAI Logo 未公布 未公布 未公布 未公布 未公布 31.50 220 不可以商用
2 MistralAI Logo 未公布 未公布 未公布 未公布 未公布 37.90 未知 不开源
3 xAI Logo 未公布 未公布 72.00 未公布 未公布 未公布 未知 不开源
4 MistralAI Logo 未公布 未公布 61.60 未公布 未公布 未公布 未知 不开源
5 MistralAI Logo 未公布 未公布 53.60 未公布 未公布 未公布 240 免费商用授权
6 MistralAI Logo 未公布 未公布 46.80 未公布 未公布 未公布 240 免费商用授权
7 阿里巴巴 Logo 未公布 未公布 67.00 未公布 未公布 未公布 4,800 免费商用授权
8 阿里巴巴 Logo 未公布 未公布 51.60 未公布 未公布 未公布 305 免费商用授权
MMLU Pro (知识问答) 未公布
GPQA Diamond (常识推理) 未公布
SWE-bench Verified (代码生成) 未公布
MATH-500 (数学推理) 未公布
AIME 2024 (数学推理) 未公布
LiveCodeBench (代码生成) 31.50
参数(亿) 220
开源情况 不可以商用
查看模型详情
MMLU Pro (知识问答) 未公布
GPQA Diamond (常识推理) 未公布
SWE-bench Verified (代码生成) 未公布
MATH-500 (数学推理) 未公布
AIME 2024 (数学推理) 未公布
LiveCodeBench (代码生成) 37.90
参数(亿) 未知
开源情况 不开源
查看模型详情
MMLU Pro (知识问答) 未公布
GPQA Diamond (常识推理) 未公布
SWE-bench Verified (代码生成) 72.00
MATH-500 (数学推理) 未公布
AIME 2024 (数学推理) 未公布
LiveCodeBench (代码生成) 未公布
参数(亿) 未知
开源情况 不开源
查看模型详情
MMLU Pro (知识问答) 未公布
GPQA Diamond (常识推理) 未公布
SWE-bench Verified (代码生成) 61.60
MATH-500 (数学推理) 未公布
AIME 2024 (数学推理) 未公布
LiveCodeBench (代码生成) 未公布
参数(亿) 未知
开源情况 不开源
查看模型详情
MMLU Pro (知识问答) 未公布
GPQA Diamond (常识推理) 未公布
SWE-bench Verified (代码生成) 53.60
MATH-500 (数学推理) 未公布
AIME 2024 (数学推理) 未公布
LiveCodeBench (代码生成) 未公布
参数(亿) 240
开源情况 免费商用授权
查看模型详情
MMLU Pro (知识问答) 未公布
GPQA Diamond (常识推理) 未公布
SWE-bench Verified (代码生成) 46.80
MATH-500 (数学推理) 未公布
AIME 2024 (数学推理) 未公布
LiveCodeBench (代码生成) 未公布
参数(亿) 240
开源情况 免费商用授权
查看模型详情
MMLU Pro (知识问答) 未公布
GPQA Diamond (常识推理) 未公布
SWE-bench Verified (代码生成) 67.00
MATH-500 (数学推理) 未公布
AIME 2024 (数学推理) 未公布
LiveCodeBench (代码生成) 未公布
参数(亿) 4,800
开源情况 免费商用授权
查看模型详情
MMLU Pro (知识问答) 未公布
GPQA Diamond (常识推理) 未公布
SWE-bench Verified (代码生成) 51.60
MATH-500 (数学推理) 未公布
AIME 2024 (数学推理) 未公布
LiveCodeBench (代码生成) 未公布
参数(亿) 305
开源情况 免费商用授权
查看模型详情