DataLearner 标志
返回总榜单

大模型数学推理能力评测排行榜

本页面提供最新、最全面的大模型数学推理能力评测排行榜。我们通过 AIME 2025、FrontierMath Tier 4 v2、MATH-500、GSM8K 等权威数学基准数据集,对包括 OpenAI 的 GPT、Anthropic 的 Claude、阿里巴巴的 Qwen、DeepSeek 等模型进行评测。

数据更新于 2026-09-25 13:11:44

截至 2026年9月,本页覆盖 AIME2025, FrontierMath Tier 4 v2, MATH-500, GSM8K 等评测基准,聚焦 大模型数学推理能力评测排行榜 方向的模型对比。

点击模型名称可进入详情页查看上下文长度、许可方式与 API 价格。数据口径说明见 数据方法论。

榜单亮点

按 GSM8K 排序

大模型性能评测结果

数据来源:DataLearnerAI

点击任意行查看模型详情;勾选左侧 可对比最多 4 个模型。

AIME202595.00
FrontierMath Tier 4 v2—
MATH-50098.80
GSM8K96.66
免费商用
AIME2025—
FrontierMath Tier 4 v2—
MATH-500—
GSM8K95.90
免费商用
AIME2025—
FrontierMath Tier 4 v2—
MATH-500—
GSM8K95.90
免费商用
AIME2025—
FrontierMath Tier 4 v2—
MATH-500—
GSM8K74.00
免费商用
AIME2025—
FrontierMath Tier 4 v2—
MATH-500—
GSM8K71.20
收费商用授权
AIME2025—
FrontierMath Tier 4 v2—
MATH-500—
GSM8K58.40
免费商用
AIME2025—
FrontierMath Tier 4 v2—
MATH-500—
GSM8K56.80
闭源
AIME2025—
FrontierMath Tier 4 v2—
MATH-500—
GSM8K42.20
免费商用
AIME2025—
FrontierMath Tier 4 v2—
MATH-500—
GSM8K35.60
不可商用
AIME202598.70
FrontierMath Tier 4 v2—
MATH-500—
GSM8K—
免费商用
AIME202592.30
FrontierMath Tier 4 v2—
MATH-500—
GSM8K—
免费商用
AIME202591.60
FrontierMath Tier 4 v2—
MATH-500—
GSM8K—
免费商用
AIME202562.76
FrontierMath Tier 4 v2—
MATH-500—
GSM8K—
免费商用
AIME202561.30
FrontierMath Tier 4 v2—
MATH-500—
GSM8K—
免费商用
AIME202520.20
FrontierMath Tier 4 v2—
MATH-50097.20
GSM8K—
免费商用
AIME2025—
FrontierMath Tier 4 v2—
MATH-50090.60
GSM8K—
免费商用
AIME2025—
FrontierMath Tier 4 v2—
MATH-50091.00
GSM8K—
免费商用
排序: