SimpleBench
查看详情SimpleBench 是一个包含 213 道英文六选一题目的常识推理基准,覆盖时空推理、社会智能和语言对抗性问题。每道题运行 5 次并报告平均正确率;通常使用 temperature=0.7、top-p=0.95,o 系列模型除外。官方由 9 名参与者的小样本测得非专业人类基线 83.7%。
评测基准库
本页面汇总了当前业界主流的大模型评测基准,包括AIME 2025, SWE Bench Verified, MMLU、GSM8K、HumanEval 等。我们致力于为研究者和开发者提供一个全面的参考平台,帮助大家了解不同大模型在各种评测数据集上的性能表现。
全部基准
204
所有类型
14
所有语言
9
大模型在评测基准的详细评测结果:主流大模型评测基准榜单
由编辑挑选,帮助你发现值得关注的评测基准。
SimpleBench 是一个包含 213 道英文六选一题目的常识推理基准,覆盖时空推理、社会智能和语言对抗性问题。每道题运行 5 次并报告平均正确率;通常使用 temperature=0.7、top-p=0.95,o 系列模型除外。官方由 9 名参与者的小样本测得非专业人类基线 83.7%。
ARC-AGI-3 是首个面向智能体的人机可比交互式推理基准。智能体需要在没有自然语言指令的全新环境中探索、即时推断目标、建立并持续更新世界模型,通过长期规划和稀疏反馈完成任务;100% 表示能像人类一样高效通关全部游戏。 注意:ARC-AGI-3 的分数强依赖测试脚手架(harness)。ARC Prize 只把 Standard harness 的结果视为跨厂商可比口径;厂商自建的 Provider Adapter harness 可在多次请求间保留不透明的推理状态,分数会显著更高,录入本站时一律以 Standard harness 为准。
Terminal-Bench 4.0 是 Terminal-Bench 团队持续维护的终端智能体评测版本,于2026年8月28日正式发布,通过 66 个容器化专业计算机任务测量模型与 Agent 脚手架组成的完整系统。4.0 将每次 Agent 运行的超时上限统一调整为 8 小时,修复 19 个任务,并移除 8 个已饱和、容易触发拒答、存在公开解法或仍有质量与平台问题的任务。每个任务运行 5 次,榜单报告任务解决率及 95% 置信区间;因任务集和资源规则已发生破坏性变更,4.0 成绩不应与 3.0 或 2.x 直接对比。
CursorBench 是 Cursor 基于真实 Cursor 会话中的模糊、多文件任务构建的内部编程 Agent 评测。4.0 版新增长周期任务,覆盖编辑、重构、调查、意图理解、作业管理和设计一致性;官方同时提示小幅分数差异可能不具统计意义。任务、Agent harness 和评分口径由 Cursor 维护,因此结果应视为特定模型、思考档位与 Cursor 工具环境组成的系统成绩。
已匹配 17 个基准,建议先看对应榜单,再进入模型对比。
Grade School Math 8K
一个包含 8500 道小学数学题的基准,用于评估模型的数学推理能力。
Mathematics Problem Solving
一个具有挑战性的数学问题数据集,包含代数、微积分、几何、概率等多个领域。
OpenAI从MATH评测数据集中精选的500个更具代表性的数学评测基准
AIME全称是American Invitational Mathematics Examination,即美国数学邀请赛,是美国面向中学生的邀请式竞赛,3个小时完成15道题,难度很高。
2025年美国数学竞赛邀请赛的试题,用于测试大模型的数学推理能力
FrontierMath (Tier 1-3)
FrontierMath 是一个用于评估人工智能高级数学推理能力的基准测试。它由数百个由数学家精心设计的全新且极具挑战性的数学问题组成,旨在真实地衡量当前AI系统的推理极限。
FrontierMath 是一个用于评估人工智能高级数学推理能力的基准测试。FrontierMath - Tier 4是其中研究生级别的难题!
International Mathematics Olympiad-ProofBench
谷歌发布的用于评估大型语言模型生成完整、逻辑严谨的数学证明能力大模型评测基准
International Mathematics Olympiad-ProofBench Advanced
谷歌发布的用于评估大型语言模型生成完整、逻辑严谨的数学证明能力大模型评测基准
International Mathematical Olympiad-AnswerBench
用于测试大模型在高难度(国际奥林匹克数学竞赛)数学问题上的回答能力
American Invitational Mathematics Examination 2026
基于2026年美国数学邀请赛的大模型数学推理能力评测基准
FrontierMath Tiers 1-3 (v2)
FrontierMath v2 的 Tiers 1-3 私有集包含 295 道由专家编写的高难度数学题,覆盖高年级本科到早期研究级别。v2 于 2026-06-12 发布,修正了 Tiers 1-3 中的 123 道题并移除 5 道题。
FrontierMath Tier 4 (v2)
FrontierMath Tier 4 v2 是包含 43 道极高难度研究级数学题的私有扩展集。v2 于 2026-06-12 发布,修正了 Tier 4 中的 12 道题并移除 7 道题。
Harvard-MIT Mathematics Tournament - February 2026
HMMT(哈佛-麻省理工数学竞赛)2 月赛是该赛事中难度更高的一场,题目难度从 AIME 中段一直延伸到国家级与国际奥林匹克水平。2026 年 2 月赛于 2026 年 2 月 14 日在哈佛大学举行,个人赛由代数、几何、组合三个专项测试组成,每项 10 题、限时 50 分钟,合计 30 题。由于题目在竞赛结束后才公开、不易被训练数据污染,HMMT Feb 已成为各家模型卡评估数学推理能力的常用基准,通常按 30 题的答题正确率计分。
MathArena Apex 是 MathArena 的高难度数学评测榜单。DeepSeek 在 2026-09-10 的 V4.1 Flash 官方发布表中报告该项目成绩;该表未提供题量、独立论文或更细的测试协议。
Vals ProofBench v1.1
ProofBench 考察模型能否把数学推理写成可被 Lean 4 形式化验证的证明:能编译通过即算对,没有部分分。公开与私有两个 split 各 100 题,共 200 题,题目由 Lean 4 专家团队形式化。注意与 Google DeepMind 的 IMO-ProofBench(自然语言证明、由评委打分)不是同一个评测。
FrontierMath Erdős 由 Epoch AI 与 Thomas Bloom 构建,收录 68 个截至 2026 年 8 月仍未解决的 Erdős 问题,全部用 Lean 4 形式化。模型以智能体方式运行(可用 bash、Lean/Mathlib、SageMath、Python 及离线数学文献库),每题一次尝试、预算上限 300 美元或 72 小时,必须写出能通过 Lean 检查的完整证明或反证。得分为解决的问题占比。