SimpleBench
查看详情SimpleBench 是一个包含 213 道英文六选一题目的常识推理基准,覆盖时空推理、社会智能和语言对抗性问题。每道题运行 5 次并报告平均正确率;通常使用 temperature=0.7、top-p=0.95,o 系列模型除外。官方由 9 名参与者的小样本测得非专业人类基线 83.7%。
评测基准库
本页面汇总了当前业界主流的大模型评测基准,包括AIME 2025, SWE Bench Verified, MMLU、GSM8K、HumanEval 等。我们致力于为研究者和开发者提供一个全面的参考平台,帮助大家了解不同大模型在各种评测数据集上的性能表现。
全部基准
204
所有类型
14
所有语言
9
大模型在评测基准的详细评测结果:主流大模型评测基准榜单
由编辑挑选,帮助你发现值得关注的评测基准。
SimpleBench 是一个包含 213 道英文六选一题目的常识推理基准,覆盖时空推理、社会智能和语言对抗性问题。每道题运行 5 次并报告平均正确率;通常使用 temperature=0.7、top-p=0.95,o 系列模型除外。官方由 9 名参与者的小样本测得非专业人类基线 83.7%。
ARC-AGI-3 是首个面向智能体的人机可比交互式推理基准。智能体需要在没有自然语言指令的全新环境中探索、即时推断目标、建立并持续更新世界模型,通过长期规划和稀疏反馈完成任务;100% 表示能像人类一样高效通关全部游戏。 注意:ARC-AGI-3 的分数强依赖测试脚手架(harness)。ARC Prize 只把 Standard harness 的结果视为跨厂商可比口径;厂商自建的 Provider Adapter harness 可在多次请求间保留不透明的推理状态,分数会显著更高,录入本站时一律以 Standard harness 为准。
Terminal-Bench 4.0 是 Terminal-Bench 团队持续维护的终端智能体评测版本,于2026年8月28日正式发布,通过 66 个容器化专业计算机任务测量模型与 Agent 脚手架组成的完整系统。4.0 将每次 Agent 运行的超时上限统一调整为 8 小时,修复 19 个任务,并移除 8 个已饱和、容易触发拒答、存在公开解法或仍有质量与平台问题的任务。每个任务运行 5 次,榜单报告任务解决率及 95% 置信区间;因任务集和资源规则已发生破坏性变更,4.0 成绩不应与 3.0 或 2.x 直接对比。
CursorBench 是 Cursor 基于真实 Cursor 会话中的模糊、多文件任务构建的内部编程 Agent 评测。4.0 版新增长周期任务,覆盖编辑、重构、调查、意图理解、作业管理和设计一致性;官方同时提示小幅分数差异可能不具统计意义。任务、Agent harness 和评分口径由 Cursor 维护,因此结果应视为特定模型、思考档位与 Cursor 工具环境组成的系统成绩。
已匹配 14 个基准,建议先看对应榜单,再进入模型对比。
Tool Decathlon是一个用于评估大模型在真实环境中使用工具执行复杂任务的能力的评测基准
一个用于评估大模型作为OpenClaw控制中心的测试基准
一个用于测试大模型在OpenClaw常见的5类任务中的能力的评测基准
MCP-Atlas: A Large-Scale Benchmark for Tool-Use Competency with Real MCP Servers
MCP-Atlas 是 Scale AI 推出的真实 MCP 服务器工具使用评测,覆盖 36 个 MCP servers、220 个工具和 1000 个自然语言任务,用于衡量模型发现工具、跨服务器编排、多步调用和基于工具结果综合答案的能力。
Agents' Last Exam evaluates AI agents on long-horizon, economically valuable professional workflows with verifiable outcomes across a broad set of industries.
Toolathlon-Verified 是 Kimi K3 官方技术博客完整评测表采用的基准。本条目用于承载官方发布成绩;Kimi K3 的全局测试设置为 reasoning_effort=max、temperature=1.0、top_p=1.0,具体 harness、工具使用和重复运行口径以官方脚注为准。
JobBench
Job Bench 是 Kimi K3 官方技术博客完整评测表采用的基准。本条目用于承载官方发布成绩;Kimi K3 的全局测试设置为 reasoning_effort=max、temperature=1.0、top_p=1.0,具体 harness、工具使用和重复运行口径以官方脚注为准。
APEX-Agents 是 Kimi K3 官方技术博客完整评测表采用的基准。本条目用于承载官方发布成绩;Kimi K3 的全局测试设置为 reasoning_effort=max、temperature=1.0、top_p=1.0,具体 harness、工具使用和重复运行口径以官方脚注为准。
MCPMark-Verified 用于评估智能体通过 MCP 工具完成真实任务的能力;Kimi K3 成绩来自官方开放权重模型卡。
DeepSeek-V4-Flash-Vision-Exp 发布日志采用的智能体评测之一,包含多模态元素并以 Pass@1 报告成绩。DeepSeek 尚未在该发布页提供独立的基准主页、题量或创建机构信息。
Berkeley Function Calling Leaderboard V4
BFCL(Berkeley Function Calling Leaderboard)是加州大学伯克利分校 Gorilla 团队维护的函数调用/工具使用评测榜单。V4 于 2025 年 7 月发布并在 ICML 2025 上介绍,在前几代(V1 单轮 AST 评分、V2 企业与线上真实数据、V3 多轮多步)的基础上引入了更完整的智能体评测维度:联网搜索(Web Search)、记忆(Memory)与格式敏感性(Format Sensitivity)。评分主要基于抽象语法树(AST)匹配与状态转移校验,保证判定确定性、结果波动小。
MCPMark: A Benchmark for Stress-Testing Realistic and Comprehensive MCP Use
MCPMark 是面向真实 MCP(Model Context Protocol)工具环境的压力测试评测集,覆盖 Notion、GitHub、Filesystem、PostgreSQL 与 Playwright 五类环境,共 127 道由领域专家与 AI 智能体协同构建的任务。每道题都带有精心准备的初始状态和程序化校验脚本,要求智能体完成多样的增删改查操作和更丰富的环境交互,在隔离沙箱中可复现执行。注意:DataLearner 另有 MCPMark-Verified 条目,对应部分厂商模型卡使用的验证子集,两者成绩不可直接比较。
PinchBench v2(OpenClaw 智能体评测)
PinchBench 由 Kilo Code 推出,评估大模型作为 OpenClaw 智能体完成真实任务的能力,任务涵盖日程安排、调研、写作、编程、邮件处理和文件管理等。v2 版共 147 个任务、11 个类别,每个任务按自动检查、Claude Opus 依据评分细则打分,或两者结合来评分。官方榜单接受公开提交,同一模型可能有多次运行;本站记录的是官方公布的所有运行平均得分,而不是单次最好成绩。v2 的题目与旧版 PinchBench 不同,两者分数不可直接比较。
AutomationBench-AA 是 Artificial Analysis 与 Zapier 合作运行的私有 AutomationBench 评测,包含 657 个业务工作流任务,覆盖 Finance、HR、Marketing、Operations、Sales 和 Support,并在 40 个模拟 SaaS 应用环境中执行。主指标要求模型完成目标且不违反任何 guardrail。