SimpleBench
查看详情SimpleBench 是一个包含 213 道英文六选一题目的常识推理基准,覆盖时空推理、社会智能和语言对抗性问题。每道题运行 5 次并报告平均正确率;通常使用 temperature=0.7、top-p=0.95,o 系列模型除外。官方由 9 名参与者的小样本测得非专业人类基线 83.7%。
评测基准库
本页面汇总了当前业界主流的大模型评测基准,包括AIME 2025, SWE Bench Verified, MMLU、GSM8K、HumanEval 等。我们致力于为研究者和开发者提供一个全面的参考平台,帮助大家了解不同大模型在各种评测数据集上的性能表现。
全部基准
204
所有类型
14
所有语言
9
大模型在评测基准的详细评测结果:主流大模型评测基准榜单
由编辑挑选,帮助你发现值得关注的评测基准。
SimpleBench 是一个包含 213 道英文六选一题目的常识推理基准,覆盖时空推理、社会智能和语言对抗性问题。每道题运行 5 次并报告平均正确率;通常使用 temperature=0.7、top-p=0.95,o 系列模型除外。官方由 9 名参与者的小样本测得非专业人类基线 83.7%。
ARC-AGI-3 是首个面向智能体的人机可比交互式推理基准。智能体需要在没有自然语言指令的全新环境中探索、即时推断目标、建立并持续更新世界模型,通过长期规划和稀疏反馈完成任务;100% 表示能像人类一样高效通关全部游戏。 注意:ARC-AGI-3 的分数强依赖测试脚手架(harness)。ARC Prize 只把 Standard harness 的结果视为跨厂商可比口径;厂商自建的 Provider Adapter harness 可在多次请求间保留不透明的推理状态,分数会显著更高,录入本站时一律以 Standard harness 为准。
Terminal-Bench 4.0 是 Terminal-Bench 团队持续维护的终端智能体评测版本,于2026年8月28日正式发布,通过 66 个容器化专业计算机任务测量模型与 Agent 脚手架组成的完整系统。4.0 将每次 Agent 运行的超时上限统一调整为 8 小时,修复 19 个任务,并移除 8 个已饱和、容易触发拒答、存在公开解法或仍有质量与平台问题的任务。每个任务运行 5 次,榜单报告任务解决率及 95% 置信区间;因任务集和资源规则已发生破坏性变更,4.0 成绩不应与 3.0 或 2.x 直接对比。
CursorBench 是 Cursor 基于真实 Cursor 会话中的模糊、多文件任务构建的内部编程 Agent 评测。4.0 版新增长周期任务,覆盖编辑、重构、调查、意图理解、作业管理和设计一致性;官方同时提示小幅分数差异可能不具统计意义。任务、Agent harness 和评分口径由 Cursor 维护,因此结果应视为特定模型、思考档位与 Cursor 工具环境组成的系统成绩。
已匹配 5 个基准,建议先看对应榜单,再进入模型对比。
Document Visual Question Answering
DocVQA是一个针对文档图像的视觉问答基准数据集。
CharXiv (RQ)
CharXiv RQ 是 Kimi K3 官方技术博客完整评测表采用的基准。本条目用于承载官方发布成绩;Kimi K3 的全局测试设置为 reasoning_effort=max、temperature=1.0、top_p=1.0,具体 harness、工具使用和重复运行口径以官方脚注为准。
OmniDocBench 是 Kimi K3 官方技术博客完整评测表采用的基准。本条目用于承载官方发布成绩;Kimi K3 的全局测试设置为 reasoning_effort=max、temperature=1.0、top_p=1.0,具体 harness、工具使用和重复运行口径以官方脚注为准。
GDP.pdf: Benchmarking Grounded Multimodal Reasoning over Professional PDF Documents
GDP.pdf evaluates grounded multimodal reasoning over 100 real professional PDF workflows spanning ten domains. Tasks require locating evidence, interpreting tables, charts, forms and diagrams, cross-referencing documents, and avoiding unsupported claims; strict pass rate requires satisfying all task rubric criteria.
DeepSeek-V4-Flash-Vision-Exp 发布日志采用的视觉智能体评测之一。DeepSeek 尚未在该发布页提供独立的基准主页、题量或创建机构信息。