SimpleBench
查看详情SimpleBench 是一个包含 213 道英文六选一题目的常识推理基准,覆盖时空推理、社会智能和语言对抗性问题。每道题运行 5 次并报告平均正确率;通常使用 temperature=0.7、top-p=0.95,o 系列模型除外。官方由 9 名参与者的小样本测得非专业人类基线 83.7%。
评测基准库
本页面汇总了当前业界主流的大模型评测基准,包括AIME 2025, SWE Bench Verified, MMLU、GSM8K、HumanEval 等。我们致力于为研究者和开发者提供一个全面的参考平台,帮助大家了解不同大模型在各种评测数据集上的性能表现。
全部基准
204
所有类型
14
所有语言
9
大模型在评测基准的详细评测结果:主流大模型评测基准榜单
由编辑挑选,帮助你发现值得关注的评测基准。
SimpleBench 是一个包含 213 道英文六选一题目的常识推理基准,覆盖时空推理、社会智能和语言对抗性问题。每道题运行 5 次并报告平均正确率;通常使用 temperature=0.7、top-p=0.95,o 系列模型除外。官方由 9 名参与者的小样本测得非专业人类基线 83.7%。
ARC-AGI-3 是首个面向智能体的人机可比交互式推理基准。智能体需要在没有自然语言指令的全新环境中探索、即时推断目标、建立并持续更新世界模型,通过长期规划和稀疏反馈完成任务;100% 表示能像人类一样高效通关全部游戏。 注意:ARC-AGI-3 的分数强依赖测试脚手架(harness)。ARC Prize 只把 Standard harness 的结果视为跨厂商可比口径;厂商自建的 Provider Adapter harness 可在多次请求间保留不透明的推理状态,分数会显著更高,录入本站时一律以 Standard harness 为准。
Terminal-Bench 4.0 是 Terminal-Bench 团队持续维护的终端智能体评测版本,于2026年8月28日正式发布,通过 66 个容器化专业计算机任务测量模型与 Agent 脚手架组成的完整系统。4.0 将每次 Agent 运行的超时上限统一调整为 8 小时,修复 19 个任务,并移除 8 个已饱和、容易触发拒答、存在公开解法或仍有质量与平台问题的任务。每个任务运行 5 次,榜单报告任务解决率及 95% 置信区间;因任务集和资源规则已发生破坏性变更,4.0 成绩不应与 3.0 或 2.x 直接对比。
CursorBench 是 Cursor 基于真实 Cursor 会话中的模糊、多文件任务构建的内部编程 Agent 评测。4.0 版新增长周期任务,覆盖编辑、重构、调查、意图理解、作业管理和设计一致性;官方同时提示小幅分数差异可能不具统计意义。任务、Agent harness 和评分口径由 Cursor 维护,因此结果应视为特定模型、思考档位与 Cursor 工具环境组成的系统成绩。
已匹配 16 个基准,建议先看对应榜单,再进入模型对比。
Software Engineering Bench
一个从GitHub上提炼的真实世界的Python代码仓的任务评测数据集
Software Engineering Bench - Verified
OpenAI基于SWE-Bench提炼的更加准确和更具代表性的大模型代码工程任务解决能力评测
Individual Contributor SWE-Lancer (Diamond)
OpenAI开源的评测大模型解决独立软件工程任务能力的评测基准
SWE Manager-Lancer (Diamond)
OpenAI开源的评测大模型解决软件工程管理任务能力的评测基准
Software Engineering Bench Pro - Public Dataset
一个用于评估大模型解决真实世界代码工程的评测基准
SWE-Bench Pro - Private Commercial Dataset
SWE-Bench Pro 商业私有集由 18 个合作方的专有代码库构成,共 276 个真实软件工程任务,用于检验编码智能体在训练数据不可见、工业级代码库中的泛化能力。官方主指标为 Resolve Rate,补丁必须同时通过问题修复测试且不引入回归。
覆盖9种编程语言的大模型软件工程能力的评测基准
DeepSWE: Long-Horizon Software Engineering Benchmark
DeepSWE 是 Datacurve 推出的长程软件工程基准,包含 113 个原创任务,覆盖 91 个活跃开源仓库和 TypeScript、Go、Python、JavaScript、Rust 五种语言,强调多文件修改、行为正确性和更低污染风险。【版本口径】本条目统一记录 DeepSWE v1.1(Datacurve 官方榜单于 2026-08-13 更新的现行版本)的成绩。厂商自行公布的分数若标注为 DeepSWE 1.0,请勿录入本条目——同一模型两个版本差异可达 8 个百分点以上(如 Grok 4.5:v1.0 为 62.0、v1.1 为 53.0)。录入前请以 https://deepswe.datacurve.ai/ 的现行榜单为准。
SWE-Marathon: Can Agents Autonomously Complete Ultra-Long-Horizon Software Work?
SWE-Marathon 是面向超长周期软件工程智能体的评测基准,包含 20 个跨软件工程及相关技术领域的多小时任务,考察持续规划、长上下文理解、记忆、自我验证和复杂环境执行能力,并使用多层验证与对抗审查降低捷径解和奖励劫持的影响。
FrontierSWE 是 Kimi K3 官方技术博客完整评测表采用的基准。本条目用于承载官方发布成绩;Kimi K3 的全局测试设置为 reasoning_effort=max、temperature=1.0、top_p=1.0,具体 harness、工具使用和重复运行口径以官方脚注为准。
NL2Repo-Bench: Towards Long-Horizon Repository Generation Evaluation of Coding Agents
NL2Repo-Bench evaluates whether coding agents can build a complete, installable Python repository from a natural-language specification and an empty workspace. The 104 tasks are graded against upstream pytest suites.
AI Productivity Index for Software Engineering
APEX-SWE 评估前沿 AI 系统能否完成具有经济价值的真实软件工程工作,包含 200 个 Integration 与 Observability 案例,使用人工编写的 rubric 和单元测试评估功能、稳健性与代码质量。
SWE-bench Multimodal: Do AI Systems Generalize to Visual Software Domains?
SWE-bench Multimodal 在 SWE-bench 的仓库级修复任务上加入视觉上下文(截图、设计稿等),考察模型在图形界面相关的真实软件工程问题上的解决能力。
SWE Atlas - Codebase QnA
SWE-Atlas-QnA 是 Scale AI 的代码库理解智能体评测,包含来自 11 个真实开源仓库的 124 个任务,覆盖 Go、Python、C 和 TypeScript。智能体需要运行和追踪代码、跨文件理解架构并回答技术问题;主指标 Task Resolve Rate 只有在全部 rubric 条件通过时才计为成功。
SWE-Bench Pro V2 是 Scale Labs 与 Reflection 于 2026 年 9 月发布的公开软件工程智能体评测,包含 11 个代码库的 642 道任务。相比原版公开集移除了 89 道无效题,并更新任务说明、验证器与运行环境。
SWE-Bench Pro V2 Hard 是 V2 公开集中的 51 道高难任务子集,评测编码智能体在复杂多文件依赖、系统缺陷与长程工程推理中的修复能力。