2024年10月,OpenAI推出了一款名为**SimpleQA**的全新评测基准,旨在解决语言模型生成内容中的“幻觉”问题(即模型生成看似合理但实际错误的信息),并通过开源方式推动AI生成内容的可靠性发展。这一基准的发布标志着AI领域在事实性评估方面迈出了重要一步。
OpenAI发布的一个针对大模型事实问答的能力评测基准,可以有效检验模型幻觉严重程度
查看 SimpleQA 的最新得分、模型模式、发布时间与参数规模,快速了解当前完整榜单表现。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
| 排名 | 模型 | 开源情况 | |||
|---|---|---|---|---|---|
![]() DeepSeek V3.2-Exp 开启思考工具 | 97.10 | 2025-09-29 | 6710亿 | 免费商用 | |
96.80 | 2025-09-22 | 6710亿 | 免费商用 | ||
Grok 4 Fast 开启思考工具 | 95.00 | 2025-09-19 | 未知 | 闭源 | |
4 | ![]() DeepSeek-V3.1 开启思考 | 93.40 | 2025-08-20 | 6710亿 | 免费商用 |
5 | ![]() ERNIE 5.0 开启思考 | 74.01 | 2025-11-13 | 24000亿 | 闭源 |
6 | 72.10 | 2025-11-18 | 未知 | 闭源 | |
7 | ![]() Claude Opus 4.6 扩展思考 | 72.00 | 2026-02-05 | 未知 | 闭源 |
8 | ![]() Gemini 3.0 Flash 开启思考 | 68.70 | 2025-12-17 | 未知 | 闭源 |
9 | ![]() GPT-4.5 常规模式 | 62.50 | 2025-02-28 | 未知 | 闭源 |
10 | 54.30 | 2025-07-21 | 2350亿 | 免费商用 | |
11 | 54.00 | 2025-05-06 | 未知 | 闭源 | |
12 | ![]() Gemini 2.5-Pro 常规模式 | 54.00 | 2025-06-05 | 未知 | 闭源 |
13 | 52.90 | 2025-03-25 | 未知 | 闭源 | |
14 | ![]() OpenAI o3 常规模式 | 49.40 | 2025-04-16 | 未知 | 闭源 |
15 | 45.90 | 2025-06-30 | 3000亿 | 免费商用 | |
16 | 44.30 | 2025-02-05 | 未知 | 闭源 | |
17 | Inkling 开启思考 | 43.90 | 2026-07-15 | 9750亿 | 免费商用 |
18 | Grok 3 常规模式 | 43.40 | 2025-02-17 | 未知 | 闭源 |
19 | ![]() OpenAI o1 常规模式 | 42.60 | 2024-12-05 | 未知 | 闭源 |
20 | 40.30 | 2025-03-27 | 未知 | 闭源 | |
21 | 38.80 | 2024-11-20 | 未知 | 闭源 | |
22 | ![]() GPT-4o 常规模式 | 38.20 | 2024-05-13 | 未知 | 闭源 |
23 | ![]() Kimi K2 常规模式 | 31.00 | 2025-07-11 | 10000亿 | 免费商用 |
24 | ![]() DeepSeek-R1 常规模式 | 30.10 | 2025-01-20 | 6710亿 | 免费商用 |
25 | 29.90 | 2024-12-11 | 未知 | 闭源 | |
26 | 28.40 | 2024-10-22 | 未知 | 闭源 | |
27 | ![]() DeepSeek-R1-0528 开启思考 | 27.80 | 2025-05-28 | 6710亿 | 免费商用 |
28 | ![]() DeepSeek-V3-0324 常规模式 | 27.20 | 2025-03-24 | 6710亿 | 免费商用 |
29 | ![]() Gemini 2.5 Flash 开启思考 | 26.90 | 2025-04-17 | 未知 | 闭源 |
30 | ![]() Gemini 2.5 Flash 常规模式 | 25.80 | 2025-04-17 | 未知 | 闭源 |