GeoBench 评测多模态模型在 GeoGuessr 街景图像上的地理定位能力。本条目固定采用 100 张 A Community World(ACW)图像的国家准确率,避免与其他地图、平均距离或 GeoGuessr 分数混用。
查看 GeoBench ACW 的最新得分、模型模式、发布时间与参数规模,快速了解当前完整榜单表现。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
| 排名 | 模型 | 开源情况 | |||
|---|---|---|---|---|---|
![]() Claude Fable 5 常规模式 | 89.00 | 2026-06-09 | 未知 | 闭源 | |
![]() Gemini 3.0 Flash 常规模式 | 88.00 | 2025-12-17 | 未知 | 闭源 | |
86.00 | 2025-05-06 | 未知 | 闭源 | ||
4 | ![]() Gemini 3 Pro 常规模式 | 84.00 | 2026-02-01 | 未知 | 闭源 |
5 | 81.00 | 2025-03-25 | 未知 | 闭源 | |
6 | ![]() Gemini-2.5-Pro-Preview-05-06 常规模式工具联网 | 81.00 | 2025-05-06 | 未知 | 闭源 |
7 | ![]() GPT-5 思考水平·中 | 81.00 | 2025-08-07 | 未知 | 闭源 |
8 | ![]() OpenAI o1 思考水平·中 | 80.00 | 2024-12-05 | 未知 | 闭源 |
9 | ![]() Gemini 2.5 Flash 常规模式 | 76.00 | 2025-04-17 | 未知 | 闭源 |
10 | ![]() Opus 4.5 常规模式 | 75.00 | 2025-11-25 | 未知 | 闭源 |
11 | ![]() OpenAI o3 思考水平·中 | 74.00 | 2025-04-16 | 未知 | 闭源 |
12 | ![]() GPT-4.1 常规模式 | 72.00 | 2025-04-14 | 未知 | 闭源 |
13 | 71.00 | 2024-11-20 | 未知 | 闭源 | |
14 | 68.00 | 2025-02-25 | 未知 | 闭源 | |
15 | ![]() GPT-4o mini 常规模式 | 64.00 | 2024-07-18 | 未知 | 闭源 |
16 | ![]() OpenAI o4 - mini 思考水平·中 | 64.00 | 2025-04-16 | 未知 | 闭源 |
17 | ![]() OpenAI o4 - mini 思考水平·高 | 64.00 | 2025-04-16 | 未知 | 闭源 |
18 | 62.00 | 2024-10-22 | 未知 | 闭源 | |
19 | ![]() OpenAI o3 思考水平·高 | 60.00 | 2025-04-16 | 未知 | 闭源 |
20 | Grok 4 常规模式 | 45.00 | 2025-07-10 | 未知 | 闭源 |
2026-08-12 官方页面中,Claude Fable 5 在 ACW 100 图上的国家准确率为 89.0%。