Workspace-Bench 用于评估智能体在真实「工作区」中处理大规模文件依赖的能力,即所谓 Workspace Learning:能否识别、推理、利用并更新异构文件之间显式与隐式的依赖关系。基准构建了 5 类职业画像(运营经理、物流经理、AI 产品经理、研究员、后端开发)的工作区,涵盖 74 种文件类型、20,476 个文件(最大约 20GB),并整理出 388 道任务、7,399 条评分细则,要求跨文件检索、上下文推理与自适应决策。另提供 100 题的 Workspace-Bench-Lite 子集。
查看 Workspace-Bench 的最新得分、模型模式、发布时间与参数规模,快速了解当前完整榜单表现。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
| 排名 | 模型 | 开源情况 | |||
|---|---|---|---|---|---|
Spark-X2.5-4B 开启思考工具 | 31.20 | 2026-09-01 | 41.1亿 | 免费商用 |