DataLearner logo

Spark-X2.5-4B Benchmark Details

Spark-X2.5-4B currently shows benchmark results led by IF Bench (10 / 35, score 75), GPQA (6 / 17, score 67.40), τ²-Bench (22 / 44, score 75.10).

Benchmark Results

Spark-X2.5-4B

Benchmark Results

Thinking
Tool usage
Internet

General Knowledge

2 evaluations
Benchmark / mode
Score
Rank/total
GPQA
Thinking Mode
67.40
6 / 17
HLE
Thinking Mode
12.30
157 / 189

Coding and Software Engineer

4 evaluations
Benchmark / mode
Score
Rank/total
SWE-bench Multilingual
Thinking ModeTools
53.30
28 / 28
SWE-Bench Pro - Public
Thinking ModeTools
44.40
51 / 60
SWE-bench Verified
Thinking ModeTools
41.60
103 / 115
SciCode
Thinking Mode
34.70
15 / 15

Agent Level Benchmark

4 evaluations
Benchmark / mode
Score
Rank/total
τ²-Bench
Thinking ModeTools
75.10
22 / 44
Workspace-Bench
Thinking ModeTools
31.20
1 / 1
τ³-Bench
Thinking ModeTools
30.40
1 / 1
VitaBench 2.0
Thinking ModeTools
25.20
1 / 1

Instruction Following

2 evaluations
Benchmark / mode
Score
Rank/total
IFEval
Thinking Mode
93
1 / 1
IF Bench
Thinking Mode
75
10 / 35

AI Agent - Information Search

1 evaluations
Benchmark / mode
Score
Rank/total
BrowseComp
Thinking ModeToolsInternet
40.90
49 / 55

Math and Reasoning

4 evaluations
Benchmark / mode
Score
Rank/total
Gaokao 2026
Thinking Mode
133.40
1 / 1
AIME 2026
Thinking Mode
90.70
15 / 20
HMMT Feb 2026
Thinking Mode
81.20
1 / 1
IMO-AnswerBench
Thinking Mode
74.20
22 / 24

Long Context

1 evaluations
Benchmark / mode
Score
Rank/total
AA-LCR
Thinking Mode
56.30
27 / 28

AI Agent - Tool Usage

3 evaluations
Benchmark / mode
Score
Rank/total
BFCL-V4
Thinking ModeTools
65.10
1 / 1
MCP-Atlas
Thinking ModeTools
54.60
38 / 41
MCPMark
Thinking ModeTools
14.20
1 / 1