DataLearner logo

Muse Spark 1.3 Benchmark Details

Muse Spark 1.3 currently shows benchmark results led by DeepSWE (1 / 34, score 75.40), Terminal-Bench 2.1 (2 / 49, score 88.80), AutomationBench (2 / 13, score 49.40).

Benchmark Results

Muse Spark 1.3

Benchmark Results

Thinking
Internet

AI Agent - Tool Usage

3 evaluations
Benchmark / mode
Score
Rank/total
Terminal-Bench 2.1
Thinking Level · MaxTools
88.80
2 / 49
OSWorld 2.0
Thinking Level · MaxTools
66.90
3 / 8
AutomationBench
Thinking Level · MaxTools
49.40
2 / 13

Coding and Software Engineer

1 evaluations
Benchmark / mode
Score
Rank/total
DeepSWE
Thinking Level · MaxTools
75.40
1 / 34

Productivity Knowledge

1 evaluations
Benchmark / mode
Score
Rank/total
GDPval-AA v2
Thinking Level · MaxToolsInternet
1754
5 / 25

AI Agent - Information Search

1 evaluations
Benchmark / mode
Score
Rank/total
DeepSearchQA
Thinking Level · MaxToolsInternet
89.40
2 / 3

Agent Level Benchmark

1 evaluations
Benchmark / mode
Score
Rank/total
Job Bench
Thinking Level · MaxTools
64.90
1 / 5