DataLearner logo

Muse SparkvsGemini 3.1 Pro Preview

Across 6 shared benchmarks, Gemini 3.1 Pro Preview leads overall: Muse Spark wins 0, Gemini 3.1 Pro Preview wins 6, with 0 ties and an average score difference of -5.27.

Facebook AI研究实验室
Muse Spark

Facebook AI研究实验室 · 2026-04-08 · Reasoning model

Google Deep Mind
Gemini 3.1 Pro Preview

Google Deep Mind · 2026-02-20 · Multimodal model

Muse Spark0 wins(0%)(100%)6 winsGemini 3.1 Pro Preview

Benchmark scores

Grouped by capability, sorted by largest gap within each. 6 shared benchmarks.

Agent Level Benchmark

Gemini 3.1 Pro Preview 1/1
BenchmarkMuse SparkGemini 3.1 Pro PreviewDiff
Terminal Bench Hard45.5033 / 244Thinking (With Tools)53.8016 / 244Thinking (With Tools)-8.30

AI Agent - Tool Usage

Gemini 3.1 Pro Preview 1/1
BenchmarkMuse SparkGemini 3.1 Pro PreviewDiff
Terminal-Bench 2.162.20104 / 192Thinking (With Tools)73.8082 / 192Thinking (With Tools)-11.60

General Knowledge

Gemini 3.1 Pro Preview 1/1
BenchmarkMuse SparkGemini 3.1 Pro PreviewDiff
CritPt11.3066 / 200Thinking (No Tools)17.7042 / 200Thinking (No Tools)-6.40

Instruction Following

Gemini 3.1 Pro Preview 1/1
BenchmarkMuse SparkGemini 3.1 Pro PreviewDiff
IF Bench75.9028 / 282Thinking (No Tools)77.1018 / 282Thinking (No Tools)-1.20

Math and Reasoning

Gemini 3.1 Pro Preview 1/1
BenchmarkMuse SparkGemini 3.1 Pro PreviewDiff
FrontierMath - Tier 414.6023 / 80Normal (No Tools)16.7020 / 80Normal (No Tools)-2.10

Multimodal Understanding

Gemini 3.1 Pro Preview 1/1
BenchmarkMuse SparkGemini 3.1 Pro PreviewDiff
MMMU-Pro80.4039 / 227Thinking (No Tools)82.4022 / 227Thinking (No Tools)-2

Specs

FieldMuse SparkGemini 3.1 Pro Preview
PublisherFacebook AI研究实验室Google Deep Mind
Release date2026-04-082026-02-20
Model typeReasoning modelMultimodal model
ArchitectureDenseDense
ParametersNot availableNot available
Context length262K1M
Max outputNot available64K

API pricing

Prices use DataLearner records when available; missing fields are not inferred.

ItemMuse SparkGemini 3.1 Pro Preview
Text inputNot public$2 / 1M tokens
Text outputNot public$12 / 1M tokens
Cache readNot public$0.2 / 1M tokens

One or both models have incomplete public pricing.

Summary

  • Gemini 3.1 Pro Previewleads in:Agent Level Benchmark (1/1), AI Agent - Tool Usage (1/1), General Knowledge (1/1), Instruction Following (1/1), Math and Reasoning (1/1), Multimodal Understanding (1/1)

On average across the 6 shared benchmarks, Gemini 3.1 Pro Preview scores 5.27 higher.

Largest single-benchmark gap: Terminal-Bench 2.1 — Muse Spark 62.20 vs Gemini 3.1 Pro Preview 73.80 (-11.60).

Page generated from structured model, pricing and benchmark records. No real-time LLM is used to write the prose.