DataLearner logo

Muse Glimmer-30BvsGemma 4 31B

Across 3 shared benchmarks, Gemma 4 31B leads overall: Muse Glimmer-30B wins 1, Gemma 4 31B wins 2, with 0 ties and an average score difference of +0.07.

Facebook AI研究实验室
Muse Glimmer-30B

Facebook AI研究实验室 · 2026-08-10 · Reasoning model

DeepMind
Gemma 4 31B

DeepMind · 2026-04-02 · Chat model

Muse Glimmer-30B1 win(33%)(67%)2 winsGemma 4 31B

Benchmark scores

Grouped by capability, sorted by largest gap within each. 3 shared benchmarks.

General Evaluation

Gemma 4 31B 1/1
BenchmarkMuse Glimmer-30BGemma 4 31BDiff
GPQA Diamond83.5098 / 226Thinking High (No Tools)84.3093 / 226Thinking (No Tools)-0.80

General Knowledge

Gemma 4 31B 1/1
BenchmarkMuse Glimmer-30BGemma 4 31BDiff
HLE22117 / 181Thinking High (No Tools)26.50104 / 181Thinking (With Tools + Internet)-4.50

Math and Reasoning

Muse Glimmer-30B 1/1
BenchmarkMuse Glimmer-30BGemma 4 31BDiff
AIME 202694.706 / 19Thinking High (No Tools)89.2016 / 19Thinking (No Tools)+5.50

Specs

FieldMuse Glimmer-30BGemma 4 31B
PublisherFacebook AI研究实验室DeepMind
Release date2026-08-102026-04-02
Model typeReasoning modelChat model
ArchitectureDenseDense
Parameters29.6B30.7B
Context length128K+256K
Max outputNot available32K

Summary

  • Muse Glimmer-30Bleads in:Math and Reasoning (1/1)
  • Gemma 4 31Bleads in:General Evaluation (1/1), General Knowledge (1/1)

On average across the 3 shared benchmarks, Muse Glimmer-30B scores 0.07 higher.

Largest single-benchmark gap: AIME 2026 — Muse Glimmer-30B 94.70 vs Gemma 4 31B 89.20 (+5.50).

Page generated from structured model, pricing and benchmark records. No real-time LLM is used to write the prose.