DataLearner logo

Qwen3.8-27BvsMuse Glimmer-30B

Across 7 shared benchmarks, Qwen3.8-27B leads overall: Qwen3.8-27B wins 7, Muse Glimmer-30B wins 0, with 0 ties and an average score difference of +13.06.

阿里巴巴
Qwen3.8-27B

阿里巴巴 · 2026-08-14 · Reasoning model

Facebook AI研究实验室
Muse Glimmer-30B

Facebook AI研究实验室 · 2026-08-10 · Reasoning model

Qwen3.8-27B7 wins(100%)(0%)0 winsMuse Glimmer-30B

Benchmark scores

Grouped by capability, sorted by largest gap within each. 7 shared benchmarks.

AI Agent - Tool Usage

Qwen3.8-27B 2/2
BenchmarkQwen3.8-27BMuse Glimmer-30BDiff
Terminal-Bench 2.17329 / 44Thinking (With Tools)51.7044 / 44Thinking High (With Tools)+21.30
OSWorld-Verified84.303 / 26Thinking (With Tools)65.9020 / 26Thinking High (With Tools)+18.40

Multimodal Understanding

Qwen3.8-27B 2/2
BenchmarkQwen3.8-27BMuse Glimmer-30BDiff
OmniDocBench91.101 / 3Thinking (No Tools)75.803 / 3Thinking High (No Tools)+15.30
CharXiv RQ90.202 / 15Thinking (With Tools)78.8015 / 15Thinking High (No Tools)+11.40

Coding and Software Engineer

Qwen3.8-27B 1/1
BenchmarkQwen3.8-27BMuse Glimmer-30BDiff
SWE-Bench Pro - Public61.7010 / 57Thinking (With Tools)51.2041 / 57Thinking High (With Tools)+10.50

General Evaluation

Qwen3.8-27B 1/1
BenchmarkQwen3.8-27BMuse Glimmer-30BDiff
GPQA Diamond89.2047 / 226Thinking (No Tools)83.5098 / 226Thinking High (No Tools)+5.70

General Knowledge

Qwen3.8-27B 1/1
BenchmarkQwen3.8-27BMuse Glimmer-30BDiff
HLE30.8088 / 181Thinking (No Tools)22117 / 181Thinking High (No Tools)+8.80

Specs

FieldQwen3.8-27BMuse Glimmer-30B
Publisher阿里巴巴Facebook AI研究实验室
Release date2026-08-142026-08-10
Model typeReasoning modelReasoning model
ArchitectureDenseDense
Parameters27B29.6B
Context length256K128K+
Max output128KNot available

Summary

  • Qwen3.8-27Bleads in:AI Agent - Tool Usage (2/2), Multimodal Understanding (2/2), Coding and Software Engineer (1/1), General Evaluation (1/1), General Knowledge (1/1)

On average across the 7 shared benchmarks, Qwen3.8-27B scores 13.06 higher.

Largest single-benchmark gap: Terminal-Bench 2.1 — Qwen3.8-27B 73 vs Muse Glimmer-30B 51.70 (+21.30).

Page generated from structured model, pricing and benchmark records. No real-time LLM is used to write the prose.