DataLearner 标志

Qwen3.8-27BvsMuse Glimmer-30B

在 7 个共同 benchmark 中,Qwen3.8-27B 整体领先:Qwen3.8-27B 领先 7 项,Muse Glimmer-30B 领先 0 项,持平 0 项,平均分差 +13.06。

阿里巴巴
Qwen3.8-27B

阿里巴巴 · 2026-08-14 · 推理大模型

Facebook AI研究实验室
Muse Glimmer-30B

Facebook AI研究实验室 · 2026-08-10 · 推理大模型

Qwen3.8-27B7 (100%)(0%)0 Muse Glimmer-30B

评测分数

按能力类目分组,每组内按分差大小排列;共 7 项。

AI Agent - Tool Usage

Qwen3.8-27B 领先 2/2
评测项Qwen3.8-27BMuse Glimmer-30B分差
Terminal-Bench 2.17329 / 44Thinking (With Tools)51.7044 / 44Thinking High (With Tools)+21.30
OSWorld-Verified84.303 / 26Thinking (With Tools)65.9020 / 26Thinking High (With Tools)+18.40

Multimodal Understanding

Qwen3.8-27B 领先 2/2
评测项Qwen3.8-27BMuse Glimmer-30B分差
OmniDocBench91.101 / 3Thinking (No Tools)75.803 / 3Thinking High (No Tools)+15.30
CharXiv RQ90.202 / 15Thinking (With Tools)78.8015 / 15Thinking High (No Tools)+11.40

Coding and Software Engineer

Qwen3.8-27B 领先 1/1
评测项Qwen3.8-27BMuse Glimmer-30B分差
SWE-Bench Pro - Public61.7010 / 57Thinking (With Tools)51.2041 / 57Thinking High (With Tools)+10.50

General Knowledge

Qwen3.8-27B 领先 1/1
评测项Qwen3.8-27BMuse Glimmer-30B分差
HLE30.8088 / 181Thinking (No Tools)22117 / 181Thinking High (No Tools)+8.80

科学与综合推理

Qwen3.8-27B 领先 1/1
评测项Qwen3.8-27BMuse Glimmer-30B分差
GPQA Diamond89.2047 / 226Thinking (No Tools)83.5098 / 226Thinking High (No Tools)+5.70

规格对比

字段Qwen3.8-27BMuse Glimmer-30B
发布机构阿里巴巴Facebook AI研究实验室
发布时间2026-08-142026-08-10
模型类型推理大模型推理大模型
架构稠密模型稠密模型
参数规模270亿296亿
上下文长度256K128K+
最大输出128K暂无数据

小结

  • Qwen3.8-27B在以下类目领先:AI Agent - Tool Usage (2/2)、Multimodal Understanding (2/2)、Coding and Software Engineer (1/1)、General Knowledge (1/1)、科学与综合推理 (1/1)

7 个共同 benchmark 上,Qwen3.8-27B 平均高出 13.06 分。

单项差距最大的 benchmark:Terminal-Bench 2.1 — Qwen3.8-27B 73,Muse Glimmer-30B 51.70(分差 +21.30)。

本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。