Qwen3.8-27BvsMuse Glimmer-30B
在 7 个共同 benchmark 中,Qwen3.8-27B 整体领先:Qwen3.8-27B 领先 7 项,Muse Glimmer-30B 领先 0 项,持平 0 项,平均分差 +13.06。
Qwen3.8-27B
阿里巴巴 · 2026-08-14 · 推理大模型
Muse Glimmer-30B
Facebook AI研究实验室 · 2026-08-10 · 推理大模型
Qwen3.8-27B7 项(100%)(0%)0 项Muse Glimmer-30B
评测分数
按能力类目分组,每组内按分差大小排列;共 7 项。
AI Agent - Tool Usage
Qwen3.8-27B 领先 2/2| 评测项 | Qwen3.8-27B | Muse Glimmer-30B | 分差 |
|---|---|---|---|
| Terminal-Bench 2.1 | 7329 / 44Thinking (With Tools) | 51.7044 / 44Thinking High (With Tools) | +21.30 |
| OSWorld-Verified | 84.303 / 26Thinking (With Tools) | 65.9020 / 26Thinking High (With Tools) | +18.40 |
Multimodal Understanding
Qwen3.8-27B 领先 2/2| 评测项 | Qwen3.8-27B | Muse Glimmer-30B | 分差 |
|---|---|---|---|
| OmniDocBench | 91.101 / 3Thinking (No Tools) | 75.803 / 3Thinking High (No Tools) | +15.30 |
| CharXiv RQ | 90.202 / 15Thinking (With Tools) | 78.8015 / 15Thinking High (No Tools) | +11.40 |
Coding and Software Engineer
Qwen3.8-27B 领先 1/1| 评测项 | Qwen3.8-27B | Muse Glimmer-30B | 分差 |
|---|---|---|---|
| SWE-Bench Pro - Public | 61.7010 / 57Thinking (With Tools) | 51.2041 / 57Thinking High (With Tools) | +10.50 |
General Knowledge
Qwen3.8-27B 领先 1/1| 评测项 | Qwen3.8-27B | Muse Glimmer-30B | 分差 |
|---|---|---|---|
| HLE | 30.8088 / 181Thinking (No Tools) | 22117 / 181Thinking High (No Tools) | +8.80 |
科学与综合推理
Qwen3.8-27B 领先 1/1| 评测项 | Qwen3.8-27B | Muse Glimmer-30B | 分差 |
|---|---|---|---|
| GPQA Diamond | 89.2047 / 226Thinking (No Tools) | 83.5098 / 226Thinking High (No Tools) | +5.70 |
规格对比
| 字段 | Qwen3.8-27B | Muse Glimmer-30B |
|---|---|---|
| 发布机构 | 阿里巴巴 | Facebook AI研究实验室 |
| 发布时间 | 2026-08-14 | 2026-08-10 |
| 模型类型 | 推理大模型 | 推理大模型 |
| 架构 | 稠密模型 | 稠密模型 |
| 参数规模 | 270亿 | 296亿 |
| 上下文长度 | 256K | 128K+ |
| 最大输出 | 128K | 暂无数据 |
小结
- Qwen3.8-27B在以下类目领先:AI Agent - Tool Usage (2/2)、Multimodal Understanding (2/2)、Coding and Software Engineer (1/1)、General Knowledge (1/1)、科学与综合推理 (1/1)
7 个共同 benchmark 上,Qwen3.8-27B 平均高出 13.06 分。
单项差距最大的 benchmark:Terminal-Bench 2.1 — Qwen3.8-27B 73,Muse Glimmer-30B 51.70(分差 +21.30)。
本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。