DataLearner logo

Qwen3.8-27BvsQwen3.6-27B

Across 4 shared benchmarks, Qwen3.8-27B leads overall: Qwen3.8-27B wins 4, Qwen3.6-27B wins 0, with 0 ties and an average score difference of +5.70.

阿里巴巴
Qwen3.8-27B

阿里巴巴 · 2026-08-14 · Reasoning model

阿里巴巴
Qwen3.6-27B

阿里巴巴 · 2026-04-22 · Reasoning model

Qwen3.8-27B4 wins(100%)(0%)0 winsQwen3.6-27B

Benchmark scores

Grouped by capability, sorted by largest gap within each. 4 shared benchmarks.

Coding and Software Engineer

Qwen3.8-27B 2/2
BenchmarkQwen3.8-27BQwen3.6-27BDiff
SWE-Bench Pro - Public61.7010 / 57Thinking (With Tools)53.5036 / 57Thinking (With Tools)+8.20
LiveCodeBench90.306 / 124Thinking (No Tools)83.9020 / 124Thinking (No Tools)+6.40

General Evaluation

Qwen3.8-27B 1/1
BenchmarkQwen3.8-27BQwen3.6-27BDiff
GPQA Diamond89.2047 / 226Thinking (No Tools)87.8064 / 226Thinking (No Tools)+1.40

General Knowledge

Qwen3.8-27B 1/1
BenchmarkQwen3.8-27BQwen3.6-27BDiff
HLE30.8087 / 179Thinking (No Tools)24113 / 179Thinking (No Tools)+6.80

Specs

FieldQwen3.8-27BQwen3.6-27B
Publisher阿里巴巴阿里巴巴
Release date2026-08-142026-04-22
Model typeReasoning modelReasoning model
ArchitectureDenseDense
Parameters27B27B
Context length256K128K
Max output128K16K

Summary

  • Qwen3.8-27Bleads in:Coding and Software Engineer (2/2), General Evaluation (1/1), General Knowledge (1/1)

On average across the 4 shared benchmarks, Qwen3.8-27B scores 5.70 higher.

Largest single-benchmark gap: SWE-Bench Pro - Public — Qwen3.8-27B 61.70 vs Qwen3.6-27B 53.50 (+8.20).

Page generated from structured model, pricing and benchmark records. No real-time LLM is used to write the prose.