DataLearner logo

GLM-4.5-Air Benchmark Details

GLM-4.5-Air currently shows benchmark results led by MATH-500 (5 / 44, score 98.10), AIME 2024 (15 / 62, score 89.40), Pinch Bench (14 / 38, score 85.70).

Benchmark Results

GLM-4.5-Air

Benchmark Results

Thinking
Tool usage

General Knowledge

2 evaluations
Benchmark / mode
Score
Rank/total
MMLU Pro
Thinking Mode
81.40
55 / 133
HLE
Thinking Mode
10.60
158 / 185

Other

1 evaluations
Benchmark / mode
Score
Rank/total
GPQA Diamond
Thinking Mode
75
171 / 270

Coding and Software Engineer

2 evaluations
Benchmark / mode
Score
Rank/total
LiveCodeBench
Thinking Mode
70.70
53 / 127
SWE-bench Verified
Thinking Mode
57.60
86 / 114

Math and Reasoning

2 evaluations
Benchmark / mode
Score
Rank/total
MATH-500
Thinking Mode
98.10
5 / 44
AIME 2024
Thinking Mode
89.40
15 / 62

AI Agent - Tool Usage

1 evaluations
Benchmark / mode
Score
Rank/total
Terminal-Bench
Thinking Mode
30
22 / 35

Claw-style Agent Evaluation

1 evaluations
Benchmark / mode
Score
Rank/total
Pinch Bench
Thinking ModeTools
85.70
14 / 38