DataLearner logo

GPT-6.1 Sol Benchmark Details

GPT-6.1 Sol currently shows benchmark results led by AA-Briefcase (—, score 1564.21), HealthBench Consensus (length-adjusted) (—, score 96), MMMU-Pro (—, score 85.95).

Benchmark Results

GPT-6.1 Sol

Benchmark Results

Thinking
Tool usage

Knowledge Exams

1 evaluations
Benchmark / mode
Score
Rank/total
HLE
Max
52.92
—

Long Reasoning

1 evaluations
Benchmark / mode
Score
Rank/total
83
—

Repository Engineering

1 evaluations
Benchmark / mode
Score
Rank/total
DeepSWE
HighTools
75.20
—

Desktop Workflows

1 evaluations
Benchmark / mode
Score
Rank/total
OSWorld 2.0
MaxTools
71.40
—

Office & Business

2 evaluations
Benchmark / mode
Score
Rank/total
AA-Briefcase
MaxTools
1564.21
—
AutomationBench
MediumTools
31.70
—

Visual Understanding

1 evaluations
Benchmark / mode
Score
Rank/total
85.95
—

Scientific Reasoning

1 evaluations
Benchmark / mode
Score
Rank/total
31.71
—

Scientific Computing

2 evaluations
Benchmark / mode
Score
Rank/total
54.17
—

Documents & Charts

1 evaluations
Benchmark / mode
Score
Rank/total
31
—

Agentic Development

1 evaluations
Benchmark / mode
Score
Rank/total
56.06
—

Medical Reasoning

5 evaluations
Benchmark / mode
Score
Rank/total

Exploitation

2 evaluations
Benchmark / mode
Score
Rank/total

Vulnerability Analysis

1 evaluations
Benchmark / mode
Score
Rank/total
78.80
—

Clinical Workflows

1 evaluations
Benchmark / mode
Score
Rank/total

Capability Indices

1 evaluations
Benchmark / mode
Score
Rank/total

Honesty & Factuality

1 evaluations
Benchmark / mode
Score
Rank/total
41.53
—
GPT-6.1 Sol Benchmark Results & Rankings | DataLearnerAI