DataLearner 标志

Hy3 Pre 评测详情

Hy3 Pre 当前已收录的代表性评测结果包括 τ²-Bench - Telecom(51 / 264,得分 92.70)、GPQA Diamond(137 / 461,得分 86.70)、Terminal Bench Hard(82 / 244,得分 34.10)。本页还提供与 3 个竞品模型的对比,在有数据时会展示性能和价格视图。

评测结果

Hy3 Pre

评测结果

思考模式
工具使用

综合知识考试

共 2 项评测
评测名称 / 模式
得分
排名/总数
HLE
常规模式
7
446 / 568
HLE
开启思考
27.80
233 / 568

科学知识与推理

共 4 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
73.20
300 / 461
GPQA Diamond
开启思考
86.70
137 / 461
CritPt
常规模式
0.30
186 / 204
CritPt
开启思考
4.60
106 / 204

客服与业务流程

共 2 项评测
评测名称 / 模式
得分
排名/总数
τ²-Bench - Telecom
常规模式工具
67.50
143 / 264
τ²-Bench - Telecom
开启思考工具
92.70
51 / 264

指令与格式遵循

共 2 项评测
评测名称 / 模式
得分
排名/总数
IF Bench
常规模式
48
166 / 282
IF Bench
开启思考
63.10
110 / 282

自主开发与终端任务

共 2 项评测
评测名称 / 模式
得分
排名/总数
Terminal Bench Hard
常规模式工具
31.80
100 / 244
Terminal Bench Hard
开启思考工具
34.10
82 / 244

竞品对比

Hy3 Pre 与同类主流模型的评测得分对比

评测类别:
柱状图按当前筛选范围内每个模型在各评测中的最高分展示;百分制评测使用原始高度,超出 0-100 的评测按该评测内相对比例缩放,标签仍保留原始分数。

6 项可对比评测得分汇总。每个模型展示最佳得分,模式在分数下方标注。

评测项Hy3 Pre当前GLM 5.1Qwen3.6-Max-PreviewDeepSeek-V4-Flash
HLE
Accuracy
综合知识考试
27.80开启思考
52.30开启思考 | 工具
50.20开启思考 | 工具
51.50思考水平·高 | 工具
CritPt
Score
科学知识与推理
4.60开启思考
4.60开启思考
3.70开启思考
7.10思考水平·高
GPQA Diamond
Accuracy
科学知识与推理
86.70开启思考
86.20开启思考
90.40思考水平·高
89.40思考水平·高
τ²-Bench - Telecom
Accuracy
客服与业务流程
92.70开启思考 | 工具
97.70开启思考 | 工具
95.90开启思考 | 工具
95.60思考水平·高 | 工具
IF Bench
Accuracy
指令与格式遵循
63.10开启思考
76.30开启思考
76.60开启思考
79.20思考水平·高
Terminal Bench Hard
Accuracy
自主开发与终端任务
34.10开启思考 | 工具
43.20开启思考 | 工具
43.90开启思考 | 工具
38.60思考水平·高 | 工具

Hy3 Pre 与同类模型的标准 API 价格对比

按模型并排展示标准文本输入价与输出价;若存在超长上下文加价,仅保留阈值内标准价,并在下方说明适用范围。

数据来源:DataLearnerAI,展示默认供应商的标准文本价格。 · USD / 1M tokens

若存在上下文阈值,图中标准价仅适用于以下范围:

Qwen3.6-Max-Preview: 标准价适用于 <= 128
模型供应商标准输入标准输出标准价适用于
GLM 5.1
智谱AI$1.4 / 1M tokens$4.4 / 1M tokens—
Qwen3.6-Max-Preview
阿里巴巴$1.3 / 1M tokens$7.8 / 1M tokens<= 128
DeepSeek-V4-Flash
DeepSeek-AI$0.14 / 1M tokens$0.28 / 1M tokens—