为什么值得直接比较
HY-4(线上型号为 Hy4 preview)与 GLM-5.3 都是面向复杂推理、编程和 Agent 场景的国产大规模 MoE 模型。HY-4 总参数 770B、每 token 激活 49B;GLM-5.3 总参数 744B、激活 40B。两者的参数规模和计算量级足够接近,这组对比比单纯跨尺寸比较更能反映模型训练与 Agent 能力的差异。
当前共同评测的结果
DataLearner 当前收录了 12 项两者都参加的评测。按各自公开的工具增强高档结果比较,GLM-5.3 在 10 项中领先,HY-4 在 2 项中领先。GLM-5.3 的优势主要出现在长程软件工程、自动化与综合 Agent 任务;HY-4 在仓库级代码生成和工具调用评测上保留了小幅优势。
怎么选
- 如果更看重当前评测覆盖、软件工程与 Agent 综合表现,以及正式发布状态,GLM-5.3 是更稳妥的选择。
- 如果更关注接近 1.05M 的上下文、仓库级生成、工具调用表现,或希望使用腾讯已公布的 API 价格进行成本测算,可以优先测试 HY-4。
- HY-4 仍处于 preview 阶段,而两边的分数来自各自公开配置,并非同一推理预算下的独立复测;实际选型仍应使用自己的任务集、延迟和成本约束做 A/B 测试。

