模型对比分析
逐项对比的深度分析:评测分差到底意味着什么,以及什么场景该选哪一个。
Claude Fable 5.1 / Fable 5 / Opus 5 与 GPT-5.6 Sol 四方对比:评测、价格与选型
四款模型共有的 4 项 0–100 量表评测里,Fable 5.1 平均 58.8 分居首,Opus 5 50.3、Fable 5 46.7、GPT-5.6 Sol 42.5;但 Fable 5.1 的价格是 Opus 5 的两倍、Sol 的 2.5 倍,而 Opus 5 在计算机操作(OSWorld 2.0 70.57 对 41.7)上大幅反超。
Claude Fable 5.1 相比 Fable 5 提升了什么?两代模型的评测数据与升级取舍
Fable 5.1 在双方共有的 5 项 0–100 量表评测中全部领先、平均分高 10.2 分,但增益极度集中——Terminal-Bench-Science 0.1 从 21.4 跳到 52.6,而知识密集型的 HLE 只提升 1.9 分。价格与规格完全没变。
HY-4(Hy4 preview)与 GLM-5.3 对比:770B 对 744B,两款国产 MoE 旗舰怎么选?
HY-4 与 GLM-5.3 的总参数分别为 770B 和 744B,激活参数分别为 49B 和 40B,规模与定位非常接近。当前 12 项共同评测中 GLM-5.3 领先 10 项,HY-4 则在 NL2Repo-Bench 与 Toolathlon-Verified 上小幅领先;前者已 GA,后者仍是 preview。














