Claude Haiku 5.5 与 GLM-5.3-Flash 都可以纳入高频 API 调用的选型清单。站内记录 Haiku 5.5 发布于 2026 年 10 月 7 日,GLM-5.3-Flash 发布于 2026 年 8 月 26 日。本文数据核对于 2026 年 10 月 8 日,重点比较当前可核验的 API 价格、上下文与输出规格,并说明评测数据的限制。
一句话结论
短提示调用可以先验证 Haiku 5.5 的成本优势,超过 100K tokens 的长提示则需要重新计算;能力高低目前不能由本站共同评测判定。 Haiku 5.5 的普通文本输入和输出标价在 100K 提示长度边界发生变化,不能只看最低档报价就认定所有长文任务都便宜。
评测数据现状
当前对比接口没有返回 Haiku 5.5 与 GLM-5.3-Flash 可共同展示的评测项目。这表示当前收录数据不足以形成成对的数值比较,不表示 Haiku 得分为零,也不表示两者能力相同。本页不沿用 Haiku 4.5 的评测分数,不把其他 Claude 型号的成绩移到 Haiku 5.5 名下。
在共同评测补齐前,不给出谁在推理、代码、中文或工具调用上领先的结论。实际选型可以先使用同一批业务样本、相同验收规则和可记录的运行配置,观察任务成功率、引用准确率、工具调用正确率、延迟及最终账单。新增模型的版本号和发布时间本身也不构成能力优势证据。
API 价格:先看提示长度,再看缓存
以下为原厂供应商文本 API 报价,单位统一为美元/100 万 tokens。普通输入指未命中缓存,缓存命中输入单独列出;这里不混入 batch 折扣,也不把缓存写入价格当作普通输入价格。
Haiku 的输入、输出与缓存命中价格都按提示长度分档。100K 边界指每次请求的提示长度,不是某个账户累计消费的 tokens;同一请求即便输出较短,也应按适用的提示长度档核算。Haiku 的 1M 上下文窗口不意味着整个窗口都适用 0.1 美元的输入价。
GLM 使用首发促销结束后的标准标价,未使用已经结束的首发优惠。
在提示长度 ≤100K 时,Haiku 普通输入标价低于 GLM-5.3-Flash,输出标价与 GLM 相同。超过 100K 时,Haiku 普通输入与输出标价均高于表中 GLM-5.3-Flash 档位。因此,大批量短请求和长文请求可能得出不同成本结论;缓存复用也应单独核算,不能只比较普通输入价。
举例,累计处理 100 万普通输入 tokens 与 100 万输出 tokens,如果 Haiku 的每次请求均处于 ≤100K 提示档,标价成本为 0.6 美元;如果均处于 >100K 档,则为 3 美元。GLM-5.3-Flash 按表中档位为 0.65 美元。这只是等量 tokens 的费用例子,未计缓存、批处理及其他费用;实际任务的推理消耗、重试和输出长度可能不同,应以完成同一任务的最终成本判断。
上下文与最大输出
站内两款模型的上下文规格均为 1M;Haiku 5.5 最大输出为 128,000 tokens,GLM-5.3-Flash 为 128,000 tokens。两者的最大输出规格一致。 上下文或输出容量表示长度上限,不保证长文本利用率、事实准确率或生产任务成功率。
GLM-5.3-Flash 的权重许可记录为 MIT;本次接口中 Haiku 5.5 的权重许可字段未给出明确名称,所以这里不替它补写许可结论。自行部署时还应核对实际权重与许可文本,并计算硬件、量化和运维投入。
怎么选
以短提示、普通输入为主的 API 应用,可以先试跑 Haiku 5.5,再与 GLM-5.3-Flash 比较质量和单次成功成本。提示经常超过 100K 时,应先按 Haiku 长提示档重新计算费用,同时检查缓存命中与输出长度。GLM 的标准价格可以作为长提示成本评估的对照。
已有应用迁移时,保留原模型的真实样本作为基线,验证提示词、工具协议、质量、延迟与失败重试。当前没有共同评测支持直接宣布能力胜负,价格与规格比较提供的是试用顺序和预算依据,最终决定仍应建立在业务验收结果上。

