GLM-5.3-Flash、Qwen3.8-Flash-Next 与 DeepSeek-V4-Flash-Vision-Exp 都在 2026 年 8 月发布,都把重点放在“更低推理成本下的编程、Agent 与多模态能力”。但三者并不是简单的同规格替代品:GLM 更偏综合上限与工具任务,DeepSeek 强调长上下文、长输出和分时价格,Qwen 则把激活参数压到 6B,并提供文本、图片与视频输入。
一句话结论
追求现有评测中的综合稳定性,优先看 GLM-5.3-Flash;需要 384K 超长输出和 DeepSeek API 分时低价,选 DeepSeek-V4-Flash-Vision-Exp;更看重较小激活参数、视频输入和开放权重部署,Qwen3.8-Flash-Next 更有吸引力。
三者都有成绩的评测
目前站内只有 3 项评测同时覆盖三个模型,因此不宜用简单平均分宣称绝对排名。
这三项呈现出一个很有意思的分工:GLM 在真实仓库级软件工程任务 DeepSWE 上领先;DeepSeek 在从需求生成完整仓库的 NL2Repo 和长程专业 Agent 任务上略胜;Qwen 在这三项中暂未取得第一,但 DeepSWE 只比 DeepSeek 低 0.6 分。
GLM-5.3-Flash:当前最均衡的工具与编程表现
GLM 与 DeepSeek 共有 6 项成绩,GLM 领先 4 项:AutomationBench 48.8 对 25.7、Chartography 78.0 对 64.3、DeepSWE 63.4 对 59.3、Terminal-Bench 2.1 为 84.3 对 83.9;DeepSeek 则在 NL2Repo(57.7 对 56.3)和 Agents' Last Exam(27.3 对 26.3)小幅领先。
GLM 与 Qwen 共有 5 项成绩,GLM 领先 4 项:DeepSWE、NL2Repo、Toolathlon-Verified 和 Agents' Last Exam;Qwen 在 CharXiv RQ 上以 90.6 对 89.4 胜出。就当前数据覆盖而言,GLM-5.3-Flash 是三者中最像“通用 Flash 主力”的一个。
Qwen3.8-Flash-Next:更小的激活规模与视频输入
Qwen3.8-Flash-Next 是 125B 总参数、6B 激活参数的 MoE,明显小于 GLM 的 320B/18B。它原生提供 256K 上下文,可扩展到 1M,最大输出 128K,并且是三者中唯一明确记录支持视频输入的模型。
Qwen 的优势不只是“小”:CharXiv RQ 90.6 是三者当前已录入的最高图表推理成绩。对于视频理解、图表分析、端侧或有限算力部署,它比单纯追逐综合平均分更值得关注。需要注意的是,其权重采用 Qwen Community License 1.0,并非标准 MIT,商用前应核对具体许可条件。
DeepSeek-V4-Flash-Vision-Exp:最长输出与分时低价
DeepSeek 的公开 API 规格是 1M 上下文、384K 最大输出,输出上限是另外两款 128K 的 3 倍。它在 NL2Repo 与 Agents' Last Exam 上取得三者最高分,Terminal-Bench 2.1 的 83.9 也只比 GLM 低 0.4 分。
价格采用分时策略:非高峰每百万 tokens 的缓存未命中输入为 0.22 美元、输出为 0.66 美元;高峰分别为 0.44 和 1.32 美元。它适合可调度到非高峰时段的大批量 Agent、代码生成和长输出任务。不过其总参数、激活参数、公开权重与许可信息目前仍未披露,本地部署可行性不能与 GLM、Qwen 直接等同。
规格、模态与价格
GLM 的发布优惠截至 2026 年 9 月 9 日 24:00(UTC+8),正式标价为输入 0.15 美元、输出 0.50 美元。因此当前价格很有竞争力,但长期成本比较应以优惠结束后的实际价格为准。
怎么选
选 GLM-5.3-Flash,如果你:
- 希望一款在编程、工具调用和视觉 Agent 评测中都比较稳定的默认模型
- 需要 1M 上下文、开放权重和标准 MIT License
- 当前能够利用发布期 API 优惠
选 Qwen3.8-Flash-Next,如果你:
- 需要视频输入或重视图表、视觉推理能力
- 更看重 125B 总参数、6B 激活参数带来的部署与推理效率
- 可以接受 Qwen Community License 1.0,并愿意自行部署开放权重
选 DeepSeek-V4-Flash-Vision-Exp,如果你:
- 需要远高于 128K 的单次输出上限
- 工作负载可以安排在非高峰时段,以利用更低 API 价格
- 更重视 NL2Repo、长程 Agent 表现,而不要求立即获得公开权重
数据说明:评测分数来自 DataLearner 当前收录的官方发布结果,并按各模型已有的最高强度工具模式展示。不同基准的任务、工具、上下文与采样条件并不完全一致;缺少某项成绩只表示站内尚未收录,不能直接推断模型不具备该能力。


