DataLearner 标志
DE

DeepSeek-V4-Flash-Vision-Exp

预览版多模态大模型工具使用DeepSeek FlashDeepSeek V4

DeepSeek V4 Flash Vision Experimental

发布时间: 2026-08-21更新于: 2026-08-31浏览量: 1,211
在线体验GitHubHugging Face对比
模型参数
3050亿
上下文长度
1M
多语言支持
暂无数据
推理能力
暂无数据

DeepSeek-V4-Flash-Vision-Exp 于 2026 年 8 月 21 日上线 API,并于 8 月 31 日在官方 Hugging Face 账号开放约 305B 参数的权重、配置、编码与最小推理实现,采用 MIT License。配置披露 43 层、256 路由专家且每 token 选择 6 个专家的 DeepSeek V4 MoE,以及 32 层视觉编码器、DFlash、Hyper-Connections 和 DSpark。模型支持 1M 上下文、384K 输出,官方模型卡给出 11 项智能体/视觉评测。激活参数量、训练数据和知识截止日期仍未公布。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

DeepSeek-V4-Flash-Vision-Exp

模型基本信息

推理过程
支持
思考模式
思考水平 · 高 (High) (默认)常规模式思考水平 · 低 (Low)思考水平 · 最高 (Max)
上下文长度
1M tokens
最大输出长度
384K tokens
模型类型
多模态大模型
输入/输出模态
文本、图像 → 文本
发布时间
2026-08-21
模型文件大小
约 167.8 GB(48 个 safetensors 分片)
MoE架构
总参数 / 激活参数
3050亿 / 不适用
知识截止
暂无数据
DeepSeek-V4-Flash-Vision-Exp

开源和体验地址

代码开源状态
预训练权重开源
MIT License- 免费商用授权
GitHub 源码
暂无
在线体验
暂无
DeepSeek-V4-Flash-Vision-Exp

官方介绍与博客

DataLearnerAI博客
暂无
DeepSeek-V4-Flash-Vision-Exp

API接口信息

接口速度
暂无数据
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
off_peak
类型适用条件输入输出
文本-$0.220/ 1M$0.660/ 1M
peak
类型适用条件输入输出
文本-$0.440/ 1M$1.32/ 1M
缓存定价Prompt缓存
类型有效期写入读取
文本-$0.0070/ 1M

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

DeepSeek-V4-Flash-Vision-Exp

评测结果

DeepSeek-V4-Flash-Vision-Exp 当前已收录的代表性评测结果包括 Toolathlon-Verified(3 / 10,得分 75.90)、Terminal-Bench 2.1(15 / 49,得分 83.90)、NL2Repo-Bench(5 / 12,得分 57.70)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式

AI Agent - 工具使用

共 3 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 2.1
最高工具
83.90
15 / 49
75.90
3 / 10
CyberGym
最高工具
75.30
5 / 5

编程与软件工程

共 3 项评测
评测名称 / 模式
得分
排名/总数
DSBench-Hard
最高工具
63.60
1 / 1
DeepSWE
最高工具
59.30
17 / 34
NL2Repo-Bench
最高工具
57.70
5 / 12

Agent能力评测

共 2 项评测
评测名称 / 模式
得分
排名/总数
ApexBench
最高工具
36.50
1 / 1
Agents' Last Exam
最高工具
27.30
6 / 14

生产力知识

共 1 项评测
评测名称 / 模式
得分
排名/总数
AutomationBench
最高工具
25.70
14 / 16

多模态理解

共 2 项评测
评测名称 / 模式
得分
排名/总数
Chartography
最高工具
64.30
2 / 2
ZeroBench Main
最高工具
35
2 / 3

和其他模型对比

DeepSeek-V4-Flash-Vision-Exp

发布机构

DeepSeek V4 Flash Vision Experimental

模型解读

发布与开放权重

DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek-V4 家族首个实验性多模态模型。DeepSeek 于 2026 年 8 月 21 日先在 API 平台发布该模型,API ID 为 deepseek-v4-flash-vision-exp;2026 年 8 月 31 日又在官方 Hugging Face 账号发布可下载权重、配置、分词器、提示编码和最小 PyTorch 推理实现,并采用 MIT License。模型支持文本与图像输入、文本输出,面向图片描述、截图文字读取、图表分析、编程和视觉智能体任务。实验性定位仍然保留,因此生命周期继续标记为 Preview,而不是 GA。


参数与 MoE 架构

Hugging Face 对官方权重的统计约为 305B 总参数;官方没有单独公布每 token 激活参数量,因此该字段保持未知。配置文件显示语言骨干为 43 层 DeepSeek V4 MoE,隐藏维度 4,096,64 个注意力头、1 个 KV 头;共有 256 个路由专家和 1 个共享专家,每个 token 选择 6 个路由专家。模型卡明确列出 DFlash attention、MoE、Hyper-Connections 与 DSpark forward path;配置还包含 3 个 hash layer 和 3 个 next-token prediction layer。

视觉模块为 32 层、1,024 维、16 头的视觉编码器,MLP 中间维度 2,816,patch size 为 14,下采样比例为 3,每张图片最多映射为 384 个视觉 token。官方权重索引包含 48 个 safetensors 分片,总大小 167,811,372,792 bytes(约 167.8 GB / 156.3 GiB)。主配置记录 FP8 动态量化方案;参考转换脚本另支持将专家权重转换为 FP4。以上是仓库配置事实,不等同于官方公布的最低部署硬件要求。


上下文、输出与 API 能力

官方 API 上下文窗口为 1,000,000 tokens,最大输出为 384,000 tokens。模型支持非思考与思考模式,默认启用思考;DataLearner 按官方适配器保留 off、low、high、max 四档推理强度,默认 high。API 支持 JSON 输出、工具调用、Chat Completions、Responses API、Anthropic 兼容 Messages API,以及 Beta 阶段的 Chat Prefix Completion;FIM 补全不受支持。官方公布的并发上限为 2,500。


视觉输入与限制

JPEG、PNG、GIF 和 WebP 图片可通过 Base64 Data URL、外部 URL 或 Files API 提交。detail=low 会缩放到 512×512,highoriginal 保留原始细节,auto 当前等同 original。每张图片最多消耗 384 个输入 token,多图分别计算;图像 token 按普通输入 token 计费。

外部图片 URL 最长 8,192 字符;HTTP 请求体最大 48 MiB。单张 Base64 或外部 URL 图片最大 32 MiB,Files API 单文件最大 64 MiB;单次请求最多 600 张图片。不使用 file_id 时图片总大小上限为 64 MiB,包含 file_id 时可达 200 MiB。单边通常不超过 8,192 像素,15 张或更多图片时降为 4,096 像素。Chat Completions 与 Anthropic 兼容接口只接受 user 消息中的图片;Responses API 还支持官方指南列出的 developer 消息与工具输出图片。


官方评测

官方模型卡共公布 11 项成绩:Terminal-Bench 2.1 83.9、NL2Repo 57.7、CyberGym 75.3、DeepSWE 59.3、Toolathlon-Verified 75.9、DSBench-Hard 63.6、AutomationBench (Public) 25.7、ApexBench (Pass@1) 36.5、Agents' Last Exam 27.3、Chartography 64.3、ZeroBench (Pass@5) 35.0。文本智能体评测使用 DeepSeek Harness minimal、max reasoning effort、temperature=1.0top_p=0.95。这些是厂商模型卡成绩,不应与不同 Agent 脚手架或运行设置的第三方成绩直接等同。


API 价格

价格均为美元/百万 token。非高峰:缓存命中输入 $0.007、缓存未命中输入 $0.22、输出 $0.66;高峰:缓存命中输入 $0.014、缓存未命中输入 $0.44、输出 $1.32。高峰时段为周一至周五 01:00–04:00 UTC 与 06:00–10:00 UTC,其余时间为非高峰。图片转换后的 token 按对应输入价格计费。


开放范围与仍未知字段

官方仓库提供权重、配置、编码代码和最小推理实现,MIT 许可证允许使用、修改、分发和商业使用。模型卡没有公布独立技术报告、训练数据、训练算力、知识截止日期或激活参数量;DataLearner 对这些字段继续留空,不从普通 DeepSeek-V4-Flash 或其他 V4 版本推断。


官方来源

DeepSeek-V4-Flash-Vision-Exp

常见问题

DeepSeek-V4-Flash-Vision-Exp 已经正式可用并开放权重了吗?

是。API 于 2026 年 8 月 21 日上线,DeepSeek 又于 8 月 31 日通过官方 Hugging Face 账号发布可下载权重和参考代码。模型仍保留实验性 Preview 定位。

模型采用什么许可证,参数规模是多少?

官方仓库采用 MIT License,Hugging Face 对权重的统计约为 305B 总参数。DeepSeek 尚未公布每 token 激活参数量。

官方公开了哪些架构信息?

配置显示语言骨干是 43 层 DeepSeek V4 MoE,包含 256 个路由专家和 1 个共享专家,每 token 选择 6 个路由专家;还包括 DFlash、Hyper-Connections、DSpark 和 32 层视觉编码器。

上下文窗口和最大输出是多少?

官方 API 上下文窗口为 1,000,000 tokens,最大输出为 384,000 tokens。每张图片最多映射为 384 个输入 token。

可下载权重有多大?

官方索引包含 48 个 safetensors 分片,总大小 167,811,372,792 bytes,约 167.8 GB(156.3 GiB)。DeepSeek 没有公布最低部署硬件配置。

API 价格是多少?

非高峰每百万 tokens 的缓存命中输入、缓存未命中输入和输出分别为 $0.007、$0.22 和 $0.66;高峰分别为 $0.014、$0.44 和 $1.32。高峰只在周一至周五 01:00–04:00 UTC 与 06:00–10:00 UTC。

官方公布了多少项评测?

模型卡公布 11 项文本与多模态智能体成绩,包括 Terminal-Bench 2.1、CyberGym、DeepSWE、Toolathlon-Verified、ApexBench、Chartography 和 ZeroBench。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码