DataLearner 标志
QW

Qwen3-VL-4B-Thinking

推理大模型Qwen3

Qwen3-VL-4B-Thinking

发布时间: 2025-10-15更新于: 2025-10-15浏览量: 679
模型参数
44.4亿
上下文长度
256K
多语言支持
暂无数据
推理能力
3/5

Qwen3-VL-4B-Thinking 是由 阿里巴巴 发布的 AI 模型,发布时间为 2025-10-15,定位为 推理大模型,参数规模约为 44.4亿,上下文长度为 256K,采用 Apache 2.0 许可。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Qwen3-VL-4B-Thinking

模型基本信息

推理过程
支持
思考模式
常规模式 (默认)思考模式
上下文长度
256K tokens
最大输出长度
暂无数据
模型类型
推理大模型
输入/输出模态
文本、图像、视频 → 文本
发布时间
2025-10-15
模型文件大小
暂无数据
MoE架构
总参数 / 激活参数
44.4亿 / 不适用
知识截止
暂无数据
Qwen3-VL-4B-Thinking

开源和体验地址

代码开源状态
预训练权重开源
Apache 2.0- 免费商用授权
在线体验
暂无
Qwen3-VL-4B-Thinking

官方介绍与博客

DataLearnerAI博客
暂无
Qwen3-VL-4B-Thinking

API接口信息

接口速度
3/5
暂无公开的 API 定价信息。
Qwen3-VL-4B-Thinking

发布机构

Qwen3-VL-4B-Thinking

模型解读

模型简介与发布

Qwen3-VL-4B-Thinking 是阿里巴巴 Qwen 团队在 Qwen3-VL 系列下发布的推理增强多模态模型,支持图像/视频作为输入并输出文本。4B/8B(Instruct 与 Thinking)于 2025-10-15 公告上线。

架构与规格

  • 上下文:原生 256K,可扩展至 1M。
  • 关键组件:Interleaved-MRoPE(时序与二维空间位置编码)、DeepStack(多层 ViT 特征融合)、Text-Timestamp 对齐以强化长视频时序定位。
  • 许可:Apache-2.0。

核心能力与模态

覆盖 OCR(32 种语言)、版面/结构化文档理解、空间/遮挡关系与 2D/3D grounding、长视频事件索引与定位、GUI 元素识别与步骤性交互等。

访问方式

  • GitHub:提供 Qwen3-VL 代码与使用示例。
  • Hugging Face:提供本模型权重与模型卡。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码