DataLearner 标志
SP

Spark-X2.5-4B

推理大模型工具使用

Spark-X2.5-4B

发布时间: 2026-09-01浏览量: 3
模型参数
41.1亿
上下文长度
1M
多语言支持
200+ 种语言
推理能力
3/5

Spark-X2.5-4B 是科大讯飞全资子公司词元星火(XHToken / SparkLLM)于 2026-09-01 以 Apache 2.0 开源的端侧通用大模型,参数量约 41.1 亿(BF16 约 7.7GB)。模型采用 3 层滑动窗口注意力 + 1 层全注意力的混合注意力架构,原生支持 1,048,576 tokens(1M)上下文,官方称是首批原生支持百万级上下文的端侧开源模型,支持 200 种以上语言。预训练约 20 万亿 tokens,后训练经大规模强化学习与 MOPD 多教师蒸馏,主打智能体、编程、数学与指令跟随能力,官方评测中多项领先同量级开源模型。权重已上架 Hugging Face、ModelScope、Ollama 等平台,API 在讯飞星辰 MaaS 限时免费。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Spark-X2.5-4B

模型基本信息

推理过程
支持
思考模式
思考模式 (默认)常规模式
上下文长度
1M tokens
最大输出长度
暂无数据
模型类型
推理大模型
输入/输出模态
文本 → 文本
发布时间
2026-09-01
模型文件大小
约 7.7GB(BF16 safetensors)
MoE架构
总参数 / 激活参数
41.1亿 / 不适用
知识截止
暂无数据
Spark-X2.5-4B

开源和体验地址

代码开源状态
预训练权重开源
Apache 2.0- 免费商用授权
在线体验
暂无
Spark-X2.5-4B

官方介绍与博客

官方论文
暂无
DataLearnerAI博客
暂无
Spark-X2.5-4B

API接口信息

接口速度
5/5
暂无公开的 API 定价信息。
Spark-X2.5-4B

评测结果

Spark-X2.5-4B 当前已收录的代表性评测结果包括 IF Bench(10 / 35,得分 75)、GPQA(6 / 17,得分 67.40)、τ²-Bench(22 / 44,得分 75.10)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用
联网能力

综合评估

共 2 项评测
评测名称 / 模式
得分
排名/总数
GPQA
思考模式
67.40
6 / 17
HLE
思考模式
12.30
157 / 189

编程与软件工程

共 4 项评测
评测名称 / 模式
得分
排名/总数
SWE-bench Multilingual
思考模式工具
53.30
28 / 28
SWE-Bench Pro - Public
思考模式工具
44.40
51 / 60
SWE-bench Verified
思考模式工具
41.60
103 / 115
SciCode
思考模式
34.70
15 / 15

Agent能力评测

共 4 项评测
评测名称 / 模式
得分
排名/总数
τ²-Bench
思考模式工具
75.10
22 / 44
Workspace-Bench
思考模式工具
31.20
1 / 1
τ³-Bench
思考模式工具
30.40
1 / 1
VitaBench 2.0
思考模式工具
25.20
1 / 1

指令跟随

共 2 项评测
评测名称 / 模式
得分
排名/总数
IFEval
思考模式
93
1 / 1
IF Bench
思考模式
75
10 / 35

AI Agent - 信息收集

共 1 项评测
评测名称 / 模式
得分
排名/总数
BrowseComp
思考模式工具联网
40.90
49 / 55

数学推理

共 4 项评测
评测名称 / 模式
得分
排名/总数
Gaokao 2026
思考模式
133.40
1 / 1
AIME 2026
思考模式
90.70
15 / 20
HMMT Feb 2026
思考模式
81.20
1 / 1
IMO-AnswerBench
思考模式
74.20
22 / 24

长上下文能力

共 1 项评测
评测名称 / 模式
得分
排名/总数
AA-LCR
思考模式
56.30
27 / 28

AI Agent - 工具使用

共 3 项评测
评测名称 / 模式
得分
排名/总数
BFCL-V4
思考模式工具
65.10
1 / 1
MCP-Atlas
思考模式工具
54.60
38 / 41
MCPMark
思考模式工具
14.20
1 / 1
Spark-X2.5-4B

发布机构

Spark-X2.5-4B

模型解读

发布背景与定位

Spark-X2.5-4B 是科大讯飞全资子公司词元星火(Hugging Face / GitHub 组织名 XHToken,对外亦称 SparkLLM)于 2026 年 9 月 1 日开源的端侧通用大模型,与同批发布的 Spark-X2.5-1.7B 构成 Spark-X2.5 系列。官方将其定位为「面向端侧的通用智能体模型」,强调在 4B 这一可本地部署的参数量级上覆盖对话、写作、翻译、推理、编程、工具调用与智能体工作流等日常任务。模型在华为昇腾集群上完成训练,官方称训练与推理链路基于全国产算力平台。

架构与技术规格

Spark-X2.5-4B 采用混合注意力架构:每 3 层滑动窗口注意力(SWA)搭配 1 层全注意力,以此在长上下文下压低计算开销与 KV Cache 占用。公开的 config.json 显示模型共 36 层、隐藏层维度 2560、中间层 10240、16 个注意力头与 4 个 KV 头(GQA)、head_dim 256,滑动窗口大小 512,全注意力层与滑动窗口层使用不同的 RoPE 参数(partial_rotary_factor 分别为 0.25 与 1.0),词嵌入与输出层共享权重。Hugging Face 权重为 BF16 格式,参数量 4,112,079,360(约 41.1 亿),文件体积约 7.7GB。原生上下文窗口 1,048,576 tokens(1M),官方称这是首批原生支持百万级上下文的端侧开源模型,并宣称支持 200 种以上语言。

训练方法

预训练语料约 20 万亿 tokens,覆盖网页、图书、学术出版物、代码与百科材料,官方针对数学、逻辑、代码等高价值领域做了数据配比实验。长上下文能力通过一个独立的训练阶段获得,该阶段使用数千亿 tokens,序列长度扩展至 1M。后训练先做监督微调建立指令跟随与结构化生成能力,再在语言理解、推理、编程、工具增强的智能体行为与指令跟随等多个能力域上做大规模强化学习,得到一组领域专精的教师策略,最后通过官方称为 MOPD 的方法蒸馏合并为单一可部署模型。

官方评测成绩

官方模型卡将 Spark-X2.5-4B 与 Qwen3.5-9B/4B/2B、Gemma4-12B/E4B/E2B 等同量级端侧模型对比,全部评测在思考模式下进行。智能体方向:BFCL-V4 65.1、τ²-bench 75.1、τ³-bench 30.4、MCP-Atlas 54.6、MCPMark 14.2、Workspace Bench 31.2、VitaBench 2.0 25.2、BrowseComp 40.9。代码方向:SWE-Bench Pro 44.4、SWE-Bench Verified 41.6、SWE-Bench Multilingual 53.3、SciCode 34.7。数学方向:Gaokao 2026 得 133.4(五套 2026 年高考数学试卷,每套满分 150)、AIME 2026 90.7、HMMT Feb 2026 81.2、IMO-AnswerBench 74.2。通用与知识方向:IFEval 93.0、IFBench 75.0、AA-LCR 56.3、HLE 12.3、GPQA 67.4。官方口径下,模型在 τ³-bench、MCP-Atlas、MCPMark、Workspace Bench、VitaBench 2.0、BrowseComp、SWE-Bench Pro、SWE-Bench Multilingual、AIME 2026、HMMT Feb 2026、IMO-AnswerBench、IFBench 等项领先全部对比模型;而在 SWE-Bench Verified、GPQA、HLE、AA-LCR、τ²-bench、Gaokao 2026、SciCode、IFEval 等项仍落后于参数量更大的 Qwen3.5-9B 或 Gemma4-12B。以上均为厂商自测口径,独立第三方复测结果待跟进。

部署与访问方式

权重、代码与部署文档已在 Hugging Face 与 GitHub 开放,同时上架 ModelScope、Modelers、Ollama、SCNet、AtomGit 等平台。官方提供 vLLM、SGLang、llama.cpp、MLX 的部署示例,并支持 Ollama 与 LM Studio 快速运行,微调推荐使用 LLaMA-Factory;硬件方面覆盖 NVIDIA、华为昇腾、海光、后摩智能等平台。模型深度适配 Codex、Claude Code、OpenClaw、Hermes 等智能体框架。思考模式在 chat template 中默认开启,可通过 chat_template_kwargs: {"enable_thinking": false} 关闭;官方推荐采样参数为 temperature=1.0、top_p=0.95、top_k=-1。API 已在讯飞星辰 MaaS 平台上线,官方公告为限时免费,未公布长期定价。

许可协议

Spark-X2.5 系列采用 Apache 2.0 许可,权重与代码均可免费商用。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码