DataLearner 标志
MI

MiMo-V3

已官宣基础大模型

Xiaomi MiMo-V3

发布时间: 2026-10-23更新于: 2026-09-23浏览量: 1
在线体验GitHubHugging Face对比
模型参数
暂无数据
上下文长度
暂无数据
多语言支持
暂无数据
推理能力
3/5

小米 MiMo 团队于 2026 年 9 月确认 MiMo-V3 将采用 HySparse2 架构;目前公布的是架构论文,模型本身尚未发布,参数、上下文、开放方式、价格和模型评测均未确认。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

MiMo-V3

模型基本信息

推理过程
暂无数据
思考模式
不支持思考模式
上下文长度
暂无数据
最大输出长度
暂无数据
模型类型
基础大模型
输入/输出模态
暂无数据
发布时间
2026-10-23
模型文件大小
暂无数据
MoE架构
未公布
总参数 / 激活参数
未公布 / 未公布
知识截止
暂无数据
MiMo-V3

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无
Hugging Face
暂无
在线体验
暂无
MiMo-V3

官方介绍与博客

MiMo-V3

API接口信息

接口速度
3/5
暂无公开的 API 定价信息。
MiMo-V3

发布机构

Xiaomi MiMo-V3

模型解读

MiMo-V3 是小米 MiMo 团队公开提及的下一代模型。截至 2026 年 9 月 23 日,团队公布了计划用于该模型的 HySparse2 注意力架构与论文,但尚未发布 MiMo-V3 模型、权重、API 或模型卡;本页按已公布但未发布收录。

已公布的架构研究

HySparse2 采用两级 KV 共享:跨解码器的全注意力层从自解码器隐藏状态构建键值缓存,混合块中的稀疏层复用前一全注意力层的 KV 缓存和选择索引。论文还介绍了 token 级稀疏选择和强制保留最近 token 的窗口。小米研究人员称,与 MiMo-V2.6 的混合滑动窗口注意力架构相比,HySparse2 在 100 万 token 条件下的 prefill FLOPs 降低 5.02 倍、KV 缓存缩小 4.5 倍;这是架构实验结果,并非已发布 MiMo-V3 模型的评测成绩。论文中的 80B-A3B MoE 是架构实验模型,不代表 MiMo-V3 的参数规模。

发布状态

小米尚未公布 MiMo-V3 的发布日期、模型规格、支持模态、许可或 API 价格。本页的预计日期仅为目录占位,不是小米官方发布计划。来源:小米 MiMo 团队负责人公告HySparse2 论文

MiMo-V3

常见问题

Has Xiaomi released MiMo-V3?

No. Xiaomi has announced the planned HySparse2 architecture, but has not published a MiMo-V3 model, API, weights or release date.

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码