DataLearner 标志
GE

Gemma 3 - 12B (IT)

基础大模型GemmaGemma 3

Gemma 3 - 12B (IT)

发布时间: 2025-03-12更新于: 2026-07-17 23:18:32.4281,895
在线体验GitHubHugging FaceCompare
模型参数
120亿
上下文长度
128K
中文支持
支持
推理能力

Gemma 3 - 12B (IT) 是Google Deep Mind于 2025-03-12 发布的基础大模型。支持文本、图像输入和文本输出,上下文窗口为 128K,主要能力包括多语言。页面已收录官方资料、API 定价、公开评测,便于核对规格和使用成本。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Gemma 3 - 12B (IT)

模型基本信息

推理过程
不支持
思考模式
不支持思考模式
上下文长度
128K tokens
最大输出长度
暂无数据
模型类型
基础大模型
输入/输出模态
文本、图像 → 文本
发布时间
2025-03-12
模型文件大小
2GB
MoE架构
总参数 / 激活参数
120亿 / 不涉及
知识截止
暂无数据
Gemma 3 - 12B (IT)

开源和体验地址

代码开源状态
预训练权重开源
Gemma Terms of Use- 免费商用授权
GitHub 源码
暂无GitHub开源地址
在线体验
暂无在线体验地址
Gemma 3 - 12B (IT)

官方介绍与博客

DataLearnerAI博客
暂无介绍博客
Gemma 3 - 12B (IT)

API接口信息

接口速度
暂无数据
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-$0.040/ 1M$0.130/ 1M
Gemma 3 - 12B (IT)

评测结果

Gemma 3 - 12B (IT) 当前已收录的代表性评测结果包括 MATH(9 / 42,得分 83.80)、MMLU Pro(110 / 132,得分 60.60)、GPQA Diamond(172 / 187,得分 40.90)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式

综合评估

共 2 项评测
评测名称 / 模式
得分
排名/总数
60.60
110 / 132
40.90
172 / 187

数学推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
83.80
9 / 42

常识问答

共 1 项评测
评测名称 / 模式
得分
排名/总数
6.30
46 / 47

编程与软件工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
24.60
123 / 123

和其他模型对比

暂时没有为该模型整理的相关对比页面。

想自定义其他组合?打开对比工具

Gemma 3 - 12B (IT)

发布机构

Gemma 3 - 12B (IT)

模型解读

Gemma 3 - 12B(IT)是Google开源的120亿参数的第三代多模态大模型。IT后缀表明这是一个经过指令微调的版本,即insturction fine-tuned。


关于Gemma 3系列详细介绍参考: https://www.datalearner.com/blog/1051741769941194 


Gemma3-12B 是 Google DeepMind 最新发布的 Gemma 3 系列模型之一,相较于 4B 版本,它在参数规模、计算能力和任务表现上进一步提升,同时保持了较好的计算效率。该模型支持 128K tokens 的长上下文处理,集成了 417M 参数的视觉编码器,并采用 知识蒸馏 进行优化,在文本生成、多模态任务和推理能力上展现出优异的性能。


模型架构与设计

  • 解码器结构与注意力机制 采用 解码器 Transformer 架构,引入 Grouped-Query Attention (GQA),结合 QK-norm 以优化注意力分布,提高计算稳定性。
  • 局部与全局注意力层交替 采用 5:1 的局部/全局注意力交替 设计,减少 KV 缓存占用,使长文本推理更高效。
  • 视觉模块 内置 417M 参数的 SigLIP 视觉编码器,支持图像输入,可用于 OCR、图文对齐等任务。

训练细节

  • 知识蒸馏:从更大模型(如 27B 版本)学习,提高文本理解和生成能力。
  • 训练数据:使用 10T tokens 进行训练,包含大规模多语言文本和图像数据。
  • 训练硬件:在 TPUv4 平台 上训练,采用 6144 个 TPU,16 数据切分、16 序列切分、24 副本。

参数配置

模型版本视觉编码器参数嵌入参数非嵌入参数上下文长度
Gemma3‑4B417M675M3209M128K tokens
Gemma3‑12B417M1012M10759M128K tokens
Gemma3‑27B417M1416M25600M128K tokens

模型特点与评测表现

  • 多模态能力:内置视觉编码器,适用于图文任务。
  • 长上下文处理:支持 128K tokens,适用于代码生成和复杂推理。
  • 计算性能平衡:比 4B 更强,比 27B 计算要求更低,适合高性能需求但资源受限的场景。

总结

Gemma3-12B 在计算能力和任务表现上比 4B 版本更强,支持多模态输入,适合需要高效推理和长文本处理的任务,同时比 27B 版本更易部署。适用于 NLP、代码生成、OCR 以及多语言任务,是当前开源 LLM 生态中的重要选择。

Gemma 3 - 12B (IT)

常见问题

Gemma 3 - 12B (IT) 是什么模型?

Gemma 3 - 12B (IT) 是Google Deep Mind于 2025-03-12 发布的基础大模型。支持文本、图像输入和文本输出,上下文窗口为 128K,主要能力包括多语言。页面已收录官方资料、API 定价、公开评测,便于核对规格和使用成本。

Gemma 3 - 12B (IT) 支持哪些输入和输出模态?

当前官方资料记录其支持文本、图像输入,并生成文本输出。

Gemma 3 - 12B (IT) 的上下文窗口和最大输出是多少?

上下文窗口为 128K。未公开或无法确认的规格不做推测。

Gemma 3 - 12B (IT) 适合哪些任务?

根据已收录的官方能力标签,它适合多语言相关任务;实际效果应结合具体工作流验证。

Gemma 3 - 12B (IT) 是否提供 API,价格如何查看?

页面已收录 DeepInfra 的 2 条定价规则。价格可能随地域、上下文档位、缓存和时间变化,应以页面价格表及官方计费页为准。

Gemma 3 - 12B (IT) 是否开源?

代码与模型权重按 Gemma Terms of Use 记录;使用前仍应核对官方许可原文。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码