DataLearner 标志
UN

Unlimited-OCR

视觉大模型OCR大模型

Unlimited-OCR

发布时间: 2026-06-22更新于: 2026-08-22浏览量: 1,260
模型参数
33.4亿
上下文长度
32K
多语言支持
支持
推理能力
3/5

Unlimited-OCR 是百度于 2026 年 6 月 22 日发布并开源的 OCR / 文档解析视觉语言模型,官方项目标题为「Unlimited OCR Works: Welcome the Era of One-shot Long-horizon Parsing」,目标是把几十页文档一次前向解析完,避免传统切页识别再拼接导致的跨页表格、公式和阅读顺序错位。它以 DeepSeek-OCR 为 baseline,保留高压缩率的 DeepEncoder,关键改动是把解码端注意力换成 Reference Sliding Window Attention(R-SWA):每个输出 token 完整关注全部视觉 token 与 prompt,但只关注最近窗口内的输出 token,使长输出时 KV cache 近似恒定,这是它支持 32K 长输出的前提。模型仅约 33.36 亿总参数 / 5 亿激活,BF16 权重约 6.67 GB,消费级显卡即可部署。OmniDocBench v1.5 上 Overall 93.23、文本 Edit Distance 0.038、公式 CDM 92.61、表格 TEDS 90.93,v1.6 上 Overall 93.92;相比 baseline,v1.5 Overall 提升 6.22。代码与权重均为 MIT License。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Unlimited-OCR

模型基本信息

推理过程
暂无数据
思考模式
不支持思考模式
上下文长度
32K tokens
最大输出长度
32K tokens
模型类型
视觉大模型
输入/输出模态
文本、图像 → 文本
发布时间
2026-06-22
模型文件大小
6.67 GB BF16 safetensors
MoE架构
总参数 / 激活参数
33.4亿 / 5亿
知识截止
暂无数据
Unlimited-OCR

开源和体验地址

代码开源状态
预训练权重开源
MIT License- 免费商用授权
在线体验
暂无
Unlimited-OCR

官方介绍与博客

Unlimited-OCR

API接口信息

接口速度
4/5
暂无公开的 API 定价信息。
Unlimited-OCR

发布机构

Unlimited-OCR

模型解读

专门解决一件事:一次性读完一整本文档

Unlimited-OCR 是百度于 2026 年 6 月 22 日发布并开源的 OCR / 文档解析视觉语言模型,官方项目标题是 Unlimited OCR Works: Welcome the Era of One-shot Long-horizon Parsing——「一次性长程解析」就是它全部的设计目标。

传统 OCR 处理长文档的做法是切页、逐页识别、再拼接结果,问题出在跨页的表格、公式和阅读顺序上:切开之后模型看不到上下文,拼回来经常错位。Unlimited-OCR 想做的是把几十页文档一次前向解析完,让模型始终看得到全局。

关键是把长输出的显存开销压平了

技术报告说明,它以 DeepSeek-OCR 为 baseline,保留了高压缩率的 DeepEncoder,真正的改动在解码端:把注意力换成 Reference Sliding Window Attention(R-SWA)

R-SWA 的规则是——每个输出 token 都完整关注全部视觉 token 与 prompt,但只关注最近窗口内的输出 token。这样一来,随着输出越来越长,KV cache 大小近似保持恒定,而不是线性膨胀。这正是它敢做「32K 长输出」的前提:解析一整本书时,显存和注意力计算不会随页数失控。

体积很小,这点很重要

技术报告把模型标为 3B-A0.5B,即约 33.36 亿总参数 / 5 亿激活参数(HF safetensors 元数据记录的 BF16 参数量约 33.36 亿)。模型架构为 UnlimitedOCRForCausalLM,上下文长度 32768,滑动窗口 128,视觉侧 image_size 为 1024,BF16 safetensors 权重文件索引总大小约 6.67 GB

换句话说,这是一个消费级显卡就能跑起来的模型,却面向的是过去需要大模型才敢碰的长文档解析任务。官方 README 的 Transformers 与 SGLang 示例均使用 max_length=32768(或 --context-length 32768)。

评测:文档解析的几项主要指标都很硬

技术报告以 OmniDocBench 为主要评测。在 v1.5 上,Overall 93.23、文本 Edit Distance 0.038、公式 CDM 92.61、表格 TEDS 90.93、阅读顺序 Edit Distance 0.045;在 v1.6 上 Overall 93.92、公式 CDM 95.79、表格 TEDS-S 93.32。

与它的 baseline 相比,v1.5 的 Overall 提升了 6.22 分,文本编辑距离下降 0.035——对 OCR 来说,编辑距离下降往往比总分上升更能说明可用性改善。需要说明的是,本站结构化评测区目前尚未收录 OmniDocBench v1.5/v1.6,因此这些成绩以正文形式呈现,不会被映射到 DocVQA 等口径不同的评测项上。

适用场景与获取方式

它面向长篇文档、论文、书籍、多页 PDF 和复杂版面的 OCR,输入为图像加文本 prompt,输出解析后的文本。官方示例覆盖单图文档解析、多页图片解析,以及 PDF 转图片后的多页解析。

权重发布在 Hugging Facebaidu/Unlimited-OCR),代码与技术报告在 GitHub代码与权重均为 MIT License,商用无附加限制。官方未提供托管 API 或在线 demo,使用方式是本地或自建部署,因此本页没有 API 价格。

Unlimited-OCR

常见问题

Unlimited-OCR 是什么模型?

Unlimited-OCR 是百度于 2026 年 6 月 22 日开源的 OCR / 文档解析视觉语言模型,采用 R-SWA 注意力机制支持 32K 长输出和多页文档一次性解析,模型约 3B 总参数、0.5B 激活参数,MIT 许可。

Unlimited-OCR 支持哪些输入和输出模态?

当前官方资料记录其支持文本、图像输入,并生成文本输出。

Unlimited-OCR 的上下文窗口和最大输出是多少?

上下文窗口为 32K,最大输出为 32K。未公开或无法确认的规格不做推测。

Unlimited-OCR 适合哪些任务?

根据已收录的官方能力标签,它适合多语言、OCR大模型相关任务;实际效果应结合具体工作流验证。

Unlimited-OCR 是否开源?

代码与模型权重按 MIT License 记录;使用前仍应核对官方许可原文。

Is Unlimited-OCR open source?

The checkpoint is listed under the MIT license, with the license link included in the model references. Review the linked license text before commercial or derivative use.

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码