Unlimited-OCR 是什么模型?
Unlimited-OCR 是百度于 2026 年 6 月 22 日开源的 OCR / 文档解析视觉语言模型,采用 R-SWA 注意力机制支持 32K 长输出和多页文档一次性解析,模型约 3B 总参数、0.5B 激活参数,MIT 许可。
Unlimited-OCR
Unlimited-OCR 是百度于 2026 年 6 月 22 日开源的 OCR / 文档解析视觉语言模型,采用 R-SWA 注意力机制支持 32K 长输出和多页文档一次性解析,模型约 3B 总参数、0.5B 激活参数,MIT 许可。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
暂时没有为该模型整理的相关对比页面。
想自定义其他组合?打开对比工具
Unlimited-OCR 是百度在 2026 年 6 月 22 日发布并开源的 OCR / 文档解析视觉语言模型,官方项目标题为 Unlimited OCR Works: Welcome the Era of One-shot Long-horizon Parsing。项目 README 显示,模型支持通过 Hugging Face Transformers 加载 baidu/Unlimited-OCR,可处理单张图片、多页图片以及由 PDF 转换得到的页面图片,输出文档解析文本。
技术报告说明,Unlimited-OCR 以 DeepSeek-OCR 为 baseline,保留高压缩率的 DeepEncoder,并将解码端注意力替换为 Reference Sliding Window Attention(R-SWA)。R-SWA 让每个输出 token 关注完整视觉 token 与 prompt,同时只关注最近窗口内的输出 token,从而在长输出推理时保持近似恒定的 KV cache,降低显存和注意力计算开销。报告表格将模型标为 3B-A0.5B,HF safetensors 元数据记录 BF16 参数量约 33.36 亿;本条目按总参数 33.36 亿、激活参数 5 亿收录。
HF 模型配置显示,模型架构为 UnlimitedOCRForCausalLM,model_type 为 unlimited-ocr,上下文长度为 32768,滑动窗口为 128,视觉侧 image_size 为 1024,权重格式为 BF16 safetensors,文件索引总大小约 6.67 GB。官方 README 中 Transformers 与 SGLang 示例均使用 max_length=32768 或 --context-length 32768。
Unlimited-OCR 面向长篇文档、论文、书籍、多页 PDF 和复杂版面 OCR,支持图像加文本 prompt 输入并生成文本解析结果。官方示例包含单图文档解析、多页图片解析和 PDF 转图片后的多页解析;技术报告称该方法可以在标准 32K 最大长度下对几十页文档进行单次前向解析。由于官方模型卡未提供托管 API 或在线 demo,本次只记录开源权重和本地/自部署推理入口,API 价格暂留空。
官方技术报告以 OmniDocBench 作为主要文档 OCR 评测。报告表 1 显示,Unlimited-OCR 在 OmniDocBench v1.5 上 Overall 为 93.23,文本 Edit Distance 为 0.038,公式 CDM 为 92.61,表格 TEDS 为 90.93,阅读顺序 Edit Distance 为 0.045;在 OmniDocBench v1.6 上 Overall 为 93.92,公式 CDM 为 95.79,表格 TEDS-S 为 93.32。报告还说明,相比 DeepSeek-OCR baseline,v1.5 overall 提升 6.22,文本编辑距离下降 0.035。DataLearner 当前 benchmark 目录尚未收录 OmniDocBench v1.5/v1.6,因此本次不写入结构化 benchmark 成绩,避免映射到不匹配的 DocVQA 等评测项。
模型权重发布在 Hugging Face,代码与技术报告发布在 GitHub。GitHub 与 HF 模型卡均标注 MIT License,因此本条目的代码、权重与商用许可均按 MIT License 收录。
Unlimited-OCR 是百度于 2026 年 6 月 22 日开源的 OCR / 文档解析视觉语言模型,采用 R-SWA 注意力机制支持 32K 长输出和多页文档一次性解析,模型约 3B 总参数、0.5B 激活参数,MIT 许可。
当前官方资料记录其支持文本、图像输入,并生成文本输出。
上下文窗口为 32K,最大输出为 32K。未公开或无法确认的规格不做推测。
根据已收录的官方能力标签,它适合多语言、OCR大模型相关任务;实际效果应结合具体工作流验证。
代码与模型权重按 MIT License 记录;使用前仍应核对官方许可原文。
The checkpoint is listed under the MIT license, with the license link included in the model references. Review the linked license text before commercial or derivative use.
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
