跳到正文
北京时间
原文
Hugging Face:Blog(RSS)·· 2026-06-22精选AI 评分69

PP-OCRv6 on Hugging Face:50 语言 OCR,参数规模 1.5M 至 34.5M

PP-OCRv6 on Hugging Face: 50-Language OCR from 1.5M to 34.5M Parameters

AI 导读

PP-OCRv6 是 PaddleOCR 最新一代通用 OCR 模型族,提供 tiny(1.5M)、small(7.7M)和 medium(34.5M)三级。medium 和 small 支持 50 种语言(简体/繁体中文、英文、日文及 46 种拉丁语系)。在官方多场景基准上,medium 检测 Hmean 86.2%,识别准确率 83.2%,较 PP-OCRv5_server 分别提升 +4.6 和 +5.1 个百分点。模型采用 PPLCNetV4 统一骨干、RepLKFPN 检测模块和 EncoderWithLightSVTR 识别模块,可通过 PaddleOCR、Transformers、ONNX Runtime 等后端灵活部署。

推荐理由

OCR模型并没有因为VLM的兴起而消失,PP-OCRv6用1.5M到34.5M参数覆盖50种语言,对需要轻量、准确OCR的产品来说,这是一个务实的选择。

正文 · AI 翻译

在线体验 PP-OCRv6,然后通过 PaddlePaddle、Transformers 或 ONNX Runtime 后端集成轻量级、可直接用于生产的 OCR。

PP-OCRv6 是 PaddleOCR 通用 OCR 模型系列的最新一代。它专为真实场景中的文本检测与识别而设计,覆盖文档、截图、多语言图像、数字显示屏、工业标签以及场景文本。

该模型系列从 1.5M 到 34.5M 参数不等,分为三个层级:tiny、small 和 medium。medium 和 small 层级支持 50 种语言,包括简体中文、繁体中文、英文、日文以及 46 种拉丁字母语言。快速在线体验 PP-OCRv6:PP-OCRv6 在线演示。

在 PaddleOCR 官方内部多场景 OCR 基准测试中,PP-OCRv6_medium 达到 86.2% 检测 Hmean 和 83.2% 识别准确率。与 PP-OCRv5_server 相比,文本检测提升 +4.6 个百分点,文本识别提升 +5.1 个百分点。

PP-OCRv6 聚焦于一个实际的 OCR 需求:用小模型和灵活的部署选项,产出准确、结构化的文本输出。若想更深入地了解为何专用 OCR 模型在 VLM 时代依然有用,请参阅我们之前的博客:PP-OCRv5 on Hugging Face: A Specialized Approach to OCR。


PP-OCRv6 的新特性

PP-OCRv6 在检测与识别两方面引入了架构、训练和数据上的改进。其核心设计目标是在提升 OCR 准确率的同时,保持模型规模适配不同的部署场景。

三个模型层级

PP-OCRv6 提供三个模型层级,覆盖不同的模型规模和 OCR 准确率水平。

模型 模型规模 检测 Hmean 识别准确率 典型应用场景
PP-OCRv6_tiny 1.5M params 80.6% 73.5% 边缘设备、轻量级本地 OCR、延迟敏感的演示、资源受限环境
PP-OCRv6_small 7.7M params 84.1% 81.3% 移动端、桌面端、均衡型 OCR 服务、更低计算成本的多语言 OCR
PP-OCRv6_medium 34.5M params 86.2% 83.2% 面向精度的 OCR、服务端流水线、工业级 OCR、文档摄取、多语言 OCR

PPLCNetV4 骨干网络

PP-OCRv6 使用 PPLCNetV4 作为文本检测和文本识别的统一骨干网络。

对开发者而言,主要好处是整个模型系列的一致性。tiny、small 和 medium 各档并非互不相关的模型;它们属于同一个 OCR 系列,共享统一的架构方向。

用于文本检测的 RepLKFPN

文本检测是 OCR 流程的第一阶段。检测质量会影响送入识别器的裁剪区域,而糟糕的裁剪往往导致更差的识别效果。

PP-OCRv6 用 RepLKFPN 升级了检测模块,这是一个轻量级大核特征金字塔网络,专为多尺度文本检测而设计,同时保持推理高效。

这对于真实世界的 OCR 输入尤为重要,其中的文字可能很小、密集、旋转、低分辨率,或嵌入在复杂背景中。

用于识别的 EncoderWithLightSVTR

在文本识别方面,PP-OCRv6 使用 EncoderWithLightSVTR。它将局部上下文建模与全局注意力相结合,以提升在具有挑战性的文本裁剪区域上的识别质量。

识别方面的改进对于多语言文本、屏幕文本、工业字符、特殊符号、密集文本以及噪声图像区域尤为 relevant。

统一的多语言 OCR

中小规模版本在同一个模型系列中支持50 种语言,涵盖简体中文、繁体中文、英文、日文以及 46 种拉丁字母语言。

这有助于减少在常见多语言 OCR 场景中对独立 OCR 模型的需求。


PaddleOCR 快速上手

安装 PaddleOCR:

pip install paddleocr

使用 Paddle Inference(默认后端)运行 OCR:

from paddleocr import PaddleOCR

# Model: PP-OCRv6_medium(Default)
# Backend: Paddle Inference(Default)
ocr = PaddleOCR(
    use_doc_orientation_classify=False,
    use_doc_unwarping=False,
    use_textline_orientation=False,
)
result = ocr.predict("https://paddle-model-ecology.bj.bcebos.com/paddlex/imgs/demo_image/general_ocr_002.png")

for res in result:
    res.print()
    res.save_to_img("output")
    res.save_to_json("output")

OCR 结果可以保存为可视化图像和结构化 JSON 输出。结构化输出随后可供下游系统使用,例如文档解析、搜索、抽取、RAG、分析或智能体工作流。


可用的推理后端

PP-OCRv6 可通过 PaddleOCR 与多种推理后端配合使用。PaddleOCR 3.7 提供了统一的推理引擎接口,其中 engine 用于选择底层运行时,相关配置可通过 pipeline 或模块 API 传入。

后端 说明
Transformers 面向 Hugging Face / PyTorch 的推理路径,支持部分 PaddleOCR 模型
ONNX Runtime 面向基于 ONNX 的部署环境的可移植推理路径
Paddle Inference 原生 Paddle 推理格式

对于 Hugging Face 用户,PaddleOCR 支持通过 Transformers 后端运行部分 OCR 和文档解析模型。可通过以下方式启用:

engine="transformers"

有关 Transformers 后端在 PaddleOCR 中如何工作的更多细节,请参阅:

使用 Transformer 后端运行 PP-OCRv6 示例:

from paddleocr import PaddleOCR

# Model: PP-OCRv6_medium(Default)
# Backend: transformers
ocr = PaddleOCR(
    use_doc_orientation_classify=False,
    use_doc_unwarping=False,
    use_textline_orientation=False,
    engine="transformers",
)
result = ocr.predict("https://paddle-model-ecology.bj.bcebos.com/paddlex/imgs/demo_image/general_ocr_002.png")

ONNX 变体也可在 PP-OCRv6 Collection 中获取,适用于通过 engine="onnxruntime" 使用 ONNX Runtime 的环境:

from paddleocr import PaddleOCR

# Model: PP-OCRv6_medium(Default)
# Backend: ONNX Runtime
ocr = PaddleOCR(
    use_doc_orientation_classify=False,
    use_doc_unwarping=False,
    use_textline_orientation=False,
    engine="onnxruntime",
)
result = ocr.predict("https://paddle-model-ecology.bj.bcebos.com/paddlex/imgs/demo_image/general_ocr_002.png")

这些后端选项共同使 PP-OCRv6 可在不同的运行时环境中使用,同时在 Hugging Face Hub 上保持相同的 OCR 模型系列。


结论

PP-OCRv6 通过一个轻量级、多语言的 OCR 模型系列扩展了 PaddleOCR,用于真实场景中的文本检测与识别。

本次发布包含三个模型层级,参数量从 1.5M 到 34.5M,支持多达 50 种语言的 OCR,相比 PP-OCRv5_server 在检测和识别准确率上有所提升,并在 Hugging Face Hub 上提供多种模型格式,包括 safetensors、Paddle 推理模型 和 ONNX 模型。

结合托管的 Hugging Face Space 和可用的 PaddleOCR 推理后端,PP-OCRv6 提供了多个用于评估和集成的入口:

你可以通过在线演示评估 PP-OCRv6,在合集中浏览可用的模型资源,并使用与你自己 OCR 工作流相匹配的推理后端。

来源:Hugging Face:Blog(RSS) · huggingface.co