一、PP-OCRv6简介

June 22, 2026 · View on GitHub

PP-OCRv6 是 PP-OCR 最新一代通用文字识别解决方案。PP-OCRv6 基于全新设计的 PPLCNetV4 统一骨干网络,提供 tiny、small、medium 三档模型,分别面向端侧/IoT、移动端/桌面端、服务端场景。PP-OCRv6 在语言覆盖方面实现重大突破,medium/small 档单一模型统一支持简体中文、繁体中文、英文、日文及 46 种拉丁语系语言共 50 种语言(tiny 档支持 49 种,不含日文)。在内部多场景综合评估集上,PP-OCRv6_medium 相比 PP-OCRv5_server 识别精度提升 5.1%、检测精度提升 4.6%,同时 GPU 推理速度提升 2.37×;以仅 34.5M 参数的规模,精度超越 Qwen3-VL-235B、GPT-5.5 等大型视觉语言模型。

PP-OCRv6 的主要贡献如下:

  1. 统一可扩展的模型族:提供覆盖 1.5M 至 34.5M 参数的三档完整 OCR 模型族。medium 档达到 86.2% 检测 Hmean 和 83.2% 识别准确率,可作为工业部署和大规模数据管线的高效生产级基础设施。
  2. 面向 OCR 的轻量级架构创新:提出一系列专为 OCR 任务定制的轻量级架构组件——(i) LCNetV4:集成结构重参数化的 MetaFormer 风格轻量骨干;(ii) RepLKFPN:利用膨胀可重参数化深度卷积实现大感受野的检测颈部;(iii) EncoderWithLightSVTR:基于局部-全局注意力和加性跳跃连接的识别颈部。
  3. 广泛的多语言与多场景泛化:单一模型扩展至支持 50 种语言和多种挑战性工业场景(如数码显示屏、点阵字符、轮胎印字等),显著提升了传统通用视觉语言模型难以覆盖的专业场景 OCR 性能。

图:PP-OCRv6 与 PP-OCRv5 及视觉语言模型的性能对比。左:文本检测平均 Hmean(%);右:文本识别加权平均准确率(%)。

二、核心技术升级

1. 统一骨干网络 PPLCNetV4

PP-OCRv6 采用全新设计的 PPLCNetV4 作为检测和识别的统一骨干网络,核心创新包括:

LCNetV4Block:遵循 MetaFormer 范式,将每层解耦为 Token Mixer 和 Channel Mixer。设输入特征 xRC×H×W\mathbf{x} \in \mathbb{R}^{C \times H \times W},Block 计算如下:

x^=SE(DW(x))+x\hat{\mathbf{x}} = \text{SE}(\text{DW}(\mathbf{x})) + \mathbf{x}

y=W2σ(W1x^)+x^\mathbf{y} = W_2\,\sigma(W_1\,\hat{\mathbf{x}}) + \hat{\mathbf{x}}

其中 DW()\text{DW}(\cdot) 是 3×3 深度卷积(Token Mixer),SE 是可选的通道注意力模块,W1R2C×CW_1 \in \mathbb{R}^{2C \times C}W2RC×2CW_2 \in \mathbb{R}^{C \times 2C} 构成扩展比为 2 的 Channel Mixer,σ\sigma 为 GELU 激活。

Task-Adaptive Downsampling:同一骨干通过不同下采样策略服务两个任务——检测模式使用标准 stride-2 空间下采样产出多尺度特征图(stride 4/8/16/32);识别模式在 Stage 3/4 使用非对称 stride (2,1)(2,1),仅缩减高度保留宽度,经 height-axis 平均池化后产出 1-D 序列特征用于 CTC/NRTR 解码。

与 LCNetV3 对比

设计维度LCNetV3LCNetV4
架构范式MobileNet-style (DW→SE→PW)MetaFormer (TokenMixer + ChannelMixer)
通道交互单个 1×1 PW ConvExpand(2×)→Act→Compress + 残差
空间混合普通 DW ConvRepDWConv(3×3 + 1×1 + identity 三分支)
BN 初始化标准Compress 层 BN 零初始化

图:PPLCNetV4 骨干网络结构

2. 检测模块升级

  • RepLKFPN:轻量级大核特征金字塔,使用 DilatedReparamBlock(7×7 深度卷积 + 膨胀分支),相比 PP-OCRv5 的 RSEFPN 参数减少 31%(118K vs 172K),同时感受野从 3×3 扩大到 7×7。
  • 辅助深度监督:在 P2、P3、P4 层级添加预测头,训练时提供更强梯度信号。
  • DiceBCE Loss:组合 DiceLoss + Focal Loss,对小目标和密集文本提供更好的逐像素监督。

图:PP-OCRv6 检测模块结构

3. 识别模块升级

  • EncoderWithLightSVTR 颈部:局部上下文建模(1×7 深度卷积)+ 全局自注意力(1-2 层 Transformer),通过加性跳跃连接(而非 PP-OCRv5 的拼接)减少参数。
  • 多头解码器:CTCHead 用于高效并行推理,NRTRHead 用于训练时辅助监督(推理时移除)。
  • Tiny 模型特殊设计:无颈部(直接 reshape + FC),使用 medium 模型蒸馏训练。
  • 多语言统一:字典扩展约 200 个带变音符号字符,实现单模型 48 语言覆盖。

图:PP-OCRv6 识别模块结构

三、关键指标

1. 文本检测指标

在内部多场景基准上对 16 类场景进行文本检测 Hmean(%) 评测:

模型AVG手写CN手写EN印刷CN印刷EN繁体古籍日文模糊表情扭曲拼音艺术字表格旋转工业通用
PP-OCRv6_medium86.283.784.095.193.786.380.284.394.199.688.674.069.096.893.873.382.8
PP-OCRv6_small84.180.587.194.293.685.772.682.392.699.787.669.665.395.693.767.678.2
PP-OCRv6_tiny80.679.485.993.192.383.763.076.689.399.886.159.060.194.791.062.073.8
PP-OCRv5_server81.680.384.194.591.781.567.677.290.196.287.667.167.397.180.064.379.7
PP-OCRv5_mobile75.274.477.790.591.082.358.172.787.493.682.757.552.592.864.752.872.1
Gemini-3.1-Pro46.853.456.547.347.639.045.838.250.068.144.640.665.226.922.152.550.2
GPT-5.545.642.458.550.251.935.026.742.049.197.537.736.352.071.010.036.232.6
Qwen3-VL-235B38.356.566.041.737.019.313.127.038.581.228.533.068.319.62.148.432.3

PP-OCRv6_medium 平均 Hmean 达 86.2%,相比 PP-OCRv5_server 提升 4.6 个百分点,在日文、古籍、旋转文本、工业字符等场景提升尤为显著。

2. 文本识别指标

在内部多场景基准上对 15 类场景进行文本识别准确率(%) 评测:

模型W-Avg手写CN手写EN印刷CN印刷EN繁体古籍日文易混淆特殊字符通用拼音艺术字工业屏幕卡片
PP-OCRv6_medium83.262.167.891.594.178.672.490.564.961.787.578.171.277.482.588.1
PP-OCRv6_small81.357.661.190.593.377.071.188.264.160.285.775.968.476.479.786.9
PP-OCRv6_tiny73.540.139.386.788.465.068.489.852.357.178.065.454.762.171.280.5
PP-OCRv5_server78.158.059.690.185.174.760.473.759.456.886.574.464.070.268.187.6
PP-OCRv5_mobile73.741.750.986.086.072.057.875.855.754.880.772.554.059.357.681.7
Qwen3-VL-235B74.949.773.282.386.276.433.666.256.149.082.576.569.674.773.878.7
Gemini-3.1-Pro71.446.473.080.090.569.518.067.254.450.374.675.963.169.173.275.9
GPT-5.564.219.256.975.782.257.563.758.649.148.367.750.453.062.467.771.1

PP-OCRv6_medium 加权平均准确率 83.2%,相比 PP-OCRv5_server 提升 5.1%,在日文(+16.8%)、古籍(+12.0%)、屏幕显示(+14.4%) 等类别提升显著。即使是仅 1.1M 参数的 PP-OCRv6_tiny,也超越了 4/5 的 VLM 模型。

4. 端到端推理速度(s/image)

在 200 张图像(通用场景 + 文档场景)上测试端到端 OCR 产线速度,包含读图、前后处理、模型推理全流程。

硬件推理后端PP-OCRv6_mediumPP-OCRv6_smallPP-OCRv6_tinyPP-OCRv5_serverPP-OCRv5_mobilePP-OCRv4_mobile
NVIDIA A100PaddlePaddle0.290.250.130.320.250.14
NVIDIA A100TensorRT--0.320.16--0.330.16
NVIDIA V100PaddlePaddle0.720.490.210.660.500.25
NVIDIA V100ONNX Runtime0.670.530.290.770.460.27
NVIDIA V100TensorRT0.770.600.230.730.590.27
Intel Xeon 8350CPaddlePaddle2.050.790.322.040.800.62
Intel Xeon 8350COpenVINO1.400.590.207.300.780.60
Intel Xeon 8350CONNX Runtime3.310.610.226.360.610.49
Apple M4PaddlePaddle8.823.070.96>105.825.65
Apple M4ONNX Runtime5.551.290.357.201.101.02
  • PP-OCRv6_medium 在所有平台上均匹配或优于 PP-OCRv5_server:A100 上快 1.1×(0.29s vs 0.32s),V100 ONNX Runtime 快 1.15×(0.67s vs 0.77s),Intel Xeon OpenVINO 快 5.2×(1.40s vs 7.30s)。
  • PP-OCRv6_small 在大多数平台上与 PP-OCRv5_mobile 速度持平但精度更高;Apple M4 PaddlePaddle 快 1.9×(3.07s vs 5.82s)。
  • PP-OCRv6_tiny 是所有平台上最快的模型,Apple M4 PaddlePaddle 快 6.1×(0.96s vs 5.82s),Intel Xeon OpenVINO 快 3.9×(0.20s vs 0.78s),A100 上仅需 0.13s。

四、语言支持

PP-OCRv6 medium/small 档支持以下 50 种语言:

核心语言:简体中文、繁体中文、英文、日文

拉丁语系(46种):法文、德文、意大利文、西班牙文、葡萄牙文、荷兰文、波兰文、罗马尼亚文、捷克文、瑞典文、挪威文、丹麦文、芬兰文、匈牙利文、土耳其文、越南文、印尼文、马来文、阿塞拜疆文、南非荷兰文、波斯尼亚文、克罗地亚文、威尔士文、爱沙尼亚文、爱尔兰文、冰岛文、库尔德文、立陶宛文、拉脱维亚文、马耳他文、毛利文、奥克文、斯洛伐克文、斯洛文尼亚文、阿尔巴尼亚文、斯瓦希里文、他加禄文、乌兹别克文、拉丁文、塞尔维亚文(拉丁)、加泰罗尼亚文、巴斯克文、加利西亚文、卢森堡文、罗曼什文、克丘亚文

PP-OCRv6_tiny 档支持 49 种语言(不含日文,以避免约 4000 个汉字/假名字符对 1.1M 参数输出层的影响)。

五、效果可视化

1. 检测效果对比

图:文本检测效果对比。从左到右:PP-OCRv6_medium、PP-OCRv5_server、Gemini-3.1-Pro、GPT-5.5。

2. 幻觉对比

图:PP-OCRv6_medium 与 VLM 的幻觉对比。PP-OCRv6 忠实还原图像中的文字内容,而 VLM 基于语言先验进行"纠正",引入了图像中不存在的幻觉。

3. 端到端 OCR 效果对比

图:PP-OCRv6_medium 与 PP-OCRv5_server 端到端 OCR 效果对比,涵盖中文、英文、日文、艺术字、工业字符、旋转文本、拼音、点阵字符等场景。

六、快速使用

from paddleocr import PaddleOCR

# 默认使用 PP-OCRv6_medium
ocr = PaddleOCR(
    use_doc_orientation_classify=False,
    use_doc_unwarping=False,
    use_textline_orientation=False,
)
result = ocr.predict("https://paddle-model-ecology.bj.bcebos.com/paddlex/imgs/demo_image/general_ocr_002.png")

for res in result:
    res.print()
    res.save_to_img("output")
    res.save_to_json("output")

# 命令行使用
paddleocr ocr -i https://paddle-model-ecology.bj.bcebos.com/paddlex/imgs/demo_image/general_ocr_002.png \
    --use_doc_orientation_classify False \
    --use_doc_unwarping False \
    --use_textline_orientation False

使用 Transformers 引擎推理:

PP-OCRv6 支持通过 Hugging Face Transformers 引擎进行推理(需安装 transformers>=5.8.0):

from paddleocr import TextRecognition

model = TextRecognition(
    model_name="PP-OCRv6_medium_rec",
    engine="transformers",
)
output = model.predict(input="general_ocr_rec_001.png", batch_size=1)
for res in output:
    res.print()
# 命令行方式
paddleocr text_recognition -i general_ocr_rec_001.png \
    --text_recognition_model_name PP-OCRv6_medium_rec \
    --engine transformers

使用高性能推理(ONNX Runtime 后端):

通过 enable_hpi=True 启用高性能推理插件,底层会自动使用 ONNX Runtime 加速:

from paddleocr import PaddleOCR

ocr = PaddleOCR(
    use_doc_orientation_classify=False,
    use_doc_unwarping=False,
    use_textline_orientation=False,
    enable_hpi=True,
)
result = ocr.predict("general_ocr_002.png")
# 命令行方式
paddleocr ocr -i general_ocr_002.png \
    --use_doc_orientation_classify False \
    --use_doc_unwarping False \
    --use_textline_orientation False \
    --enable_hpi True

高性能推理插件需额外安装,详见高性能推理指南

七、部署与二次开发

  • 多系统支持:兼容 Windows、Linux、Mac 等主流操作系统。
  • 多硬件支持:支持英伟达 GPU、Intel CPU、昆仑芯、昇腾等硬件推理和部署。
  • 高性能推理插件:推荐结合高性能推理插件进一步提升推理速度,详见高性能推理指南
  • 服务化部署:支持高稳定性服务化部署方案,详见服务化部署指南
  • 二次开发能力:支持自定义数据集训练、字典扩展、模型微调,详见文本检测模块使用教程文本识别模块使用教程