2026/9/20 3:29:12

古籍数字化 OCR:用 RapidOCR 三档部署把书影变文本

古籍数字化 OCR:用 RapidOCR 三档部署把书影变文本 古籍数字化 OCR用 RapidOCR 三档部署把书影变文本【免费下载链接】RapidOCR Awesome OCR multiple programing languages toolkits based on ONNX Runtime, OpenVINO, MNN, PaddlePaddle, TensorRT and PyTorch.项目地址: https://gitcode.com/GitHub_Trending/ra/RapidOCRRapidOCR 是一个把 PaddleOCR 模型转成多引擎可部署形态的 OCR 工具包一条调用链覆盖文本检测、方向分类与识别。在古籍数字化里它负责把扫描书影切成文字块并吐出文本与坐标让你跳过从零搭模型的过程直接拿到可入库的数据。场景与能力边界古籍书影 vs 项目能力书影上的典型状况项目对应能力竖排、从右至左的窄长文本块全局参数use_vertical_padding对细窄块自动扩边width_height_ratio控制扩边比例繁体字、日汉混排识别端lang_type可选ch、chinese_cht、japan等十余种语言检测端另有multi模型纸张老化、折痕、污渍Global.use_preprocess_img开关的预处理max_side_len: 2000控制输入缩放上限字浅、笔画断连Det段的unclip_ratio: 1.6、use_dilation: true扩大文本块膨胀框单行只有几个字Global.min_height: 30过滤过短切片避免空块进识别两条明确的短板先说在前面重度模糊、低分辨率扫描件字面糊成一团不在能力圈内参数救不回来。手写体、朱笔批注、印章套叠区域模型没有针对性训练建议留给人工。能力拆解链路、语言与部署检测—分类—识别三阶段流水线入口开关use_det/use_cls/use_rec默认全开可整段跳过比如只认单条文字图。检测用 DB 算法limit_side_len: 736决定送进模型的输入尺寸分类模型只判 0/180 度cls_image_shape: [3, 48, 192]。识别输入固定为rec_img_shape: [3, 48, 320]结果对象里boxes、txts、scores一一对应方便按置信度过滤。竖排、繁简与多语言古籍竖排的核心痛点是文本块又细又窄容易不达标被丢弃apply_vertical_padding会把短块按min_height: 30、width_height_ratio: 8扩成矩形再进识别。识别模型清单在 python/rapidocr/default_models.yaml繁体走chinese_cht日文走japan另有korean、latin等十余个选项。检测端lang_type只有ch/en/multi三档中日混排的书页直接选multi检测。六后端 × 多语言运行时引擎覆盖 ONNX Runtime、OpenVINO、PaddlePaddle、PyTorch、TensorRT、MNN每阶段在 python/rapidocr/config.yaml 里独立指定engine_type。Python 包之外有 C、JavaJVM、C#、iOS/Android 版本docker/目录预置了各后端的 Dockerfile。最小工作流安装、调用、取结果安装pip install rapidocr onnxruntime。调用引擎传图片路径、URL 或 numpy 数组from rapidocr import RapidOCR engine RapidOCR() result engine(shuying.jpg)取结果。result是RapidOCROutput核心字段boxes、txts、scoresto_json()直接得到可入库列表print(result.txts, result.scores) result.vis(vis_result.jpg)调优与避坑实录问题竖排窄行漏检、被当成噪点丢弃。原因短块低于min_height: 30或宽高比过窄。做法保持use_vertical_padding: true调低width_height_ratio默认 8让扩边更激进代价是引入少量误检。问题纸张斑点、折痕被检成文本框识别出一堆乱码。原因Det段box_thresh: 0.5与thresh: 0.3偏宽松或全局text_score: 0.5过滤不严。做法把text_score提到 0.6~0.7unclip_ratio从 1.6 降到 1.4减少框膨胀带来的粘连。问题繁体古籍错字率偏高。原因默认lang_type: ch的字典以简体为主。做法Rec段切到chinese_cht模型或整体升级PP-OCRv6的multi多语模型model_type: small/medium。问题高清扫描边长 3000 像素跑起来慢。原因输入先被Global.max_side_len: 2000缩放检测端还有limit_side_len: 736。做法扫描件导出控制在 300dpi 左右或按精度需求下调这两个值。部署与选型建议单机、批量、生产三档场景推理后端语言/形态关键参数单机试用onnxruntimeCPUPythonintra_op_num_threads: -1默认即可模型自动落到rapidocr/models批量处理openvino 或 onnxruntimePython 脚本批跑OpenVINO 侧调inference_num_threads、performance_hint生产环境tensorrtFP16或 Docker 镜像C/Java 服务use_fp16: true、workspace_size: 1GB镜像见 docker/ 目录有跨端需求时移动端直接选 MNN 后端加对应语言版本cpp/、jvm/、dotnet/目录各有说明不用自己移植模型。RapidOCR 的定位一句话三阶段 OCR 流水线加六个可切换推理后端把古籍扫描件变成带坐标的文本糊掉的页和手写的字留给人。【免费下载链接】RapidOCR Awesome OCR multiple programing languages toolkits based on ONNX Runtime, OpenVINO, MNN, PaddlePaddle, TensorRT and PyTorch.项目地址: https://gitcode.com/GitHub_Trending/ra/RapidOCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考