2026/9/11 10:39:46

从单张截图到整批 PDF,Umi-OCR 的实际能力边界

从单张截图到整批 PDF,Umi-OCR 的实际能力边界 从单张截图到整批 PDFUmi-OCR 的实际能力边界【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费开源的离线 OCR 工具截图、批量图片和 PDF 扫描件都可在本地完成文字识别。它无需联网、不按次收费内置 RapidOCR 与 PaddleOCR 双引擎解压即可使用。⚙ 快速上手解压后三步跑通发行版以.7z或.7z.exe自解压包提供支持 Windows 7 x64 与 Linux x64无需安装步骤。实测下来流程很短从仓库或发行版渠道下载压缩包解压到任意目录双击Umi-OCR.exeLinux 下为umi-ocr.sh启动。打开截图OCR标签页按快捷键截取屏幕区域识别结果出现在右侧记录栏。打开批量OCR标签页导入图片或在文档识别页拖入 PDF即可开始批量任务。全局设置页可切换界面语言、主题与字体跑通第一步后剩下要做的就是按自己的工作流选对页面和参数。核心功能拆解从截图到批量再到文档截图、批量、文档三条路径覆盖了绝大多数日常识别需求按实际操作顺序依次看。截图 OCR快捷键触发与结果编辑快捷键唤起截图识别完成后左侧可划选文字直接复制右侧记录栏支持编辑文字、划选多条记录复制也可把别处复制的图片粘贴进来识别右键菜单可复制文本、复制图片、切换文字叠加层显示。批量 OCR多图片导入与结果导出支持jpg / png / webp / bmp / tif等格式无数量上限一次导入几百张也可以识别结果可导出为txt、jsonl、md、csv任务完成后支持自动关机/待机每张图片显示耗时与置信度方便定位识别质量差的文件。批量识别页左侧文件列表带进度条与置信度右侧记录栏文档识别PDF 扫描件转可编辑文本支持pdf、xps、epub、mobi、fb2、cbz等格式扫描件逐页 OCR已有文本层则直接提取可输出双层可搜索 PDF保留原版式同样支持忽略区域用于排除页眉页脚。识别完成后真正影响产出质量的是下面几个参数。关键参数与配置一张表说清怎么选参数可选项什么时候用OCR 引擎RapidOCR / PaddleOCR批量简单图片选 RapidOCR复杂文档、多语言混排选 PaddleOCR排版解析方案多栏/单栏 × 自然段换行/总是换行/无换行/保留缩进论文多栏选多栏-按自然段换行代码截图选单栏-保留缩进忽略区域右键绘制多个矩形框图片有固定水印、页眉页脚时框选排除输出格式txt / jsonl / md / csv进 Excel 选 csv归档留全字段选 jsonl限制图像边长可调高数值识别超清长图或大图被截断时调高HTTP 服务仅本地 / 任何可用地址需要 CLI 或 HTTP 调用时保持开启默认仅本地环回引擎切换在全局设置页完成排版方案在识别页设置中调整其余参数在批量页和文档页各自配置。典型场景实战三个高频用法论文提取扫描版论文 PDF 走文档识别页排版方案选多栏-按自然段换行避免双栏内容串行。扫描合同数字化文档识别页导入 PDF输出双层可搜索 PDF版式不变且全文可检索。代码截图识别截图OCR页的排版方案切到单栏-保留缩进行首缩进和行内空格得以保留。这三个场景验证了主流程之后如果你想接入脚本或做二次开发接下来看接口。技术架构与二次开发插件、CLI 和 HTTP API引擎是插件机制RapidOCR、PaddleOCR 可在设置页自由切换也可以导入第三方引擎插件以实际版本为准。命令行入口即主程序与后台进程通过本地环回通信umi-ocr --screenshot --clip umi-ocr --path D:/img -- test.txt umi-ocr --qrcode_create 文本内容 D:/out.jpegHTTP 接口提供图片识别、文档识别、二维码识别/生成等能力适合接入自动化流程接口细节见 docs/http/ 与 docs/README_CLI.md。接口调不通或识别结果不理想时多半是参数和素材的问题下面按问题排查。效果调优与避坑识别不好时先查这三处图片模糊、分辨率过小或超清大图被截断先提高清晰度或在批量页调高限制图像边长。水印、页眉页脚干扰在批量页右栏进入忽略区域编辑器按住右键画矩形框。注意按整个文本块排除框画得略大一些更稳妥。按场景切引擎简单图用 RapidOCR 省时间复杂文档、多语言混排用 PaddleOCR 换精度。另外有个小细节Linux 下若出现截图偏移或 UI 错位可在全局设置 → 界面和外观 → 渲染器切换渲染方案或关闭硬件加速。社区与参与方式翻译协作UI 本地化在 Weblate 平台进行可校对现有语言或补充新语言问题反馈使用问题、功能建议直接提 Issue作者响应比较积极插件开发围绕插件机制扩展引擎或文本后处理逻辑参考构建文档 README.md 中工程结构一节。Roadmap接下来会往哪走从 README 的远期计划里能确认三个方向表格图片识别并输出 Excel、图片翻译与离线翻译、固定区域识别。具体排期以实际版本为准。Umi-OCR 覆盖了单张截图—整批图片—整本 PDF这条完整链路离线运行、解压即用双引擎和忽略区域让批量场景的参数调得比较细。日常有扫描件或大量截图要转文字的话值得先解压一个版本跑一遍自己的素材再下结论。关键词速览离线 OCR 工具、批量文字识别、PDF 扫描件转可编辑文本、截图识别保留缩进格式、RapidOCR 与 PaddleOCR 引擎切换、双层可搜索 PDF、忽略区域排除水印、命令行与 HTTP 接口【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考