2026/9/13 17:53:50

markitdown 快速上手:两步把 PDF、Word、EPUB 变成结构化 Markdown

markitdown 快速上手:两步把 PDF、Word、EPUB 变成结构化 Markdown markitdown 快速上手两步把 PDF、Word、EPUB 变成结构化 Markdown【免费下载链接】markitdownPython tool for converting files and office documents to Markdown.项目地址: https://gitcode.com/GitHub_Trending/ma/markitdown手里一堆 PDF、Word想整理进笔记或喂给大模型复制粘贴却总丢格式markitdown 是一个开源的 Python 工具一条命令把文档转成结构化 Markdown。全程本地运行、免费不上传文件装完几分钟就能转出第一个文件。对比你常遇到的三种情况你常遇到的情况以前的做法用 markitdown 的做法PDF 合同想整理成纯文本逐页复制粘贴格式全丢一条命令输出保留标题和段落结构EPUB 电子书想存进笔记库没有现成工具只能手动重打整本书输出为单个 .md 文件批量文档要喂给大模型做摘要手动清理标签、逐个处理循环调用 API批量转 Markdown老 Outlook 邮件、音频想留底只能打开对应软件查看统一转成 Markdown可搜索、可入库说白了输入是原始文件——PDF、Word、EPUB、图片、音频输出是一份干净、结构完整的 Markdown。从安装到第一条命令两步跑通 markitdown第 1 步确认 Python 版本。项目要求 Python 3.10 及以上pyproject.toml 里有明确声明。版本低于 3.10 就先升级或换个 3.12 环境。python3 --version第 2 步安装并转第一个文件。建议直接装全量可选依赖省得之后转 PDF 时再补库pip install markitdown[all] markitdown your-file.pdf document.md怎么验证装好了运行markitdown --version能打印版本号即成功。想装源码版可以先克隆仓库https://gitcode.com/GitHub_Trending/ma/markitdown再执行pip install -e packages/markitdown[all]。能力版图20 多种格式共用一个入口所有转换器都注册在 converters/ 目录里支持范围大致分五类类别具体支持额外前提办公文档PDF、Word(docx)、Excel(xls/xlsx)、PPT(pptx)装[pdf][docx]等对应依赖组电子书EPUB基础安装即可网页与文本HTML、CSV、JSON、XML、Jupyter 笔记本无图片与音频图片EXIF 元数据、LLM 视觉描述、WAV/MP3 转写[audio-transcription]其他ZIP逐个解压转换、Outlook 邮件、YouTube 链接[outlook][youtube-transcription]这张图来自项目自带的测试素材markitdown 处理图片时可以把画面里的视觉内容转成文字描述。电子书转换实战EPUB 变成单个 Markdown 文件用仓库里真实存在的测试文件走一遍路径是packages/markitdown/tests/test_files/test.epub一本两章、带完整元数据的电子书。命令markitdown test.epub -o mybook.md输出取自仓库测试断言中的真实内容**Title:** Test EPUB Document **Authors:** Test Author # Chapter 1: Test Content This is a **test** paragraph with some formatting. * A bullet point * Another point再挑三个细节说说为什么重要开头的Title / Authors等字段是从 EPUB 内部的 Dublin Core 元数据标题、作者、语言、描述、标识符里自动抽出来的等于顺手帮你生成了著录信息正文里的加粗、列表项没有被打平成纯文本而是保留成**test**、* A bullet point这类 Markdown 语法笔记工具和大模型都能直接理解章节按 EPUB 的阅读顺序spine依次拼接第二章里的引用块也会转成开头的 blockquote整本书合并为一个文件丢进 Obsidian 或喂给 LLM 都没问题。深度用法参数速查表与 Python APICLI 参数不多记住这张表基本够用参数作用什么时候用-o写入输出文件不写则打印到终端markitdown a.docx -o a.md-x手动提示扩展名stdin 输入、类型认不出时-m手动提示 MIME 类型文件无扩展名时-c指定字符集纯文本出现乱码时-p启用第三方插件如 OCR 增强markitdown a.pdf -p--list-plugins列出已安装插件查看装了哪些-v打印版本号确认安装不传文件参数时markitdown 自动从 stdin 读取方便嵌进流水线cat example.pdf | markitdown -x pdfPython API 更适合批量处理和自动化from markitdown import MarkItDown md MarkItDown() result md.convert(test.xlsx) print(result.markdown)把文件名换成任意受支持格式即可result.markdown拿到纯文本也可以拿到result.text_content做后续处理。高频疑问转 PDF 时报缺库说明没装对应可选依赖组。一开始就pip install markitdown[all]最省事。安装直接失败九成是 Python 版本不够3.8/3.9 装不上换 3.10 环境再来。管道输入识别不出格式markitdown 靠扩展名猜类型流没有扩展名。补一个-x pdf或-m application/pdf提示即可。转音频时有 ffmpeg 警告那只是语音转写组件在提示外部工具缺失不影响任何文档转换真要转语音再装 ffmpeg。不受信任的文件路径能直接传吗项目 README 明确提醒markitdown 以当前进程权限做 I/O。服务端场景请先清洗输入并用convert_local()、convert_stream()这类更窄的入口。能逐像素还原版式吗不能。它的定位是面向文本分析和 LLM 的转换输出给人看也基本可读但高保真排版不是它的目标。选型速查维度markitdown在线转换网站手动复制粘贴上手成本一条命令 ⚡打开浏览器即可 ⚡⚡零成本 ⚡⚡⚡格式与结构保留标题/列表/表格 ✅视服务而定 ⚠️基本丢失 ❌批量处理循环、API 皆可 ✅逐个上传 ❌❌隐私安全全程本地 ✅文件要上传 ⚠️✅成本免费 ✅多有额度限制 ⚠️时间成本高 ⚠️适合你如果你经常要把 PDF、Word、电子书变成文本笔记或喂给 LLM ✅你在写自动化管道抓文档 → 转 Markdown → 入库/向量化文件敏感不想上传到任何在线服务建议绕道如果你要的是PDF 逐页高保真还原成可编辑版式那是专业排版工具的活你只需偶尔转一两个小文件在线工具更快markitdown 做的事很小——把文件变成 Markdown——但正是这一步打通了文档、笔记和大模型之间的路。今天就装好它先拿一份 PDF 跑一遍第一条命令吧。【免费下载链接】markitdownPython tool for converting files and office documents to Markdown.项目地址: https://gitcode.com/GitHub_Trending/ma/markitdown创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考