2026/9/7 7:59:20

把电子书变成有声书:ebook2audiobook 语音克隆与 1158 种语言使用指南

把电子书变成有声书:ebook2audiobook 语音克隆与 1158 种语言使用指南 把电子书变成有声书ebook2audiobook 语音克隆与 1158 种语言使用指南【免费下载链接】ebook2audiobookGenerate audiobooks from e-books, voice cloning 1158 languages!项目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobook你手里有本 epub却想在通勤时听完它。ebook2audiobook 就是干这件事的把电子书转成带章节、带元数据的有声书支持语音克隆覆盖 1158 种语言CPU 或 GPU 都能跑。下面带你从克隆仓库一路走到导出 m4b中间再讲清语音克隆、小语种引擎和几个常调的参数。从一本电子书到一张有声书它做了什么ebook2audiobook项目里简称 E2A是一个本地运行的转换工具输入是电子书输出是可直接进播放器的音频文件。它不是只读个词而是做了三件更费力的事自动切章节读进.epub、.mobi、.pdf、.txt等 20 多种格式保留章节结构生成的音频里一章一段方便跳转。多引擎语音合成内置 XTTSv2、Bark、Fairseq、VITS、Tacotron2、Tortoise、GlowTTS、YourTTS 等引擎不同语言会自动落到最合适的引擎上。可选语音克隆上传一段你自己的录音整本书就用你的声音读。输出支持m4b、mp3、flac、wav等 11 种格式默认就是有声书常用的m4b单声道或立体声都能选。三步跑出第一本有声书整个过程不复杂卡在环境上的人最多所以先说清楚最低要求2 GB 内存起步推荐 8 GB1 GB 显存起步推荐 4 GB。纯 CPU 也能跑只是速度慢。第一步把仓库拉到本地git clone https://gitcode.com/GitHub_Trending/eb/ebook2audiobook cd ebook2audiobook第二步按系统跑启动脚本。macOS 和 Linux 用./ebook2audiobook.commandWindows 用ebook2audiobook.cmd。脚本会自动装缺的依赖macOS 走 HomebrewWindows 走 scoop。第三步看终端里打印出来的网址一般是http://localhost:7860/浏览器打开就是你的网页界面。到这里界面就跑起来了剩下的都在网页里点。小提示如果中途脚本停掉又重启记得刷新网页让它重新连上新的会话否则会连不上。看懂网页界面上传、语言与引擎界面分两个标签页新手先待在第一个Input Options里就够了。从左到右你会用到的几项Ebook File拖入你的电子书。想要章节切得准优先.epub或.mobi。注意 epub 本身没有标准结构前言、脚注这类不想念的内容要提前手动删掉。Language选书的语言默认 English。这里填 ISO-639 代码中文是zho法语fra德语deu。Cloning Voice可选传一段你自己的录音整本书就用这个声音。Processor UnitCPU 或 GPU。有独显就选 GPU合成速度能接近实时。填完点Convert下方会出进度条。转换完成后你会看到一个播放器和一个下载入口先在网页里点Listen试听开头几段满意了再从Download里把m4b存下来。让书用你自己的声音朗读语音克隆是 E2A 最出效果的功能也最容易被低估。你要做的只有一件事传一段干净的录音。几点经验能少走弯路时长 1 到 5 分钟最合适太短克隆不准太长没必要。有底噪、有背景音乐也没关系。E2A 会先对你的参考音频做降噪再克隆所以手机随手录一段也行。英文的内置克隆音色最多其他语言想用官方音色可以联系项目方审核后加入。在界面上把录音丢进Cloning Voice框选对语言点 Convert。生成的整本书就会用你或你指定的声音读出来。想更进一步项目里还带了 XTTSv2 的微调工具见 components/Universal_TTS_Finetune能用更多样本训练一个专属模型上传成一个 zip 就能在XTTS Model框里直接载入。小语种怎么选引擎、翻译与 1158 种语言1158 种语言这个数字来自它底层用的 Fairseq 多语言模型覆盖从中文、英语到斯瓦希里语、约鲁巴语这类小语种。但不同引擎擅长的不一样选对引擎比硬调参数更管用中文、英语、印欧系主流语言默认多落在XTTSv2上音色自然还支持零样本语音克隆。小语种、方言优先Fairseq语言覆盖最广。纯 CPU 场景XTTSv2 这类现代引擎在 CPU 上很慢可以换 YourTTS、Tacotron2 这类轻量引擎音质是 Siri 级但速度快很多。如果你手上有本外语书想听母语还有个隐藏玩法加一个--translate参数它会先把整本书翻译到目标语言再合成并自动用_语言代码后缀把翻译版和原版输出分开存互不覆盖。命令行里这样写./ebook2audiobook.command --headless \ --ebook book.epub --translate fra调参数、选格式、配硬件第二个标签页Audio Generation Preferences是进阶区新手可以先用默认值等对音色不满意再回来抠。最常调的几个Temperature调发挥程度调高更有创意但更飘调低更稳。Speed语速系数嫌拖沓就调大。Repetition Penalty复读机式重复就调高它。Top-k / Top-p调低了输出更可控、生成也更快。输出格式和声道在配置文件里改默认m4b单声道改法见 lib/conf.py。硬件这块给你个直观预期GPU 能接近实时转换纯 CPU 会明显偏慢长书建议挂后台或夜里跑。GPU 没被识别、依赖装不上这两类问题最省事的解法都是改用 Docker——它自带完整环境还支持 headless 命令行模式一条命令就能在容器里跑转换。想给朗读加停顿、换声它支持一套 SML 标签[break]短停顿、[pause:3]固定 3 秒、[voice:路径]...[/voice]中途切换说话人配套工具在 components/E2A-SML。建议的下一步先别追求一步到位按这个顺序试最稳先用默认音色跑一本短书走通上传 → Convert → 试听 → 下载整条链路确认格式和章节没问题。再换上自己的录音测克隆挑 2 到 3 分钟的干净录音重点听开头几段像不像。最后才动参数音色飘就降 Temperature节奏拖就调 Speed有重复就抬 Repetition Penalty。嫌慢再考虑硬件有独显切 GPU环境老是装不上就转 Docker。记住只处理无 DRM、合法获取的电子书其余的跟着界面点一遍就上手了。【免费下载链接】ebook2audiobookGenerate audiobooks from e-books, voice cloning 1158 languages!项目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobook创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考