电子书转有声书完整指南:ebook2audiobook 实现语音克隆与 1158+ 语言有声书生成
电子书转有声书完整指南ebook2audiobook 实现语音克隆与 1158 语言有声书生成【免费下载链接】ebook2audiobookGenerate audiobooks from e-books, voice cloning 1158 languages!项目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobookebook2audiobookE2A是一个把电子书转换成完整有声书的开源工具上传 EPUB、PDF、TXT 等 20 多种格式的文件它会自动切分章节、保留元数据调用多种 TTS 引擎合成带章节标记的音频并输出 m4b、mp3 等格式。它内置语音克隆功能丢一段 1~5 分钟的录音即可换音色并覆盖 1158 种语言与方言。以下按先跑通 → 再调优 → 后进阶的顺序带你走完整个流程。适合什么场景在动手之前先对号入座看 E2A 是否匹配你的需求通勤/运动听书把手头的 EPUB、mobi 小说批量变成带章节的 m4b直接导入播放器或 Audiobookshelf外语学习小语种书先用内置翻译功能译成目标语言基于 argostranslate再合成母语音频跟读个性化音色想用自己的声音、家人声音或某位播客主播的声音读给你听走语音克隆路线扫描版/图片书支持对 PDF、JPG、PNG、TIFF 做 OCR 识别后再合成无需手动转录多角色朗读配合附带的 E2A-SML 对话提取组件可自动识别小说人物并分配不同音色实现有声剧效果。它的硬件门槛很低最低 2GB 内存 1GB 显存即可运行CPU、CUDA、ROCm、Apple SiliconMPS、Intel XPU、Jetson 均在支持列表内见 lib/conf.py 中的设备矩阵。5 分钟跑通第一次转换安装只需两步脚本会自动创建独立 Python 环境macOS 依赖 HomebrewWindows 自动装 scoopgit clone https://gitcode.com/GitHub_Trending/eb/ebook2audiobook cd ebook2audiobook ./ebook2audiobook.command # Linux/macOSWindows 用 ebook2audiobook.cmd首次运行会自动安装依赖并拉起 Web 界面打开终端里给出的http://localhost:7860/即可开始。界面分两个页签Input Options拖入电子书选择语言、CPU/GPU可选地上传克隆音色音频建议 24000Hz、不超过 6 秒到 5 分钟均可用录音带背景噪音也没关系工具会自动降噪Audio Generation Preferences调节 temperature、速度、重复惩罚等合成参数。点 Convert完成后可以直接在页面试听、按速度播放或下载生成的 m4b 文件。提示EPUB 本身没有什么是章节的标准结构转换前建议先删掉前言、目录等不想被朗读的内容。不打开网页命令行无头模式如果你要批量转换或挂后台任务用 headless 模式一条命令搞定./ebook2audiobook.command --headless \ --ebook 路径/书籍.epub --voice 路径/克隆音色.wav --language eng常用参数完整列表见./ebook2audiobook.command --help参数作用--ebooks_dir指定整个文件夹批量转换可配--voice_map的 JSON 给每本书指定不同音色--text直接把一段短文本转成音频无需整本书--translate先翻译成目标语言ISO-639-3 码如 fra、deu再合成--tts_engine手动指定引擎XTTS / BARK / VITS / FAIRSEQ / TACOTRON / YOURTTS 等--output_format输出格式默认 m4b可选 mp3、flac、ogg、webm 等 10 种--session记录会话 ID中断后凭它断点续转--abs_url等生成后直接推送到 Audiobookshelf 服务器引擎怎么选默认按所选语言自动匹配。追求接近真人选 XTTSv2支持零样本语音克隆但吃资源只有 CPU 建议用 YourTTS、Tacotron2 这类轻量引擎速度快很多缺点是音色偏Siri 风。个性化配置与多角色朗读用 SML 标签微调朗读节奏正文中支持插入轻量标签控制停顿与换声[break]0.3~0.6 秒随机短停顿[pause]/[pause:N]1~1.6 秒停顿或固定 N 秒[voice:路径/音色.wav]...[/voice]段落内临时切换说话人让小说角色各说各话仓库内的 E2A-SML 组件 基于 BookNLP 分析文本自动识别人物、推断性别与年龄段把每句对话归属到对应角色并输出带[voice:...]标签的 SML 文件直接喂给 E2A 转换即可。支持 Web GUI可手动改派音色并试听和 CLI 两种用法也提供独立 Docker 镜像。进阶训练自己的专属模型语音克隆是零样本方案如果想要音色更稳定可以在 Universal_TTS_Finetune 组件 里微调 XTTSv2、VITS、Glow-TTS、Piper 等十余种模型。它支持用 E2A 生成的 VTT 时间戳直接把已有有声书切成零转写误差的训练集也支持 Whisper 自动转写和说话人分离训练完的模型可以 zip 打包后用--custom_model参数加载./ebook2audiobook.command --headless --ebook 书.epub --custom_model 我的模型.zip部署方式与远程运行Docker仓库自带 Dockerfile 与 docker-compose.yml一条命令构建完全隔离的运行环境适合依赖容易出问题的机器ebook2audiobook.cmd --script_mode build_docker可一键构建镜像提供 CPU / CUDA / ROCm / XPU / Jetson 各版本标签免费云端项目提供 Google Colab 与 Kaggle 笔记本见 Notebooks/无本地 GPU 也能跑Colab 笔记本见 Notebooks/colab_ebook2audiobook.ipynb局域网/公网共享启动时加--share可生成 Gradio 公网链接方便手机浏览器远程查看转换进度。常见问题速查GPU 没被检测到先跑python detect_gpus.py自检确认驱动满足 CUDA ≥ 11.8 / ROCm ≥ 5.7见 lib/conf.py 版本区间。依赖安装失败别折腾了直接用 Docker环境完全自包含且支持 headless 模式。CPU 太慢属正常现象现代 TTS 引擎在 CPU 上速度有限换 YourTTS/Tacotron2 可提速。转换中途被打断记下 session ID重跑时加--session续传GUI 模式下点上传区的 [X] 即可取消当前任务。音频被截断/断句奇怪断句逻辑需要母语者反馈建议提交 issue 帮助项目完善对应语言规则。上手清单clone 仓库并运行启动脚本等依赖装完浏览器打开http://localhost:7860/拖入一本 EPUB选语言点 Convert想要自己的音色录一段 1~5 分钟音频上传到克隆音色栏想要批量/自动化改用--headless --ebooks_dir模式想要多角色跑一遍 E2A-SML 生成 SML 文件再转换。E2A 的路线图还包括逐句编辑、iOS/Android 应用以及更多 TTS 引擎接入功能持续扩充中。它把格式转换 → 章节切分 → 多引擎合成 → 音色克隆 → 音频输出整条链路整合进一个 Web 界面是目前对新手最友好的电子书转有声书工具之一。【免费下载链接】ebook2audiobookGenerate audiobooks from e-books, voice cloning 1158 languages!项目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobook创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考