拓冰建站拓冰建站
首页 / 资讯中心 / 正文

Calibre 电子书转换实战:3个高频场景 + 一张表选对格式

Calibre 电子书转换实战3个高频场景 一张表选对格式【免费下载链接】calibreThe official source code repository for the calibre ebook manager项目地址: https://gitcode.com/GitHub_Trending/ca/calibre如果你手里的书是 PDF、MOBI 或 TXT而阅读器只认 EPUBCalibre 的格式转换功能就是干这件事的。本文不讲原理只讲三个最常遇到的场景PDF 书转流式格式、Kindle 老格式翻新、TXT 纯文本救回目录。每个场景给出具体点哪些选项、动哪个参数最后附排障对照表和一张速查清单照着点就行。先定格式一张表选对输入输出Calibre 的转换是管道式的输入格式先被插件拆成中间 XHTML做一轮处理再由输出插件打包成目标格式每种格式的处理器都在 src/calibre/ebooks/conversion/plugins/ 下完整选项说明见 manual/conversion.rst。选格式时记住一条原则源格式结构越完整输出质量越高。角色推荐格式说明输入优EPUB、HTMLZ、DOCX结构清晰章节、样式都能保留转换损耗最小输入中MOBI/AZW3、RTF、FB2可用个别样式会丢输入差PDF、TXTPDF 是固定版式段落切割靠算法猜TXT 无格式标记全靠启发式规则输出通用EPUB主流阅读器通吃输出KindleAZW3现代 Kindle 设备首选MOBI 只用于老设备输出打印/存档PDF需要固定版式或加页眉页脚时用输出调试/中转HTMLZ带全部资源的 HTML 包方便拆开检查内容场景一PDF 书要转成 EPUB 在手机上读这是最难的一条路因为 PDF 的段落是摆在页面上的Calibre 只能靠标点线索猜哪里是换段。先把 PDF 特有的杂质去掉在PDF Input区域调Line un-wrapping factor默认 0.45数值调低如 0.3更多行会被合并进段落调高则相反。页眉页脚会混进正文里还会干扰段落合并。用Search and replace选项写正则把它们删掉再跑转换。转换后目录和章节怎么处理勾选Structure detection里的章节检测默认 XPath 能认出chapter、section等字样开头的标题。若原 PDF 自带大纲bookmarks输出到 AZW3 时可直接沿用转 EPUB 则依赖检测出来的章节标题。复杂双栏排版、纯图片型 PDF 不支持这种书别浪费时间找 EPUB 版本。场景二Kindle 老 MOBI 翻新成 AZW3 或 EPUB老书库存了一堆 MOBI要么想迁移到新设备要么想进 EPUB 书源。转换时盯住三个点元数据转换前先在书库里核对书名、作者、封面。MOBI 的元数据经常残缺缺了会导致 TOC 和首页信息丢失。封面重复源文件正文开头常带一张封面图转换后会出现两本封面。勾Remove first image保留书库里设置的封面即可。字体嵌入MOBI 里嵌入的字体不会自动带到 EPUB。若在意排版先转 AZW3 再检查或接受用阅读器自带字体。转完先别关对话框勾选Manually fine-tune the Table of Contents after conversion转换完会直接打开 TOC 编辑器点哪里就在哪里建目录项比调 XPath 快得多。场景三TXT 纯文本没有章节怎么救回目录TXT 没有加粗、标题这些标记能不能转出像样的书取决于你选什么Formatting style。给 TXT 选对解析规则文档有# 标题这类标记Formatting style选Markdown章节 XPath 填//h:h1目录直接生成。全文无标记选Heuristic让 Calibre 靠行首缩进、短行、标点猜出章节标题、场景分隔和斜体词。段落识别不对全挤成一坨或每行一段调Paragraph styleBlock按空行分段、Print按行首缩进分段、Single每行一段按源文件的实际排版挑。猜错了就用启发式处理兜底在Heuristic processing里开Enable heuristic processing再按需勾Unwrap lines合并硬换行Line-unwrap factor配合微调。Detect and markup unformatted chapter headings把猜出的章节标题包上h2/h3之后结构检测就能顺着它建 TOC。Delete blank lines between paragraphs、Ensure scene breaks are consistently formatted清理多余空行、统一场景分隔样式。小技巧启发式规则是按常见模式猜偶尔会误伤。转完 EPUB 后点编辑书籍手动修几处再拿修好的 EPUB 当输入转其他格式质量远高于反复调参数硬转。转坏了按症状对药乱码/方块字→ 源文件没声明编码。在Look feel里手动指定Input character encoding老 Windows 文档常用cp1252中文文档试UTF-8或GBK。两个封面叠一起→ 勾Remove first image只保留书库元数据里的封面。段落挤成一团→ 硬换行没合上。开Unwrap lines并降低Line-unwrap factorPDF 输入在PDF Input里单独调同名参数。目录是空的或全是错的项→ 章节检测没命中。先用调试功能转换对话框里的 debug 选项导出中间 XHTML看实际标签长什么样再改章节 XPath赶时间就用Manually fine-tune the Table of Contents after conversion手动建。目录混进Next/Previous这类杂项→ 填TOC Filter正则比如Next|Previous命中的条目会被剔除。表格内容乱序→ 勾Linearize tables把表格按单元格顺序拉直。注意它会线性化文档里所有表格正文有真实表格的书慎用。老 .doc 文件转不动→ 别硬转。用 Word 另存.docx或扔进 LibreOffice 存成.docx再喂给 Calibre。交付前速查清单检查项怎么做目录用阅读器 TOC 按钮过一遍跳错就回改章节 XPath 或手动重挂封面只应有一张重复就补勾Remove first image字体正文大小是否协调不协调调Base font size同比例缩放全文图片抽几页看是否清晰、有无被拉伸到超屏宽换小一号输出档案会触发自动缩放特殊字符中文标点、破折号、场景分隔符显示是否正常超链接正文内链接是否还能跳元数据书名/作者/封面/标签在输出文件里是否齐全转换这活儿参数不用一次配全先跑一遍默认转换对着上面的清单挑毛病再逐个选项修。两三轮下来这本书的转换配置就定型了存下来给同类书复用即可。【免费下载链接】calibreThe official source code repository for the calibre ebook manager项目地址: https://gitcode.com/GitHub_Trending/ca/calibre创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门