拓冰建站拓冰建站
首页 / 资讯中心 / 正文

ChatTTS-ui完整指南:三步从文字到语音

ChatTTS-ui完整指南三步从文字到语音【免费下载链接】ChatTTS-ui一个简单的本地网页界面使用ChatTTS将文字合成为语音同时支持对外提供API接口。A simple native web interface that uses ChatTTS to synthesize text into speech, along with support for external API interfaces.项目地址: https://gitcode.com/GitHub_Trending/ch/ChatTTS-ui想象这个场景你写好一段产品讲解词几秒钟内就听到用稳定音色读出来的效果。ChatTTS-ui 就是一个跑在本地电脑上的文字转语音TTS合成工具——网页上输入文字直接产出中英数字混杂、语感自然的音频同时还开放 API 给你的程序调用。下面带你把它跑起来并调出满意的音色。如何安装并运行 ChatTTS-ui你的第一个目标打开网页合成出第一段音频。全程不需要改任何配置默认值就能用。git clone https://gitcode.com/GitHub_Trending/ch/ChatTTS-ui . python3 -m venv venv source venv/bin/activate pip3 install -r requirements.txt pip3 install torch2.7.1 torchaudio2.7.1 python3 app.pyWindows 用户把第二行换成.\venv\scripts\activate其余命令不变。首次启动会自动联网下载模型优先 ModelScope 魔塔连不上再走 HuggingFace耐心等进度走完启动后浏览器自动打开http://127.0.0.1:9966在文本框输入文字点立即合成声音页面上就能直接播放音色下拉框会自动列出 speaker目录 里的全部音色文件先用默认的 2222 即可如何固定音色并合成一段完整讲解第一段音频到手后你马上会遇到一个问题换个种子音色就变了怎么把某个好听的音色固定下来页面上有三层控制各司其职选内置音色在选择音色下拉框里挑 speaker 目录中的 csv/pt 文件如 2222.csv、7869.csv音色完全固定反复合成不会变填音色值在音色值框填任意大于 0 的整数如 3000、9000系统用这个种子生成随机音色并自动存成speaker/3000.csv——从此这个数字永久对应同一副嗓子调表达细节Prompt 框填[oral_2][laugh_0][break_6]这类控制符分别调口语感、笑声和停顿语速滑杆 1~9默认 5举个例子做一段儿童故事配音音色下拉选 5099语速拉到 3Prompt 填[oral_1][laugh_1]出来的读白就会活泼不少。觉得嗓音太平把 temperature 从 0.3 往 0.4~0.5 调追求稳定的播报感就往 0.2 降。音色与参数推荐值速查参数作用推荐值voice从 speaker 目录选固定音色2222 / 7869 / 6653 / 4099 / 5099custom_voice用任意种子生成随机音色设置后覆盖 voice大于 0 的整数prompt控制口语感、笑声、停顿[oral_2][laugh_0][break_6]speed语速1 最慢、9 最快5temperature音色随机性0.3稳定播报用 0.2top_p / top_k采样宽度与候选词数0.7 / 20text_seed文本润色阶段的种子固定说话习惯42skip_refine1跳过文本润色保留控制符时开启0生成的 wav 存到static/wavs/下文件名自动标注了参数例如use14.39s-audio0s-seed1983-te0.1-tp0.701-tk20-textlen5-39593.wav——回头找这条音频是怎么配的时非常省事。如何批量调用语音合成 API要把一整个字幕文件转成音频API 才是趁手的工具。向/tts发 POST 请求参数和网页上一一对应import requests res requests.post(http://127.0.0.1:9966/tts, data{ text: 大家好欢迎收听本期节目, custom_voice: 3333, temperature: 0.3, top_p: 0.7, top_k: 20 }) print(res.json()[audio_files][0][url])返回的url就是可直接下载的 wav 地址请求里再加wav1则直接返回音频流。如果你手上有从外部站点下载的旧版 pt 音色文件seed_开头、_emb.pt结尾放进 speaker 目录后执行python cover-pt.pycover-pt.py 会把它们转成当前内核可识别的格式。避坑指南四个常见报错与解决现象原因解决下载模型失败报 proxy 类错误开着代理去连 ModelScope而魔塔不允许代理关闭代理后重启 app.py显存大于 4G 的显卡仍跑在 CPU 上装的是 CPU 版 torch 或 CUDA 版本过低卸载后重装 cu128 版 torch并升级 CUDA 到 12.8下载的 pt 音色文件不出现在下拉框旧内核格式与 0.96 版本不兼容放进 speaker 目录运行 python cover-pt.py 转换同一音色值在不同机器上声音不同随机音色由采样生成本身会漂移改用 speaker 目录里的 csv/pt 文件固定音色接下来可以做这三件事打开.env把WEB_ADDRESS改成局域网 IP 加端口让手机和同事也能访问你的合成页挑 3~5 个音色值各合成同一段话试听后只留下最好听的组成你的固定音色库写个循环调用/tts的小脚本把整本稿子批量转成音频【免费下载链接】ChatTTS-ui一个简单的本地网页界面使用ChatTTS将文字合成为语音同时支持对外提供API接口。A simple native web interface that uses ChatTTS to synthesize text into speech, along with support for external API interfaces.项目地址: https://gitcode.com/GitHub_Trending/ch/ChatTTS-ui创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门