拓冰建站拓冰建站
首页 / 资讯中心 / 正文

如何让 ai 开口说话--tts的扫盲

tts简介tts 全称Text-to-Speech是一种文字转语音的技术是实现ai与人类交互必不可少的技术。常用于智能客服、数字人、机器人场景。tts的api调用tts的api一般基于WebSocket以下简称WS连接实现。整体流程为建立连接-配置会话-传输文本-合成控制-结束会话建立连接核心参数model模型名称url连接地址配置会话核心参数设置当前连接的一些配置voice设置音色必填项languageType设置语言默认根据传入文本自动选择mode设置交互模式分为 server_commit 与 commit 两种下文细说format设置格式默认为pcm可选wav、mp3、opus推荐在模型支持的情况下选择opus其他还有很多参数在这就不一一细说了我认为对于搭建一个智能客服助手这类商业场景了解这四个参数已经足够剩余的参数更倾向于如何定制一个私人的情感陪伴类产品。传输文本默认流式传输文本这没什么可讲的了。合成控制这里就涉及到我们的交互模式了server_commit推荐也是默认值由大模型厂商的服务端自动决定合成时机兼顾延迟和质量。commit由我们的服务端决定合成时机优势是极低延迟缺点是要自己管理句子分块。所以我推荐采取默认值 server_commit。结束会话finish推荐结束当前轮次会话而不断开WS连接方便后续进行 WS 连接的复用。close断开 WS 连接后续使用 tts 服务需要重新建立 WS 连接会导致 TCP 三次握手性能损耗。为什么 TTS 要采用 WS 连接的一些思考Chat模型看首token到达时间用SSE实现流式输出足够了。TTS 的终极目标是实时语音对话如果像 Chat 一样得把所有话都想好再说出口相当于人类的写稿子再照完整稿子念。那首音频的延迟过于长久了就好像你和别人对话对方思考一分多钟才说出口存在长时间冷场。
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门