拓冰建站拓冰建站
首页 / 资讯中心 / 正文

Dograh TTS 声音配置教程:ElevenLabs、Cartesia 语音效果全体验

Dograh TTS 声音配置教程ElevenLabs、Cartesia 语音效果全体验【免费下载链接】dograhOpen source voice AI platform. Self-hosted alternative to Vapi and Retell. On Prem, BYOK across Speech to Speech or LLM/STT/TTS, with a visual workflow builder, MCP native and telephony support.项目地址: https://gitcode.com/GitHub_Trending/do/dograhDograh TTS 声音配置是打造开源语音 AI Agent 的关键一步。Dograh 是一个自托管的开源语音 AI 平台可视为 Vapi 和 Retell 的自托管替代方案。它支持 BYOK自带密钥模式让你自由选择ElevenLabs、Cartesia、OpenAI、Google 等 15 家 TTS 引擎并通过可视化工作流编辑器完成 Agent 搭建。本教程将带你从零完成 TTS 声音配置对比不同提供商的语音效果与适用场景。三种模型配置模式先选对入口在动手配置 TTS 之前先了解 Dograh 的模型配置体系。打开仪表盘的Models模型配置页面你会看到三个顶层分区配置分区适用场景Speech to Speech使用实时语音对语音模型直接处理通话无需单独配置 Voice 和 TranscriberDograh使用 Dograh 托管模型一个 Service Key 统一管理 LLM、Voice、TranscriberBYOK自带提供商密钥分别独立配置 LLM、Voice、Transcriber、Embedding 模型配置是组织级的只要不设置 Agent 级别的覆盖该组织下所有 Agent 都会使用这套全局 TTS 声音配置。对于大多数想体验 ElevenLabs / Cartesia 语音效果的用户推荐选择BYOK 模式它对每个模型类别提供独立控制。一步配好 ElevenLabsTTS 声音配置最快方法ElevenLabs 以自然度著称适合客服、品牌电话等对音质要求高的场景。配置步骤进入Models → BYOK → Voice标签页提供商选择ElevenLabs模型选择eleven_flash_v2_5选择 Voice声音 ID可参考提供商官方文档挑选匹配你目标语言的声音调整Speed语速取值范围 0.1 ~ 2.0默认 1.0填入你的 ElevenLabs API Key进阶技巧EU 数据驻留ElevenLabs 提供商配置支持自定义 Base URL默认值为https://api.elevenlabs.io。如果你有 GDPR / HIPAA 合规需求可以改为https://api.eu.residency.elevenlabs.io这样的区域端点。这一设置定义在 api/services/configuration/registry.py 中。配置 Cartesia超低延迟的声音选择Cartesia 的 Sonic 系列模型以低延迟闻名是实时对话场景的首选。配置同样在 BYOK → Voice 中完成模型sonic-3.5或sonic-3Speed语速范围 0.6 ~ 1.5默认 1.0Voice ID在 Cartesia 控制台创建或克隆声音后填入Cartesia 还内置了 STT语音转文本支持ink-2等转写模型可在 Transcriber 标签页一并配置实现STT TTS 同一提供商的极致延迟组合。找不到心仪的声音手动添加 Voice ID如果你想要的声音不在下拉列表中Dograh 允许手动输入任意 Voice ID。在下拉框底部选择手动添加模式粘贴提供商提供的 Voice ID 即可——这是 Dograh TTS 声音配置中最灵活的一招⚠️ 注意Voice ID 的有效性由提供商决定。如果提供商侧删除了该声音通话时会合成失败请妥善保管你自定义的声音资源。保存配置并让声音生效配置完成后点击页面底部的Save Configuration保存。配置项的合并与解析逻辑由 api/services/configuration/merge.py 和 api/services/configuration/resolve.py 负责处理保存后API Key 在数据库和日志中会自动脱敏展示见 api/services/configuration/masking.py你可以放心分享截图而不泄露密钥。Agent 级声音覆盖不同 Agent 用不同声音全局配置之外还可以为单个 Agent 单独覆盖 Voice。例如让销售 Agent 用 ElevenLabs 的沉稳男声客服 Agent 用 Cartesia 的亲和女声打开目标 Agent →Settings进入Model Overrides仅启用 Voice 服务的覆盖LLM 和 Transcriber 继续走全局配置配置该 Agent 专属的提供商、模型与密钥后保存这种选择性覆盖让多 Agent 项目无需重复配置整套模型。语音效果怎么选一张表看懂提供商代表模型语速范围适合场景ElevenLabseleven_flash_v2_50.1 ~ 2.0高自然度、多语言、EU 数据驻留Cartesiasonic-3 / sonic-3.50.6 ~ 1.5超低延迟实时对话OpenAI / Google / Azure各自 TTS 模型0.5 ~ 2.0已使用对应云生态的团队本地部署SpeachesOpenAI 兼容—数据完全不出内网Dograh 的官方声音配置说明见 docs/configurations/voice.mdx完整提供商选项定义在 api/services/configuration/registry.py。小结Dograh TTS 声音配置只需三步选模式BYOK→ 配声音ElevenLabs / Cartesia / 手动 Voice ID→ 保存生效。借助组织级默认配置 Agent 级覆盖的双层机制无论是单 Agent 快速上手还是多 Agent 差异化音色都能在一个可视化界面内搞定。自托管 BYOK 的组合让语音效果与数据主权都掌握在你自己手中。【免费下载链接】dograhOpen source voice AI platform. Self-hosted alternative to Vapi and Retell. On Prem, BYOK across Speech to Speech or LLM/STT/TTS, with a visual workflow builder, MCP native and telephony support.项目地址: https://gitcode.com/GitHub_Trending/do/dograh创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门