HeyGem.ai本地部署3步指南:从十秒视频克隆数字人到口播视频生成
HeyGem.ai本地部署3步指南从十秒视频克隆数字人到口播视频生成【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarHeyGem.ai 本地部署这套流程仓库内项目名为 Duix.Avatar目标是让你在自己电脑上拥有一套完全离线的数字人生产线上传一段十秒左右的说话视频程序克隆出你的形象和声音之后输入文案或传一段音频就能生成你出镜口播的视频。适合两类人想批量做口播内容又不想把素材传上云端的创作者以及想直接调用本地端口做二次开发的开发者。全文按三个任务推进环境跑通 → 出片 → 排坑每个任务只给验收标准和出错点看完照着做即可。 任务一把服务端三个容器和桌面客户端跑起来本节要达成的结果Docker 容器列表里出现三个 Running 的服务同时桌面客户端窗口能正常打开两边都满足才算管线就绪。动手前先核对硬件三项都不满足就停在这里NVIDIA 显卡且驱动正常在终端执行nvidia-smi能打印出显卡型号和显存才算通过。所有推理算力都在本机完成没有 NVIDIA 显卡这三个服务根本起不来。内存 32G 起步16G 的机器连 ASR 服务都可能拉不动。磁盘余量大于 100G首次拉取镜像约 70G。Windows 上若 C 盘紧张在 Docker Desktop 的 Settings → Resources → Advanced 中把 Disk image location 挪到剩余空间充足的磁盘改完点 Apply and restart。服务端的编排文件都在仓库的 deploy 目录直接在里面执行cd deploy docker-compose up -d这条命令会拉取镜像并起三个容器duix-avatar-tts负责声音克隆与语音合成对外端口 18180duix-avatar-asr负责语音识别端口 10095duix-avatar-gen-video负责口型视频合成端口 8383。首次下载流量约 70G、耗时半小时左右建议连 Wi-Fi 等它跑完。看到 Docker 里三个容器全部显示 Running即代表服务端就绪。两种变体按需替换显存吃紧时用docker-compose-lite.yml精简编排它只启动duix-avatar-gen-video一个服务50 系列新显卡改用docker-compose-5090.yml基于 torch 官方预览版构建Ubuntu 22.04 用docker-compose-linux.yml但必须先装好 NVIDIA Container Toolkit 并让 Docker 获得 GPU 运行时否则容器拿不到显卡。客户端是一个 Electron 应用依赖 Node 18。先拿到源码git clone https://gitcode.com/GitHub_Trending/he/HeyGem.ai cd HeyGem.ainpm install npm run dev窗口弹出后顶部是 Create Video 与 Create Avatar 两张卡片、下方是 My Works / My Avatars 两个列表看到这一画面即代表客户端跑通。️ 任务二克隆数字人并产出第一条口播视频本节要达成的结果My Works 里多出一条新记录点开能播放、能下载且口型与内容对得上。在客户端点 Create Avatar上传一段 10 秒左右的视频。这条素材有两个硬要求画面是正脸且视频里必须真的在说话——声音克隆就是从这段音频提取的静音视频会直接失败。另外服务端刚启动完不要立刻创建模特ASR 容器加载模型较慢建议等几分钟再提交否则大概率撞上任务三的 Connection refused。模特建好后点 Create Video选中刚才的形象输入文案或上传音频文件。文案支持中、英、日、韩、法、德、阿拉伯、西八种语言提交后程序先把文案合成为克隆音色再驱动形象合成口型视频。合成产物落在 Windows 的D:\duix_avatar_data数据目录该路径在 compose 文件里以卷挂载约定可以自行修改。看到 My Works 出现新条目且播放正常整条管线就算真正跑通。 任务三拉不动镜像与克隆报错的排查路径本节只回答一个问题卡住时该看哪份日志、该改哪个配置。最高频的卡点是docker-compose up -d拉取镜像时反复出现 request canceled 或超时报错指向 registry-1.docker.io——原因是 Docker Hub 官方源连接不稳。解法是在 Docker 的 daemon 配置里增加registry-mirrors镜像源数组保存后重启 Docker再执行一次 up第二高频问题是定制模特时报Connection refused日志里指向 funasr 的 websocket 建连失败。原因是 ASR 服务尚未加载完成等服务全部 Running 后再等几分钟重试即可若机器内存只有 16GASR 可能根本起不来需要升级内存。排查时你需要两份日志。客户端的从右上角设置菜单进入服务端的在 Docker 中点开对应容器的 Logs 页签直接复制关键段落更多条目例如 heygen-tts 容器反复重启见仓库自带的 常见问题。 进阶把数字人能力接到自己的程序如果你的目标不是点界面而是把克隆能力嵌进自己的服务直接打本地端口即可调用链与客户端界面走的是同一套。三个容器对外暴露的端口就是调用入口18180 管声音/v1/preprocess_and_tran做参考音频预处理、/v1/invoke做语音合成8383 管视频/easy/submit提交合成、/easy/query查询进度。完整链路四步把源视频拆成静音视频加音频 → 音频调用 18180 的预处理接口拿到 reference 音频与文本两个参数 → 带着这两个参数调/v1/invoke合成克隆音色的配音 → 把音频与静音视频一起提交 8383 出片。各接口的参数样例与返回结构可直接参照客户端主进程中的现成实现src/main/service/ 下的 model.js、voice.js、video.js 分别对应形象、声音、视频三条链路。下一步打开客户端点 Create Avatar上传一段自己说话的十秒视频若克隆环节报 Connection refused对照任务三第二条处理镜像拉不动则按任务三第一条加镜像源后重跑docker-compose up -d。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考