拓冰建站拓冰建站
首页 / 资讯中心 / 正文

【2026实测】AI数字人本地部署零基础上手:10秒克隆你的形象和声音,完整跑通指南

【2026实测】AI数字人本地部署零基础上手10秒克隆你的形象和声音完整跑通指南【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar还在把口播视频外包给别人做吗一条上千块脸还是别人的。Duix.Avatar 是一个开源的 AI 数字人 工具用你自己 10 秒的视频就能克隆形象和声音全程 本地部署 不联网输一段文字就能产出会说话的视频。跑起来30分钟用 Docker 拉起数字人服务推荐配置一张表说清CPU内存显卡存储13代 Intel i5-13400F 起32GB必要RTX 4070仅支持英伟达空闲 100GB 以上Win 系统 C 盘 100G D 盘 30G50 系新显卡有专门配置进阶一节里有说法。六步启动动作确认系统装过 WSL并更新到最新版。 命令wsl --update预期终端无报错。没装过 WSL 的先按项目 README 里的说明安装。动作确认显卡和驱动就位。 命令nvidia-smi预期屏幕显示显卡型号和驱动版本。 ⚠️ AMD 显卡直接出局全部算力都跑在英伟达卡上没装驱动一个服务都起不来。动作拿到项目代码。 命令git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar预期当前目录出现 Duix-Avatar 文件夹。动作进入 deploy 目录启动服务集群。 命令docker-compose up -d预期开始拉 3 个镜像总流量约 70GB建议连 WiFi大概半小时。Ubuntu 用户改用 deploy 目录里的 docker-compose-linux.yml 启动。动作确认容器活过来了。 命令docker ps预期3 个服务 Runningduix-avatar-tts、duix-avatar-asr、duix-avatar-gen-video端口 18180、10095、8383 全部映射成功。动作装客户端。 操作下载官方发布的安装包双击安装程序。 预期能打开首页出现创建视频和创建形象两个入口。✅ 验证清单开始创作前自查 4 项3 个容器都是 Running没有 Restarting浏览器访问 127.0.0.1:18180 有正常响应8383 端口能通客户端能进首页不报连接错误它怎么干活10秒视频是怎么变成口播视频的合成之前系统先干一件铺垫的事把你视频里说的话转写成文字。这一步是 ASR自动语音识别机器听你说话并转成文字。不先搞清楚这段音频里说了什么词机器就没法学你的声音。剩下两个核心环节声音克隆从 10 秒音频里提取音色特征给你建一份声纹。之后输入文字TTS文本转语音用你克隆的声音把文字念出来直接产出你的配音。 类比像把旧收音机的声卡拆出来装进新收音机你喂什么词它都用你的嗓子唱。 关键数字喂进去的样本只要 10 秒左右。口型视频合成画面背景、身体动作都保持原样只有脸被重新驱动。 类比像给一张定格照片做对口型换脸人不动脸在动嘴型跟着音频走。 关键数字合成容器的共享内存配了 8G显存小的卡最容易在这步被挤爆。玩出花接上 API 批量生成数字人视频首页界面够个人用了想批量生产就直接调接口。Docker 起来后服务暴露在本地 127.0.0.118180 管音频8383 管视频。场景同一个数字人给 20 个人发周报开场白各不一样。 参数调 8383 的 /easy/submit传 audio_url音频路径、video_url静音视频、code唯一 key外加三个固定值 chaofen0、watermark_switch0、pn1再用 /easy/query 带 code 轮询进度。 效果绕开客户端写个循环提交批量出片不盯屏。场景同一段文字想让配音更稳一点或语调更活一点。 参数调 18180 的 /v1/invoketemperature 和 topP 默认 0.7max_new_tokens 1024reference_audio 和 reference_text 填训练那一步的返回值。 效果0.7 是稳态调低更平稳调高语调变化更多。场景内存吃紧或者用的是 50 系新卡。 参数deploy 目录改跑 docker-compose-lite.yml只起 1 个 gen-video 容器5090 用户换 docker-compose-5090.yml。 效果lite 版不起 ASR 和 TTS镜像更小但没法克隆声音5090 配置用的是 torch 官方预览版。具体调用逻辑看仓库里的 src/main/service/voice.js 和 src/main/service/video.js抄就行。踩坑实录我第一周栽过的 4 个真问题拉镜像一直失败满屏 request canceled 和 context canceled。 根因Docker Hub 官方源在国内网络下不稳定。 修复Docker 设置的 Docker Engine 里加一段镜像源配置doc/常见问题.md 里有现成的 registry-mirrors点 Apply restart再重新拉。C 盘两天就被塞满。 根因3 个镜像共 70GB默认全躺在 C 盘。 修复Docker 设置 → Resources → Advanced → Disk image location换个空间足的盘Apply restart。客户端新增模特报错日志里是 file not exists。 根因上传的模特视频必须带人说话的声音程序要把音频拆出来做声音克隆音频会写进容器约定的 d:/duix_avatar_data/voice/data 目录。没声音、或者这个目录压根不存在都会翻车。 修复重拍一段你说话清晰的片段确认 D 盘的挂载目录存在。服务刚起来就点克隆形象报 Connection refused。 根因ASR 服务启动偏慢你连得太早自然被拒。 修复启动后等几分钟再操作用 docker ps 确认 3 个服务都 Running。内存只有 16G 的话 ASR 可能根本起不来加到 32G。收尾三个服务跑起来形象克隆好你手里就有了一个用自己脸和嗓子念稿的视频。接下来可以试试调 /v1/invoke 的 temperature看看声音会不会更有起伏。再卡住的话先翻 doc 目录下的常见问题八成有人替你踩过。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门