拓冰建站拓冰建站
首页 / 资讯中心 / 正文

Duix.Avatar:10秒素材克隆数字人完整指南

Duix.Avatar10秒素材克隆数字人完整指南【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarDuix.Avatar 是一款完全开源的 AI 数字人视频合成工具上传一段你自己的短视频它就能在本地克隆你的外貌和声音再靠文本或语音驱动它开口说话。传统 3D 数字人制作要数十万美元现在降到 1000 美元级——成本直接砍掉 99%而且全流程离线数据不出你的电脑。3组数据说明它凭什么值得换传统路线做数字人动捕棚 建模团队 数周周期 数十万美元报价。Duix.Avatar 路线一段自拍视频 一张 NVIDIA 显卡 半小时部署。差异具体到三个点上痛点外包 3D 数字人数十万美元起步。方案用真人视频数据本地训练模型。收益制作成本降到 1000 美元级降幅 99%。痛点在线生成 API 必须把素材和声音传到云端隐私风险自担。方案ASR、TTS、视频渲染三个服务全部跑在本机 GPU。收益外网流量为 0完全离线。痛点自己接 ASR/TTS/视频模型得先会 Python 再会工程。方案3 个 Docker 镜像 docker-compose 编排Electron 客户端管界面。收益拉镜像约 30 分钟图形界面开箱即用。核心模块拆解3个服务怎么配合跑起来整套架构是三个容器 一个客户端语音克隆、视频合成各占一个服务客户端负责串流程。️ 语音克隆本地 TTS 服务把你的一句话音频变成你嗓子的任意文本朗读。底层是 Fish-Speech语音合成TTS: Text To Speech服务监听 18180 端口走/v1/invoke接口传reference_audio参考音频和reference_text再带上topP: 0.7、temperature: 0.7、max_new_tokens: 1024这类采样参数即可。传统 TTS 只有固定内置音色它能从一段参考音频里复刻你的语速、语气和音色。 视频合成Face2Face 口型驱动让原视频里的人脸跟着克隆语音做口型。视频服务跑在 8383 端口/easy/submit提交任务传audio_urlvideo_url/easy/query?codexxx轮询进度。容器侧用shm_size: 8g撑住共享内存PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:512抑制显存碎片。传统 3D 管线要建模、绑骨、对口型、渲染好几道工序这里一次接口调用搞定任务队列由客户端本地 SQLite 管理。️ 桌面客户端Electron 任务调度器统一管理数字人模型、声音模型和合成任务。Electron Vue 3 better-sqlite3 本地数据库 fluent-ffmpeg 处理音视频状态机按 draft → waiting → 完成流转轮询服务端更新进度条。不懂代码的人全程点鼠标完成克隆和出片。五步跑通从装环境到出片1. 校验环境显卡、Docker、WSL核心操作nvidia-smi docker --version wsl --list --verbose踩坑提醒❌ AMD/核显不行三个服务起不来❌ C 盘空闲 100GBDocker 镜像放不下✅ 推荐 i5-13400F 32G 内存 RTX 4070✅nvidia-smi必须能看到显卡型号2. 拉起服务一键启动3个容器核心操作git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -d docker ps踩坑提醒❌ 首次拉取约 70GB 流量中途别断电断网❌docker ps不是 3 个 UP先查日志再重启✅ 50 系显卡改跑docker-compose-5090.yml✅ 显存紧张可跑 lite 版docker-compose-lite.yml3. 装客户端安装包或 AppImage核心操作# Windows: 双击 Duix.Avatar-x.x.x-setup.exe 安装 # Ubuntu root 桌面下需加参数启动 ./Duix.Avatar-x.x.x.AppImage --no-sandbox踩坑提醒❌ 别装在含中文的路径下❌ 不要同时开多个客户端实例✅ 连不上服务端检查防火墙放行 8383/181804. 训练模型一段视频克隆外貌和声音核心操作# 客户端点 Create Avatar上传10~30秒正面 MP4 视频 # 系统自动拆出音频与无声视频分别送 TTS 和 Face2Face 训练踩坑提醒❌ 视频里戴帽子、墨镜特征提取会翻车❌ 多人同框或频繁遮挡面部训练失败✅ 分辨率 ≥720P背景简单、光线均匀5. 生成视频文本变成片核心操作# Create Video → 选模型 → 输入文本或上传音频 → Generate # 音频走 18180 合成成片走 8383 渲染客户端轮询进度踩坑提醒❌ 单次文本 500 字容易显存溢出❌ 合成中途关掉客户端任务队列会卡住✅ 渲染失败先查显存不够就降分辨率真实场景怎么用老师、客服、自媒体做课程视频的老师谁在用要批量产出标准化课程视频的讲师怎么搭训练一个虚拟讲师模型多门课程复用同一形象长课脚本分段处理单次不超过 500 字防溢出渲染走本机 8383 服务批量任务排队提交效果单课制作成本降 80%日均产出 300 分钟课程视频搭客服数字分身的运营谁在用需要 7×24 多语言自助视频的企业客服团队怎么搭用金牌客服形象克隆一个数字分身训练正式/亲切两种音色中、英、日、韩等 8 种语言脚本直接出片FAQ 视频预生成缓存长尾问题再走动态渲染缓存优先效果常见咨询从人工分钟级应答变成视频秒级自助8 语言一套配置全出日更口播的自媒体谁在用个人博主要周更甚至日更口播视频怎么搭工作流接成文案 → TTS 音频 → 视频渲染三段管线口型精度优先时用音频驱动模式音频采样率 44.1kHz换背景用绿幕素材后期替换更省时间效果周产出 3 条 → 15 条单条制作时间缩 75%进阶改代码、调参数、找社区二次开发接自己的 TTS 可参考 src/main/service/voice.js 的合成流程新增服务端调用参考 src/main/api/request.js 的请求封装改界面参考 src/renderer/src/views 下的 Vue 组件性能调优显存吃紧先切 720P 出片lite 版单容器部署走docker-compose -f指定文件即可不用动主配置社区资源排错先看 doc/常见问题.md问题提项目 issue社区更新很快Duix.Avatar 把模型声音视频合成整条链路搬进一台有显卡的电脑离线、免费、零门槛。以后做一个自己的数字人大概就和装个应用一样顺手。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门