拓冰建站拓冰建站
首页 / 资讯中心 / 正文

一段10秒视频,就能跑起这套开源AI数字人

一段10秒视频就能跑起这套开源AI数字人【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar之前想给一门课拍段口播视频算上棚、设备、剪辑的钱再加上录砸了重来的时间成本比内容本身还贵。后来试了 Duix.Avatar一套开源 AI 数字人工具喂它一段 10 秒真人视频就能克隆你的形象和声音之后输入文字或上传音频它替你出镜念稿全程本地离线运行素材不出你的电脑。它是一整套本地克隆数字分身、批量产出口播视频的解决方案。这篇文章你能带走三样东西10 秒视频 → 形象与声音模型 → 口播成片背后的完整链路Windows 上最短的部署路径以及第一次跑起来时界面长什么样部署和使用中最常踩的三个坑以及日志该往哪里看⚡ 它到底是怎么工作的三个本地服务干完所有活输入→处理→输出的链路拆解别被数字人这个词唬住它的链路很朴素全部由本地 Docker 里的三个服务完成语音识别ASR基于 FunASR、语音合成TTS基于 Fish-Speech、视频合成。可以把训练模特理解成给一段 10 秒视频建档程序把视频拆成无声视频和音频两部分无声部分做人脸特征训练把你的表情、口型习惯抽出来存成形象模型音频部分做声纹训练把音色特征抽出来存成声音模型。你可以把它类比成办一张自己的证件照加声纹备案——备案一次之后随时调用。之后想做新视频就不用再真人出镜了输入文字或上传音频TTS 用你的声音念出来视频合成服务再拿形象模型逐帧对齐音频。口型之所以自然是因为它是从你自己的 10 秒里学来的。和上一代方案最核心的一个差异如果你用过云端 SaaS 数字人流程大概是这样的视频传到对方服务器按分钟计费敏感内容根本不敢上传。这个项目最核心的差异是把整条链路搬进了本地 DockerASR、TTS、视频合成三个服务都只监听本机回环地址你的视频和音频从头到尾不离开电脑。据社区反馈这也是企业内部培训、医学科普这类内容不能出内网场景选择它的首要原因。其次是硬件门槛被显著拉低。前一代开源数字人方案普遍要求高端显卡而这套方案 8G 显存RTX 3060 级别就能跑起来还有面向低配机器的单镜像 lite 版。对一个要装在自己电脑上的工具来说这比任何参数都重要。 上手体验从克隆到成片只要三步最小化跑通我试了一下午走的 Windows Docker 路径最短路线是这样的git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -d然后就是等。首次拉镜像大约 70G 流量视网速需要半小时到一小时。Docker 里看到 Duix.Avatar-asr、tts、gen-video 三个服务都 Running服务端就就绪了。客户端不用自己编译从官方 Releases 页下载构建好的安装包双击安装即可。装完它直接连本机服务不需要配端口、不需要联网。第一次生成结果时你会看到什么先创建模特上传一段你对着镜头说话的 10 秒以上视频训练完成后我的模特列表里就多了一个数字分身。再创建视频选这个模特输入一段文字点生成。界面会先走语音合成、再走视频合成全程有进度反馈。完成后成片出现在我的作品列表里可以直接点开播放。我第一次看数字版的我念测试文案时特意从头听了一遍确认音色没有怪味再逐帧看口型。效果属于可用、接近真人用来批量产出口播内容绰绰有余。三个真实使用场景做知识付费课程的人以前每节课都要出镜录一天现在晚上写好稿子早上数字分身念完更新节奏翻倍而且不用重录。要批量出产品短视频的团队同一个数字分身配上不同脚本一天生成几十条口播成片形象、音色统一直接分发给多个平台。做旅行 Vlog 的自媒体把数字分身嵌进实景素材做画外解说一个人干完出镜 配音 剪辑的活赶时间出不了镜也不用断更。容易踩的坑 快速排错别急着关页我踩过的坑社区里基本都重复过。先记住排查顺序先看服务再看日志。拉镜像超时三个服务起不来。现象是执行 compose 命令后报 request canceled 或 context canceled。原因是 Docker Hub 官方源连接不稳定70G 的镜像下不动。解法是在 Docker 的 daemon.json 里配置国内镜像源重启 Docker 后再执行doc/常见问题.md 里有现成配置示例可参照。创建模特时报 Connection refused。这个报错容易吓到人但它通常不是你的配置问题。原因是 ASR 服务启动比较慢启动后的头几分钟内请求会被直接拒绝另一种可能是内存只有 16G服务起不稳。解法服务端起来后等 5 分钟再操作内存不足 32G 的机器建议先加内存。新增模特时报错提示视频不可用。原因很隐蔽上传的视频必须有声音而且得是人在说话——程序要拿这段音频做声音克隆纯画面没有意义。解法重录一段 10 秒以上、声音清晰、人脸对镜头的视频。卡住时先敲docker ps看三个服务是否都在 Running。服务端日志打开对应容器的 Logs 页复制关键报错段落客户端日志在右上角设置菜单里的Open Log入口。仓库的常见问题文档 里还有提问模板带上日志再去排查效率高得多。硬件/环境要求一张表配置项最低要求推荐配置备注系统Windows 10 19042.1526 或 Ubuntu 22.04Windows 11 / Ubuntu 22.04 桌面版两条官方完整验证过的路径显卡NVIDIA 显卡8G 显存装好驱动RTX 4070 或更高50 系显卡有专用 docker-compose-5090.ymlnvidia-smi看不到卡就先装驱动CPUi5 级十代及以上i5-13400F算力全在本地不产生云端费用内存16GASR 可能起不来32G 及以上官方文档把 32G 列为必要项磁盘数据盘空闲 30G 以上空闲 100G 以上首次拉镜像约 70Glite 单镜像版占用明显更小软件Docker NVIDIA 驱动 Nodejs 18Docker Desktop 最新版lite 版只有一个视频合成服务显存与磁盘要求更低写在最后一句话总结它适合想把课程、产品视频、自媒体口播这类内容批量做出来又希望素材始终留在自己电脑里的你。仓库是 Duix.AvatarGitHub 上的 duixcom/Duix.Avatargit clone 地址见上文开源协议允许免费商用用户量超过 10 万或年营收超过 1000 万美元的企业需签署商业许可细则见仓库里的 LICENSE 与协议 PDF。下期打算接着写如何把它的模型训练与视频合成开放 API 接进自己的内容流水线。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门