拓冰建站拓冰建站
首页 / 资讯中心 / 正文

一张照片加一段音频,SadTalker 数字人视频生成完整实战指南

一张照片加一段音频SadTalker 数字人视频生成完整实战指南【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalkerSadTalker 是一款来自 CVPR 2023 的开源数字人视频工具给它一张正面人像照片和一段语音它就能输出口型、表情、头部动作同步的会说话的人脸视频。整个过程本地离线运行不需要你懂 3D 建模也不需要部署云端服务适合做虚拟主播、数字代言人或动画角色的快速原型。它到底解决什么问题大多数会说话的头像方案要么依赖真人拍摄要么需要 3D 模型参数门槛都偏高。SadTalker 的思路是把人脸动起来这件事拆成两步学习先用音频编码网络从语音里预测出 3D 面部运动系数表情、眨眼、姿态再把这些系数喂给一个重渲染网络把单张静态照片逐帧演出来。这意味着它的输入门槛低到只有一张图和一段音频仓库里自带的示例就说明了这一点示例人像examples/source_image/从写实照片到插画风都有示例音频examples/driven_audio/覆盖中文、英文、日文等多种语言参考视频examples/ref_video/用于进阶的姿态控制三步跑通你的第一段数字人视频第一步克隆仓库并装好依赖环境要求不苛刻Python 3.8、一个可用的 ffmpeg以及 PyTorch有 NVIDIA 显卡时建议带 CUDA 版本。git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker pip install -r requirements.txt更完整的分系统安装说明含 macOS、WSL、Docker在 docs/install.md。装完依赖还差最后一块拼图模型权重。第二步一键下载模型权重SadTalker 需要一批预训练权重映射网络、音频编码器、渲染器、GFPGAN 增强模型等仓库提供了 Linux/macOS 下的批量下载脚本执行完会在本地生成checkpoints/和gfpgan/目录bash scripts/download_models.shWindows 用户可以参照 docs/FAQ.md 中的说明手动放置。权重就位后推理阶段不会再产生任何下载全程离线。第三步生成第一个会说话的视频python inference.py --driven_audio examples/driven_audio/chinese_news.wav --source_image examples/source_image/art_0.png跑完后成片会按时间戳保存到results/目录下。到这一步你就已经拥有了自己的第一段数字人视频。输入图怎么选crop 模式和 full 模式的分野第一次跑通之后最容易困惑的其实是--preprocess这个参数它决定了输出画面长什么样crop默认只保留检测到的面部区域做动画生成的是裁剪后的脸部特写表情和头部动作最自然full动画只作用于面部区域随后贴回原图输出完整画面。想要全身照会说话的效果就用它且建议配合--still使用头部动作会更收敛resize把整张图缩放到渲染分辨率输出适合证件照式构图对全身照效果不佳extcrop/extfull在裁剪前做人脸对齐矫正姿态偏歪的图更稳一张好的人脸特写图通常意味着更好的结果面部无遮挡、光线均匀、分辨率不低于 512x512。仓库的 docs/best_practice.md 里用同一张输入图对比了各模式的实际差异值得花两分钟看完。进阶把数字人的活人感调出来默认的 crop 模式已经可用但真正让成片从能看到耐看的是下面这几个开关。表情力度--expression_scale。默认值是 1.0调大比如 1.5嘴部动作会更夸张、更有表演感觉得太浮夸就往回压。这是最便宜、见效最快的一根滑杆。静态模式--still。复用原图的头部姿态抑制额外的头部运动和眨眼。做全身照动画、或者希望画面稳如定格朗读时用这个。参考视频--ref_eyeblink和--ref_pose。这是进阶玩法里最实用的给一段真人视频SadTalker 会从中借走眨眼节奏和头部姿态让目标人脸继承那种自然的韵律。参考视频比音频短时会自动循环播放。仓库里有两个现成参考视频可直接试。面部与背景增强。加--enhancer gfpgan或RestoreFormer对人脸做修复增强皮肤质感会明显更细腻再叠加--background_enhancer realesrgan则是对整段视频做超分。两者需要额外安装对应包具体说明见 docs/best_practice.md。自由视角--input_yaw / --input_pitch / --input_roll。直接指定头部在时间轴上的偏航、俯仰、翻滚角度序列例如--input_yaw -20 30 10可以生成特定朝向的说话镜头适合需要侧头讲解这类固定机位的场景。卡住了先看这两份文档环境类问题ffmpeg 找不到、dlib 在 M1 上报错、显存不足、权重文件损坏等在 docs/FAQ.md 里都按错误信息列好了多数情况抄一行命令就能解决。音频格式上注意只支持 wav 或 mp3m4a、flac 需要先转码。配置类的取舍——每种 preprocess 模式、增强器、参考视频各自适合什么画面——则集中在 docs/best_practice.md。如果嫌命令行麻烦也可以用python app_sadtalker.py起一个本地 Gradio 界面或者直接双击webui.bat/ 运行bash webui.sh参数在网页上点点就行想集成进 stable-diffusion-webui 的话仓库也提供了扩展脚本说明在 docs/webui_extension.md。上手前把这份资源清单存在手边资源位置用途示例人像examples/source_image/试错时的输入图风格覆盖较全示例音频examples/driven_audio/中英日多语言驱动音频参考视频examples/ref_video/姿态/眨眼参考模式演示权重下载脚本scripts/download_models.sh一键拉取全部 checkpoint安装文档docs/install.mdmacOS / WSL / Docker 等环境说明常见问题docs/FAQ.md报错自查第一站配置指南docs/best_practice.md各模式参数取舍与效果对比跑通第一条视频之后剩下的工作基本就是围绕inference.py的参数做取舍。把一张合适的正脸图和一段干净的语音放进去调好表情力度你的第一支数字人视频就会落在results/里。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门