Pixelle-Video 数字人视频教程:3 步从文字生成 AI 口播短视频
Pixelle-Video 数字人视频教程3 步从文字生成 AI 口播短视频【免费下载链接】Pixelle-Video AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video做短视频账号的人都熟悉这套流程想个选题、写脚本、录配音、找配图最后丢进剪辑软件逐帧对齐。一条片子半小时起步想日更基本靠命。Pixelle-Video 是个开源的 AI 全自动短视频引擎你输入一个主题它自动完成写文案、AI 生成配图、语音合成、背景音乐和最终合成直接产出成片另外它还带数字人口播功能上传人物形象就能让人出镜说话。这篇文章按真实使用顺序把从零安装到跑通第一条视频的过程和踩坑点讲一遍。安装启动两个前置依赖和一条命令先装两样东西uvPython 包管理器和ffmpeg视频处理。ffmpeg 在 macOS 上brew install ffmpegUbuntu 上sudo apt install ffmpeg。然后克隆仓库启动git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video uv run streamlit run web/app.py浏览器会自动打开http://localhost:8501。Windows 用户省事很多直接下载官方一键整合包解压后双击start.bat就行不用碰 Python 环境。首次打开要在「⚙️ 系统配置」面板填三块内容LLM 配置选通义千问、GPT-4o、DeepSeek 或 Ollama 等预设填 API Key、ComfyUI/RunningHub 配置、以及可选的 API 媒体模型配置。这里给个取舍建议本地有显卡就用 Ollama 本地 ComfyUI全程 0 元没显卡又嫌部署麻烦就先配 RunningHub 云端的 Key能直接出图追求性价比选通义千问项目文档里写的实际花费是一个 3 段视频约 0.01~0.05 元。横屏电影模板的成片画面风格模板库覆盖竖屏、横屏、方形三种尺寸生成第一条视频默认配置只改一个地方Web 界面是三栏布局左侧「内容输入」中间「语音视觉设置」右侧「生成与预览」。新手其实可以全用默认值只改左侧的主题。生成模式选「AI 生成内容」输入一个具体主题比如为什么要养成阅读习惯分镜数默认 5 个。如果你手头已经有写好的完整文案选「固定文案内容」直接粘贴AI 写稿这一步就跳过了——这个模式对小说解说、固定栏目这类场景特别实用。中间栏不用动TTS 工作流默认 Edge-TTS免费且够听图像工作流和模板用默认即可。点击右侧「生成视频」进度会精确到分镜级别比如分镜 3/5 - 生成插图。5 分镜的视频大概 2~5 分钟出片视频自动在右侧播放文件落在项目根目录的output/文件夹。图文模板的横屏效果每个分镜对应一张 AI 配图需要人出镜时数字人口播功能的实际用法标准流水线的解说员其实是配图加字幕不是真人。很多账号形式需要有人出镜讲东西这就是数字人口播流水线的用武之地入口在 web/pipelines/digital_human.py。它的输入结构很轻一段文本、两张人物形象图片、一段音频就能生成数字人视频。上传界面支持 JPG/PNG/WebP最多放三张素材要清晰且内容相关。它替你省掉的是数字人视频最大的麻烦——单独搭一套口型驱动、形象生成和合成的环境在这里就是一次上传加一次生成。数字人相关的工作流放在 workflows/runninghub/ 下三个文件分工不同digital_image.json负责生成数字人形象digital_combination.json做数字人与素材的合成digital_customize.json用于完全自定义。实际建议的路径是手头没有现成人物形象先用标准流程或digital_image生成一张满意的图再走组合流程出视频比直接硬凑效果好。决定成片好坏的 3 个开关生成完第一条后你大概会发现能不能看基本由这三个参数决定。文案质量取决于 LLM 模型。同一个主题换通义千问和换 GPT-4o文风差别不小这是最便宜的优化手段——不用重跑其他环节换个模型重新生成就行。配图风格主要靠提示词前缀Prompt Prefix控制注意这里要求填英文。比如想统一成极简火柴人风格就填Minimalist black-and-white matchstick figure style illustration, clean lines, simple sketch style。界面有「预览风格」按钮先试一张再批量跑避免 5 个分镜全废了才换风格。图像尺寸默认 1024x1024不同模型对尺寸有不同限制改之前留意一下提示。声音方面Edge-TTS 够用但想用自己的声音或特定音色换 Index-TTS 工作流并上传一段参考音频做声音克隆即可上传后可以直接试听再决定用不用。另外把 MP3 放进bgm/文件夹就能当自定义背景音乐选。宽幅暗色科技风模板适合科技类选题出错了先查这份清单按出现频率排个序ComfyUI 连接失败服务没启动、URL 填错、防火墙拦截是最常见三种原因。界面有「测试连接」按钮先点它别急着改代码。LLM 调用失败API Key 写错、断网、余额不足。错误提示一般会指明具体原因照着改。图像/视频生成失败检查工作流 JSON 是否存在、ComfyUI 是否已下载所需模型、磁盘空间够不够。生成太慢减分镜数、换更快的 LLM、本地 ComfyUI 比云端排队快。更完整的排查步骤在 docs/zh/troubleshooting.md纯文本模板static_*.html开头甚至不需要 ComfyUI环境实在搭不起来时可以先用它跑通全流程体验完整链路后再补图像生成。下一步现在就跑uv run streamlit run web/app.py主题填一个你熟悉的领域比如如何提高工作效率全程不动任何默认参数等 3 分钟。拿到成片后只换 LLM 模型再跑一次对比两次文案差异——这一步比读十篇文档更能帮你理解每个参数在管什么。【免费下载链接】Pixelle-Video AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考