拓冰建站拓冰建站
首页 / 资讯中心 / 正文

如何从零跑通 Open-Sora Plan:开源文生视频模型的完整上手教程

如何从零跑通 Open-Sora Plan开源文生视频模型的完整上手教程【免费下载链接】Open-Sora-PlanThis project aim to reproduce Sora (Open AI T2V model), we wish the open source community contribute to this project.项目地址: https://gitcode.com/GitHub_Trending/op/Open-Sora-PlanOpen-Sora Plan 是一个由北大-兔展 AIGC 联合实验室发起的开源项目目标是复现 OpenAI 的 Sora 文生视频模型支持输入一段文字描述、输出一段可播放视频。项目由兔展、华为、鹏城实验室和开源社区共同贡献采用 Apache 协议开源最新版本 v1.5.0 完全基于华为昇腾训练。本文带你走通看懂项目→装好环境→跑通第一段视频→进阶玩法→训练与部署的完整路径。先搞懂它能做什么、做到什么程度在动手之前先花两分钟搞清楚这个仓库的定位能帮你少走弯路。它的核心就一件事文本到视频text-to-video的生成附带图像生成、图生视频I2V和视频重构等能力。版本演进从 21D 到真 3D 再到稀疏加速仓库在 docs/ 下保留了从 v1.0.0 到 v1.5.0 的完整技术报告可以直接按版本号查阅演进过程v1.0.021D 架构提升画质与文本可控性v1.2.0改用 3D full attention 的真 3D视频扩散模型支持 4 秒 720p并上线图生视频v1.3.0引入 WF-VAE、提示词精炼器prompt refiner、数据过滤、稀疏注意力与 bucket 训练策略93 帧 480p 可在 24G 显存内推理v1.5.0换上更高压缩率的 WF-VAE 与改进的稀疏 DiT 架构 SUV用 8B 规模模型 4000 万视频样本性能对标同级别的 HunyuanVideo且全程在昇腾 910 上训练推理。两个核心模块WF-VAE 与 SUVREADME 里把这两点列为亮点WF-VAE 采用 8×8×8 的下采样率在 PSNR 上超过 Wan2.1 使用的 VAE同时降低其上层 DiT 的训练成本SUV 稀疏注意力架构在保持接近稠密 DiT 性能的同时带来超过 35% 的加速。视频压缩部分源码在 opensora/models/causalvideovae/扩散模型主体在 opensora/models/diffusion/。环境装好跑通第一段生成的视频这一步的目标只有一个让文字真正变成一个 mp4。安装依赖与准备权重仓库依赖固定在 pyproject.toml 中要求 Python ≥3.8锁定 torch 2.1.0、diffusers 0.30.2、deepspeed 等版本建议先建一个独立环境再安装git clone https://gitcode.com/GitHub_Trending/op/Open-Sora-Plan cd Open-Sora-Plan pip install -e .安装完成后需要从仓库 README 的 Resource 表格对应版本下载预训练权重例如 v1.3.0 的Open-Sora-Plan-v1.3.0。注意 v1.3.0 的帧数需满足 4n1如 93、77、61、45、29推理分辨率保持 32 的倍数。用 sample.py 出第一段视频推理入口是 opensora/sample/sample.py它同时兼容 GPU 与昇腾 NPU检测到torch_npu时自动走 NPU 分支。最省事的办法是直接参考仓库现成的采样脚本 scripts/text_condition/gpu/sample_t2v_v1_3.sh它用torchrun起多卡、指定--num_frames 93 --height 352 --width 640、--guidance_scale 7.5、--num_sampling_steps 100等参数把提示词文件指向examples/sora.txt里的现成英文描述即可。你只需把里面的模型路径与 VAE 路径换成自己下载的位置。从命令行到网页控制台命令行适合批量出片网页控制台适合边调边看效果两种入口都封装得比较薄。命令行批量采样opensora/sample/sample.py支持--text_prompt传入一个文本文件文件里每行一个提示词就能一次跑出多条视频输出统一落到--save_img_path目录。仓库自带 examples/sora.txt 提供了几十条可直接使用的提示词样例覆盖城市街景、动物、电影镜头等多种风格非常适合拿来当上手测试集。网页控制台交互式生成opensora/serve/gradio_web_server.py 基于 Gradio 搭了一个交互界面启动后在浏览器里填提示词、点 Run 就能出片python opensora/serve/gradio_web_server.py \ --model_path v1.3 权重目录 --version v1_3 \ --gradio_port 11900界面上暴露了种子、帧数1~93、生成数量、guidance scale默认 7.5、推理步数默认 50等滑杆并预置了一批可一键填充的示例提示词。生成结果会按采样方法_gs步数的规则命名存到本地方便回溯每次用的参数。进阶润色提示词、图生视频与帧插值跑通第一段视频后下面几块能力能明显提升成片质量。提示词精炼器v1.3.0 提供了 prompt refiner把简短描述自动扩写成包含主体、动作、场景、镜头语言的完整句子。模型与训练数据见 docs/Prompt_Refiner.md官方开源了 32,555 条训练对含中文数据核心代码在 opensora/models/prompt_refiner/。在推理入口里通过--caption_refiner指定权重即可在生成前自动润色命令行与网页控制台都支持。图生视频与帧插值图生视频I2V从 v1.2.0 起支持可给定首帧/尾帧条件做过渡生成提示词与图片路径样例在examples/cond_prompt.txt和examples/cond_pix_path.txt。另外 opensora/models/frame_interpolation/ 内置了基于 AMT-G 网络的帧插值模块含 RAFT 光流可用来补帧、提升流畅度配合enhance_videoVEnhancer还能在出片后做二次增强。训练自己的模型与多机部署如果你有数据与算力这个仓库把训练链路也开源了。微调与训练文生视频训练入口是 opensora/train/train_t2v_diffusers.py参考 scripts/text_condition/gpu/train_t2v_v1_3.sh 可用accelerate launch拉起 DeepSpeed脚本里配置了模型规模、文本编码器如 mt5-xxl、VAE 路径、batch、学习率、EMA、梯度检查点等参数数据清单指向scripts/train_data/merge_data.txt。CAVAE 与 inpaint 的独立训练入口分别是opensora/train/train_causalvae.py和opensora/train/train_inpaint.py。多机与昇腾 NPU 部署多机多卡靠 accelerate 的配置文件管理仓库在 scripts/accelerate_configs/ 提供了 DDP、DeepSpeed ZeRO-2/ZeRO-3 及 offload 等多种 yaml按需替换--config_file即可。v1.5.0 则面向昇腾推理与训练脚本在scripts/text_condition/npu/下与 GPU 版参数基本一一对应权重目前仅兼容 NPU MindSpeed 框架详见 v1.5.0 报告 docs/Report-v1.5.0.md。权重从哪来、版本怎么选选型时按显存和需求对号入座显存紧张、想快速体验选 v1.3.0 的 93 帧 480p24G 可跑要更长更清晰选 v1.3.0 的 640×640 任意尺寸或 v1.2.0 的 720p追求画质与压缩效率上限、且手头是昇腾环境直接上 v1.5.0。所有权重地址都列在 README 的 Resource 表格里各版本对应的技术细节分别对应 docs/Report-v1.2.0.md、docs/Report-v1.3.0.md 与 docs/Report-v1.5.0.md。项目遵循 LICENSEApache你可以自由使用并贡献回社区。【免费下载链接】Open-Sora-PlanThis project aim to reproduce Sora (Open AI T2V model), we wish the open source community contribute to this project.项目地址: https://gitcode.com/GitHub_Trending/op/Open-Sora-Plan创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门