十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Open-Sora Plan 开源视频生成全指南:从 Sora 复现到 8.5B SUV 稀疏 DiT 的昇腾全栈训练与推理实践

Open-Sora Plan 开源视频生成全指南:从 Sora 复现到 8.5B SUV 稀疏 DiT 的昇腾全栈训练与推理实践 Open-Sora Plan 开源视频生成全指南从 Sora 复现到 8.5B SUV 稀疏 DiT 的昇腾全栈训练与推理实践【免费下载链接】Open-Sora-PlanThis project aim to reproduce Sora (Open AI T2V model), we wish the open source community contribute to this project.项目地址: https://gitcode.com/GitHub_Trending/op/Open-Sora-PlanOpen-Sora Plan 是一个以开源社区力量复现 OpenAI Sora文生视频大模型为目标的项目由北大-兔展AIGC联合实验室发起华为、鹏城实验室及开源社区伙伴深度参与。本文以仓库 README.md 为入口结合其正式技术报告 Report-v1.5.0.md 与仓库源码系统讲解项目的技术路线、v1.5.0 的核心架构8×8×8 高压缩 WFVAE 与 SUV 稀疏 DiT、昇腾 910 全栈训练/推理实战命令、自适应梯度裁剪策略以及数据与缩放工程细节。读完本文你将掌握 Open-Sora Plan 的版本谱系、模型权重资源清单、可复现的训练与采样命令并能从源码层面理解 Skiparse Attention 的稀疏化实现原理。一、项目定位以开源社区之力复现 SoraOpen-Sora Plan 的核心目标正如 README.md 开篇所述创建一个**简单、可扩展simple and scalable**的仓库用于复现 OpenAI 的 Sora 文生视频模型。项目名称中的 Plan 强调这是一条由社区共同推进的技术路线图——与单一团队闭门造车不同它欢迎任何开发者通过 Pull Request 和实际使用参与迭代。需要特别强调的是当前v1.5.0 版本完全基于华为昇腾Ascend910 系列加速器完成训练与推理是昇腾纯血版而不是传统的 NVIDIA GPU 为主线的实现。GPU 版本的适配被标记为coming soonREADME.md 的 How to start 章节明确写了 GPU: coming soon...NPU 用户则被引导至mindspeed_mmdit分支查看配置。从 pyproject.toml 也能看到项目生态的技术栈以diffusers、accelerate、deepspeed、transformers为核心依赖Python 版本要求3.8许可证为 Apache-2.0。项目的技术演进有一份清晰的公开记录v1.0.02024.04提升视频质量与文本控制能力、v1.1.02024.05引入 ShareGPT4Video 长视频标注、v1.2.02024.07切换为真正的 3D full attention 架构发布 4s 720p 视频扩散模型、v1.3.02024.10引入 WFVAE、prompt refiner、稀疏注意力 Skiparse 与 bucket 训练策略并支持 24G 显存内生成 93×480p、v1.5.02025.068.5B 参数、完全昇腾训练。每个版本都配有独立技术报告可在 docs 目录下查阅Report-v1.0.0.md、Report-v1.1.0.md、Report-v1.2.0.md、Report-v1.3.0.md、Report-v1.5.0.md。二、v1.5.0 核心技术亮点更高压缩 WFVAE 与 SUV 稀疏 DiTREADME 的 Highlights 章节浓缩了 v1.5.0 的两大卖点而 Report-v1.5.0.md 给出了完整的细节本节将它们展开讲解。2.1 WFVAE8×8×8 高压缩率的潜在空间编码器核心结论v1.5.0 使用8×8×8 下采样率的 WFVAE在压缩率上把时间维从 4× 提升到 8×使潜在特征latent形状减半注意力序列长度随之缩短从而显著降低上层 DiT 的训练成本。性能反超尽管压缩率更高其重建质量仍优于社区广泛使用的 4×8×8 VAE。报告给出的开源域 1K 样本评测表中WF-VAE-M8x8x832 通道的PSNR 达到 36.91高于 CogVideoX36.38与 Wan2.135.77LPIPS 0.0205 与 rFVD 52.53 也处于第一梯队。模型THW(C)PSNRLPIPSrFVDCogVideoX4x8x8 (16)36.380.024350.33StepVideo8x16x16 (16)33.610.0337113.68LTXVideo8x32x32 (128)33.840.0380150.87Wan2.14x8x8 (16)35.770.019746.05OursWF-VAE-M8x8x8 (32)36.910.020552.53WFVAE 的完整原理小波驱动的能量流设计可参考仓库中的 VAE.md 与 v1.3.0 报告 Report-v1.3.0.md 中的 WF-VAE 章节通过小波变换将视频分解为多个子带利用视频大部分能量集中在低频 LLL 子带的统计特性为 LLL 子带能量构建专用传输通路从而简化模型结构、降低推理耗时与显存占用。2.2 SUVU 型稀疏扩散 Transformerv1.3.0 首次把稀疏注意力Skiparse Attention引入视频生成领域。Skiparse 在预定义稀疏度 k 下以Single-Skip 与 Group-Skip 交替的模式从原始序列中选出 1/k 长度的子序列进行注意力交互在保持全局注意力特性的同时把自注意力的理论复杂度降到原来的 1/k。值得注意的边界情况是k1 时等价于 Full 3D AttentionkHW 时则退化为 21D AttentionReport-v1.3.0.md 用平均注意力距离AVG Attention Distance这一度量证明了 Skiparse 在非全注意力方法中与 Full 3D 的建模能力最接近。v1.5.0 的 SUVSparse U-shaped在此基础上做了架构级延伸U 型稀疏度变化把稀疏交互理解为token 级信息下采样——低稀疏度捕获细粒度信息高稀疏度进行语义级交互。因此浅层使用低稀疏度 Skiparse、最浅层使用 Full 3D Attention深层使用高稀疏度 Skiparse形成 U 形分布同稀疏度跨阶段长跳连受 UNet 启发在稀疏度相同的 stage 之间加入 long skip connections不改权重、动态可调Skiparse 只改变前向传播中的注意力计算方式不修改模型权重因此可以在训练过程中动态调整稀疏度低分辨率用低稀疏度、高分辨率用高稀疏度使 FLOPs 随序列长度近似线性增长。从源码看Skiparse 的实现位于 modules.pyOpenSoraAttnProcessor2_0类中的_sparse_1d/_reverse_sparse_1d/_sparse_1d_kv分别完成序列切分、逆变换与 KV 广播核心操作是rearrange张量重排Single-Skip 模式x rearrange(x, (g k) b d - g (k b) d, kself.sparse_n)即每隔 k 个 token 取一个组成注意力作用域Group-Skip 模式x rearrange(x, (n m k) b d - (n k) (m b) d, mself.sparse_n, kself.sparse_n)先把相邻 k 个 token 分组、再以组为单位跳选序列长度不是 k² 的整数倍时会先做 paddingpad_len注意力计算后再裁剪还原。同时Attention.prepare_sparse_mask会为稀疏化后的 Q/K/V 准备对应的注意力掩码文本侧cross-attention的 key/value 则通过_sparse_1d_kv重复 k 倍以对齐稀疏化后的 latent 形状——这与报告text embeddings 不做稀疏化、仅重复对齐的描述完全一致。上层 DiT 模型modeling_opensora.py通过sparse1d、sparse_n等构造参数开启该处理器仓库训练脚本中--sparse1d --sparse_n 4即对应报告采用的 k4 配置。报告中的消融结论在昇腾 910B 上以 121×576×1024 形状测试SUV 比 Dense DiT 快 35% 以上其中注意力操作本身提速超过 45%而性能在相近训练步数内与稠密 DiT 持平。三、模型权重与资源清单全版本README 的 Resource 表格给出了从 v1.0.0 到 v1.5.0 的完整模型矩阵训练/推理前请按下表核对版本、架构与权重版本架构扩散模型CausalVideoVAE数据Prompt Refinerv1.5.0SUV (Skiparse 3D)121x576x1024MindSpeed 格式Anysize_8x8x8_32dimwfvae_888_dim32.ckpt--v1.3.0Skiparse 3D93x640x640、93x640x640_i2vAnysizeprompt_refiner 数据集checkpointv1.2.0Dense 3D93x720p、29x720p、93x480p、29x480p、1x480p、93x480p_i2vAnysizeAnnotations-v1.1.021D221x512x512、65x512x512AnysizeData and Annotations-v1.0.021D65x512x512、65x256x256、17x256x256AnysizeData and Annotations-使用前务必注意 README 中的三条脚注约束v1.2.0 的 29×720p 与 93×480p 权重基于 Panda70M 训练、未经过最终高质量数据微调可能产生水印93×480p 是从 93×720p 微调 3.5k 步得到的社区研究用权重v1.3.0 模型在 stride32 上任意训练推理分辨率需保持 32 的倍数帧数需满足 4n1如 93、77、61、45、29、1v1.5.0 权重仅兼容 NPU MindSpeed-MM 框架这是昇腾纯血版的重要使用前提v1.2.0 起不再支持 21D 模型若使用 v1.2.0 请选择 Dense 3D 架构权重。四、训练实战昇腾 NPU 上的文生视频训练命令解析v1.5.0 的 GPU 版尚未发布README 明确 GPU: coming soon...NPU 用户需要切换到mindspeed_mmdit分支并按其 README 配置环境。不过仓库的 scripts/text_condition/npu 目录给出了可直接参考的 NPU 训练/推理脚本其参数体系与 v1.3.0 主分支一脉相承下面以 train_t2v_v1_3.sh 为例逐段解读注意该脚本为 v1.3.0 配置v1.5.0 在mindspeed_mmdit分支但参数语义通用。4.1 环境变量与分布式配置脚本开头设置了一系列昇腾 NPU 运行环境变量export HF_DATASETS_OFFLINE1 export TRANSFORMERS_OFFLINE1 export TASK_QUEUE_ENABLE0 export HCCL_OP_BASE_FFTS_MODE_ENABLETRUE export MULTI_STREAM_MEMORY_REUSE1 export PYTORCH_NPU_ALLOC_CONFexpandable_segments:True其中HCCL_OP_BASE_FFTS_MODE_ENABLETRUE开启 HCCL 集合通信的 FFTS 模式以提升多卡通信效率PYTORCH_NPU_ALLOC_CONFexpandable_segments:True借鉴了 PyTorch 的显存扩展段分配策略来缓解碎片化。多机训练时可取消注释--machine_rank与--main_process_ip并将加速配置切换为deepspeed_zero2_config.yaml仓库 scripts/accelerate_configs 下还提供了 zero2/zero3 及对应的 offload 变体。4.2 accelerate launch 启动与关键参数训练入口是 train_t2v_diffusers.py通过 accelerate 启动accelerate launch \ --config_file scripts/accelerate_configs/deepspeed_zero2_config.yaml \ opensora/train/train_t2v_diffusers.py \ --model OpenSoraT2V_v1_3-2B/122 \ --text_encoder_name_1 google/mt5-xxl \ --dataset t2v \ --data scripts/train_data/video_data_debug_on_npu.txt \ --ae WFVAEModel_D8_4x8x8 \ --ae_path /home/save_dir/lzj/formal_8dim/latent8 \ --num_frames 93 \ --max_height 352 \ --max_width 640 \ --force_resolution \ --interpolation_scale_t 1.0 \ --interpolation_scale_h 1.0 \ --interpolation_scale_w 1.0 \ --gradient_checkpointing \ --train_batch_size1 \ --dataloader_num_workers 8 \ --gradient_accumulation_steps1 \ --max_train_steps1000000 \ --learning_rate1e-5 \ --lr_schedulerconstant \ --lr_warmup_steps0 \ --mixed_precisionbf16 \ --report_towandb \ --checkpointing_steps500 \ --allow_tf32 \ --model_max_length 512 \ --use_ema \ --ema_start_step 0 \ --cfg 0.1 \ --resume_from_checkpointlatest \ --speed_factor 1.0 \ --ema_decay 0.9999 \ --drop_short_ratio 0.0 \ --pretrained /home/save_dir/pretrained/93x640x640_144k_ema \ --hw_stride 32 \ --sparse1d --sparse_n 4 \ --train_fps 16 \ --seed 1234 \ --trained_data_global_step 0 \ --group_data \ --use_decord \ --prediction_type v_prediction \ --snr_gamma 5.0 \ --rescale_betas_zero_snr \ --output_dirdebug逐项说明参数含义与取值范围模型与编码器--model OpenSoraT2V_v1_3-2B/122对应 modeling_opensora.py 中注册的OpenSoraT2V_v1_3_2B_122工厂函数--text_encoder_name_1 google/mt5-xxl指定 mT5-XXL 文本编码器--model_max_length 512控制提示词最长 token 数数据与时空尺寸--dataset t2v使用文生视频数据集t2v_datasets.py--num_frames 93、--max_height 352、--max_width 640与 v1.3.0 的 93×352×640 训练分辨率对应--force_resolution强制将数据缩放到目标分辨率--group_data启用 bucket 分组采样相同形状的数据聚合后由 dataloader 按聚合索引取数避免 OOM 与算力浪费VAE--ae WFVAEModel_D8_4x8x8、--ae_path指定 WFVAE 模型与权重路径v1.5.0 对应 8×8×8 版本的 wfvae 权重训练策略--prediction_type v_prediction--rescale_betas_zero_snr--snr_gamma 5.0对应报告所述以 v-pred 损失替换 eps-pred 损失并启用 ZeroSNR的训练配方--cfg 0.1为 classifier-free guidance 的丢弃概率--use_ema与--ema_decay 0.9999启用指数移动平均稀疏注意力开关--sparse1d --sparse_n 4即开启 Skiparse Attention 且稀疏度 k4这正是 v1.3.0/v1.5.0 架构的核心开关会传递到 modules.py 的OpenSoraAttnProcessor2_0采样率--train_fps 16表示训练时视频重采样到 16 FPS与 v1.3.0 报告一致--drop_short_ratio 0.0控制短样本丢弃比例数值精度--mixed_precisionbf16配合--allow_tf32在昇腾侧对应 bf16 混合精度训练。4.3 v1.5.0 的分阶段训练蓝图v1.5.0 报告 的 Training Stage 章节给出了工业级的九阶段训练方案分为文生图与文生视频两个大阶段这是复现 v1.5.0 的路线图文生图Text-to-Image——采用 1.1B 真实图像数据而非合成数据报告明确指出合成数据训练的权重会对视频训练产生负面影响多分辨率训练使用五种宽高比 (1,1)、(3,4)、(4,3)、(9,16)、(16,9) 与 Min-Max Token 策略Image-Stage-1512 卡 910B256² 多分辨率lr1e-4batch8096225k 步随机初始化的 Dense MMDiTImage-Stage-2384 卡 910B384² 多分辨率lr1e-4batch6144150k 步Image-Stage-3256 卡 910B288×512 强制分辨率lr1e-4batch4096110k 步完成 Dense MMDiT 训练Image-Stage-4256 卡 910B用 Dense MMDiT 权重初始化 SUV 模型skip connections 零初始化以保证起步输出非噪声实验证实零样本推理已能产生有意义的低频结构固定 288×512lr1e-4batch4096约 160k 步。报告确认 Dense DiT → SUV 的微调收敛很快。文生视频Text-to-Video——固定 9:16 宽高比纯视频数据训练不做图文联合训练全程 512 卡 910BVideo-Stage-157×288×51240k 步lr6e-5TP/SP2grad-accum2micro-batch2global-batch102424fps约 2.4s/样本短片段保证初始化稳定Video-Stage-257×288×51245k 步其余不变但降到 12fps约 4.8s/样本在不加长序列的前提下增强时序学习Video-Stage-3121×288×51225k 步lr4e-5TP/SP4grad-accum2micro-batch4global-batch1024恢复 24fpsVideo-Stage-4121×576×102416k9k 步lr 分别为 2e-5 与 1e-5TP/SP4grad-accum4micro-batch1global-batch512Video-Stage-5高质量数据子集 5k 步lr1e-5TP/SP4grad-accum4micro-batch1global-batch512。这套方案配合mindspeed-mm框架支持 TP/SP张量并行/序列并行、流水并行等并行策略——这正是 README 强调 v1.5.0 在昇腾上完全训练与推理的基础设施。五、推理采样实战文本到视频生成命令NPU 推理脚本 sample_t2v_v1_3.sh 展示了完整的采样流程CUDA_VISIBLE_DEVICES0,1,2,3,4,5,6,7 torchrun --nnodes1 --nproc_per_node 8 --master_port 29513 \ -m opensora.sample.sample \ --model_path model_path \ --version v1_3 \ --num_frames 93 \ --height 352 \ --width 640 \ --cache_dir ../cache_dir \ --text_encoder_name_1 /home/save_dir/pretrained/mt5-xxl \ --text_prompt examples/sora_refine.txt \ --ae WFVAEModel_D8_4x8x8 \ --ae_path /home/save_dir/lzj/formal_8dim/latent8 \ --save_img_path ./test \ --fps 18 \ --guidance_scale 7.5 \ --num_sampling_steps 100 \ --max_sequence_length 512 \ --sample_method EulerAncestralDiscrete \ --seed 1234 \ --num_samples_per_prompt 1 \ --rescale_betas_zero_snr \ --prediction_type v_prediction采样入口为 sample.py其内部经 pipeline_opensora.py 组装 denoiser、VAE 与文本编码器关键参数--num_frames 93 --height 352 --width 640输出视频时空尺寸需遵守 4n1 帧约束与 32 倍分辨率约束--text_prompt examples/sora_refine.txt提示词文件可用 examples 目录下的示例--guidance_scale 7.5与--num_sampling_steps 100控制引导强度与采样步数--sample_method EulerAncestralDiscrete采样器选择diffusers 调度器配合--rescale_betas_zero_snr --prediction_type v_prediction与训练配方保持一致--fps 18输出视频帧率--num_samples_per_prompt 1控制每个提示词生成几条视频。六、稳定性工程自适应梯度裁剪Adaptive Grad Clippingv1.5.0 报告 将简化的自适应梯度裁剪列为四大更新之一。v1.3.0 采用基于丢弃梯度异常 batch的裁剪策略虽然稳定但执行逻辑过于复杂v1.5.0 改为用 EMA指数移动平均维护梯度范数阈值超过阈值则裁剪把大规模模型常用的固定阈值 1.0 扩展为随训练动态变化的自适应阈值。其伪代码逻辑如下 moving_avg_max_grad_norm: 通过 EMA 维护的最大梯度范数 moving_avg_max_grad_norm_var: 最大梯度范数的方差EMA 维护 clip_threshold: 依据 3-sigma 规则计算的梯度裁剪阈值 ema_decay: EMA 衰减系数通常设为 0.99 grad_norm: 当前 step 的梯度范数 clip_threshold moving_avg_max_grad_norm 3.0 * (moving_avg_max_grad_norm_var ** 0.5) if grad_norm clip_threshold: # 低于阈值正常更新参数同时更新 moving_avg_max_grad_norm 与方差 moving_avg_max_grad_norm ema_decay * moving_avg_max_grad_norm (1 - ema_decay) * grad_norm max_grad_norm_var (moving_avg_max_grad_norm - grad_norm) ** 2 moving_avg_max_grad_norm_var ema_decay * moving_avg_max_grad_norm_var (1 - ema_decay) * max_grad_norm_var # update weights... else: # 超过阈值先按比例裁剪梯度再更新参数 clip_coef grad_norm / clip_threshold grads clip(grads, clip_coef) # clipping grads # update weights...该策略相比 v1.3.0 实现更简单且有效解决了扩散训练后期梯度范数显著低于 1.0 时出现的 loss spike损失尖峰问题同时它不依赖 drop-batch 这类与并行策略耦合的操作因此对各种并行训练策略TP/SP、流水并行等的兼容性更好——这与 v1.5.0 在昇腾上大规模并行训练的需求直接相关。七、数据工程1.1B 图像与 40M 视频的收集与过滤v1.5.0 的数据规模是性能的重要支撑v1.5.0 报告 指出图像数据来自 Recap-DataComp-1B、COYO-700M 与 LAION-Aesthetics除分辨率检查外不做其他过滤合计1.1B 张图像视频数据来自 Panda-70M 与内部数据源采用与 v1.3.0 相同的过滤协议最终得到40M 高质量视频。v1.3.0 报告Report-v1.3.0.md对这套过滤协议有完整描述v1.5.0 沿用了它可作为理解数据质量的参考跳切检测与运动评分用 LPIPS 帧跳跃计算帧间语义相似度异常处判为切点均值作为运动分数低于 0.001 视为静止、高于 0.3 视为抖动闪烁OCR 字幕过滤字幕平均位置约占视频高度的 18%故以原始尺寸 20% 为最大裁剪阈值用 EasyOCR 每秒采样一帧检测字幕中心区域文字需靠美学评分人工判断取舍美学评分基于 LAION aesthetic predictor阈值取 4.75评分高于 6.25 的数据会额外追加 A high-aesthetic scene, 前缀提示词视频画质用 DOVER 的技术预测分数过滤低码率、马赛克状模糊与抖动剔除低于 0 的样本运动复检因字幕变化会干扰运动值过滤后再重评一次并剔除静止视频自动打标用 QWen2-VL-7B 为视频生成详细描述并清洗掉 The video depicts/shows/... 等冗余开头。整套流程处理后的 Panda70M 仅保留约 27% 的数据。八、性能评测VBench 上的客观数据v1.5.0 报告 在 VBench 基准上对比了当时主流开源模型。在 8B 参数量级下Open-Sora Plan v1.5.0 的总分 83.02% 紧追 13B 的 HunyuanVideo83.24%且在语义分数78.18%与美学质量66.89%两个维度上表现突出模型参数量总分质量分语义分美学质量Mochi-110B80.13%82.64%70.08%56.94%CogvideoX-2B2B80.91%82.18%75.83%60.82%CogvideoX-5B5B81.61%82.75%77.04%61.98%Step-Video-T2V30B81.83%84.46%71.28%61.23%CogvideoX1.5-5B5B82.17%82.78%79.76%62.79%Gen-3-82.32%84.11%75.17%63.34%HunyuanVideo开源13B83.24%85.09%75.82%60.36%Open-Sora Plan v1.5.08B83.02%84.24%78.18%66.89%表中加粗为该项最优下划线为次优数据均引自 Report-v1.5.0.md 原始表格。九、未来方向特征缓存、MoE 与统一模型v1.5.0 报告 的 Future Work 章节给出了项目组明确的下一步规划其中**特征缓存Latents Cache**已有实验数据支撑传统训练流程中每个 epoch 都会用 VAE 与文本编码器对多模态数据重复编码造成大量冗余计算与 GPU 显存占用。优化思路是把特征编码与模型训练解耦——首个 epoch 将最耗时的文本提示特征预计算并存储到高性能外部存储实验中为华为 OceanStor AI 存储后续训练直接加载从而减少约 30% 的多 epoch 训练时间并释放约 20% 显存实验配置为 Open-Sora Plan v1.5.0 2B 级模型、100K 图像 10K 视频、8× A800。其他方向包括稀疏/线性注意力与 DiT 预训练的进一步融合v1.3.0 首次开源稀疏注意力预训练 DiTv1.5.0 延伸为 SUV未来探索线性注意力MoE 化 DiT参照 Mixtral-8x7B 在 LLM 领域的成功把专家混合引入视频生成模型并探索与稀疏/线性注意力的结合开源视频生成模型当前规模多在 14B 以内生成与理解统一的视频模型借鉴 GPT-4o 的架构思路探索统一模型的差异化能力Image-to-Video 新范式当前 SVD 范式与 v1.2.0 以来的 inpainting 范式都需要大规模微调预训练 T2V 模型而 I2V 更贴近真实生产场景将是团队后续重点v1.5.0 的 I2V 章节目前标记为 Coming Soon。十、参与贡献与引用Open-Sora Plan 是一个社区驱动的项目README 明确欢迎 Pull Request 与使用反馈。贡献者请先阅读 Contribution_Guidelines.md许可证为 Apache-2.0详见 LICENSE。项目还致谢了 Allegro、Latte、PixArt-alpha、ShareGPT4Video、VideoGPT、DiT、FiT 及 Positional Interpolation 等相关工作并公开了引用方式README.md 提供 BibTeX主模型论文《Open-Sora Plan: Open-Source Large Video Generation Model》arXiv:2412.00131WFVAE 论文《WF-VAE: Enhancing Video VAE by Wavelet-Driven Energy Flow for Latent Video Diffusion Model》arXiv:2411.17459关联工作 Helios实时长视频生成模型arXiv:2603.04379。需要留意的是本仓库主分支承载的是 v1.3.0 及之前的 GPU 实现pyproject.toml 版本号为 1.3.0v1.5.0 的昇腾实现位于mindspeed_mmdit分支若要在 GPU 上复现本文所述 v1.3.0 流程可直接使用本仓库的 train_t2v_diffusers.py、train_inpaint.py 与 scripts 下的训练/采样脚本并按 Report-v1.3.0.md 的分阶段配方执行。【免费下载链接】Open-Sora-PlanThis project aim to reproduce Sora (Open AI T2V model), we wish the open source community contribute to this project.项目地址: https://gitcode.com/GitHub_Trending/op/Open-Sora-Plan创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表