Stability AI 模型权重下载与推理验证完整指南:SDXL 到 SV4D 2.0 一次跑通
【免费下载链接】generative-modelsGenerative Models by Stability AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-models
本文针对 Stability AI 官方 generative-models 仓库的模型下载与首次推理验证,覆盖文生图(SDXL)、图生视频(SVD/SV3D)、4D 资产合成(SV4D 2.0)三类场景,带你走通选模型、用 huggingface-cli 拉权重到 checkpoints/ 目录、跑通第一段视频的完整流程。
该下哪个模型?按任务查表决定
先想清楚你要生成什么,再从下表定位权重文件。所有权重都放在仓库根目录的checkpoints/下,仓库里scripts/sampling/configs/各配置文件的ckpt_path已写死这个位置,落对地方就能直接加载,无需手写任何配置:
| 你的任务 | 推荐模型 | 权重文件(落盘到 checkpoints/) | 体积 |
|---|---|---|---|
| 文本生成图像 / 图生图 | SDXL base 1.0 | sd_xl_base_1.0.safetensors | 约 6.9GB |
| 静态图变 14 帧短视频 | SVD | svd.safetensors | 见模型页 |
| 静态图变 25 帧长视频 | SVD-XT | svd_xt.safetensors | 见模型页 |
| 单图合成多视角环绕视频 | SV3D | sv3d_u.safetensors、sv3d_p.safetensors | 见模型页 |
| 短视频合成 4D 资产 | SV4D 2.0 | sv4d2.safetensors | 30GB 以上 |
⚠️ 单个文件从 6.9GB 到 30GB 以上不等,建议目标磁盘至少预留 100GB 空闲空间。
动手前的 5 分钟自查
先确认本地环境满足最低要求,四条命令逐个敲一遍即可:
| 工具 | 最低版本 | 验证命令 |
|---|---|---|
| Python | 3.10 | python --version |
| PyTorch | 2.0.1 | python -c "import torch; print(torch.__version__)" |
| CUDA | 11.8 | nvidia-smi |
| Hugging Face CLI | 支持 download 子命令 | huggingface-cli --version |
仓库尚未克隆时,先执行:
# 获取代码仓库并进入根目录 git clone https://gitcode.com/GitHub_Trending/ge/generative-models cd generative-models另外记住一个特性:huggingface-cli 默认支持断点续传,中断后重放同一条命令即可继续,不必重下。
一条通用下载命令 + 三个模型的差异点
三条路径共用同一个命令模板,差异只在"仓库名"和"文件名"两个位置:
huggingface-cli download <HF 仓库名> \ <文件名1> <文件名2> \ --local-dir checkpoints # 统一落到仓库根目录 checkpoints/不带文件名会拉整个仓库,所以务必保留文件名参数,只拿你需要的权重。
SDXL 文生图权重下载命令
文生图 / 图生图任务,是仓库里验证最充分的模型,建议作为第一个下载对象:
# 只拉 base 权重(约 6.9GB),落盘到 checkpoints/ huggingface-cli download stabilityai/stable-diffusion-xl-base-1.0 \ --include "*.safetensors" --local-dir checkpoints预期落盘:checkpoints/sd_xl_base_1.0.safetensors(与scripts/demo/sampling.py的默认路径一致)。校验方式:
ls -lh checkpoints/sd_xl_base_1.0.safetensors # 约 6.9GB、目录内无 .incomplete 残留即算成功SVD 图生视频与 SV3D 多视角权重怎么拿
让单张静态图动起来(SVD 出 14 帧或 25 帧视频),或由单图合成环绕多视角视频(SV3D):
# SVD 14 帧版与 25 帧版各拉一个 huggingface-cli download stabilityai/stable-video-diffusion-img2vid \ svd.safetensors --local-dir checkpoints huggingface-cli download stabilityai/stable-video-diffusion-img2vid-xt \ svd_xt.safetensors --local-dir checkpoints# SV3D 两个变体:u(均匀视角)与 p(可控轨道) huggingface-cli download stabilityai/sv3d \ sv3d_u.safetensors sv3d_p.safetensors --local-dir checkpoints显存紧张时可加拉图像解码器变体:
# 可选:低显存场景使用的图像解码器 huggingface-cli download stabilityai/stable-video-diffusion-img2vid \ svd_image_decoder.safetensors --local-dir checkpoints校验:
ls -lh checkpoints/svd.safetensors checkpoints/svd_xt.safetensors \ checkpoints/sv3d_u.safetensors checkpoints/sv3d_p.safetensors # 4 个文件均存在且大小非零即可进入推理SV4D 2.0 4D 资产主权重下载命令
由一段短视频合成新视角的 4D 资产,每次生成 48 帧(12 帧 × 4 视角),输入建议用白底运动物体视频:
# SV4D 2.0 主权重(30GB 以上),对应 sv4d2.yaml 配置 huggingface-cli download stabilityai/sv4d2.0 \ sv4d2.safetensors --local-dir checkpoints校验:
ls -lh checkpoints/sv4d2.safetensors # 数十 GB 且无 .incomplete 残留即算成功两个补充:8 视角变体把文件名换成sv4d2_8views.safetensors(同仓库)即可;若要跑初代 SV4D,还需从stabilityai/sv4d仓库拉sv4d.safetensors,其采样脚本同时依赖上文的sv3d_u.safetensors。
网络慢或中断:镜像、续传与并发三连招
| 技巧 | 命令 | 说明 |
|---|---|---|
| 镜像端点 | export HF_ENDPOINT=https://hf-mirror.com | 仅当前会话生效;镜像文件列表有同步延迟,新权重找不到时取消该变量回退官方端点 |
| 断点续传 | 重放下文任一下载命令 | 无需删已有文件;不要手动移动或清理本地缓存与目标目录,否则断点重置 |
| aria2c 并发 | aria2c -x 16 -s 16 -o svd.safetensors "<直链>" | 16 连接并发拉单文件;直链需从模型页面手动复制,不参与 hf 的续传机制 |
常见报错与处置
| 现象 | 可能原因 | 处置 |
|---|---|---|
加载时报Missing key(s) in state_dict | 权重不完整,或版本与配置不匹配 | 删除该文件后重放下载命令,重下前对照模型页文件清单 |
CUDA out of memory | 显存不足 | 采样脚本加--decoding_t=1(或--encoding_t=1)降低单批解码帧数,或把输出分辨率降到 512 |
| 模型能加载,但画面模糊、畸变 | 配置与权重版本对不上 | 核对scripts/sampling/configs/下 yaml 的ckpt_path与checkpoints/实际文件名来自同一发布版本 |
中断后残留 0 字节文件或.incomplete | 传输中断留下的残片 | 重放同一条 huggingface-cli 命令续传,仍慢则切换镜像端点 |
表中招不中时可按三步兜底排查:
sha256sum checkpoints/sd_xl_base_1.0.safetensors # 与 README.md Inference 一节列出的文件哈希比对(base 与 refiner 均给出)- 用上面的哈希结果对照 README.md Inference 一节的官方数值;
- 逐项核对
scripts/sampling/configs/各配置的ckpt_path与checkpoints/内实际文件名是否一一对应; - 删除整个本地
checkpoints/目录,重放该模型的完整下载命令。
跑通第一帧:SVD 图生视频最小推理验证
以 SVD 为例,用仓库自带测试图跑一次最小推理,确认整条链路就绪:
# 仓库自带测试图,SVD 默认 14 帧 / 25 步 python scripts/sampling/simple_video_sample.py \ --input_path assets/test_image.png --version svd跑完后终端无 traceback,outputs/simple_video_sample/svd/目录新增:
000000.jpg # 输入图存根 000000.mp4 # 生成的 14 帧视频两个文件都出现,说明模型下载与推理链路已跑通 ✅。其余模型的入口都在 scripts/sampling/(SVD/SV3D 用simple_video_sample.py,SV4D 2.0 用simple_video_sample_4d2.py),模型结构配置见 configs/inference/。
低显存提示:--decoding_t/--encoding_t可控制单批解码的帧数,显存吃紧时调小即可,也可把输出分辨率降到 512 再跑。首帧顺利产出后,其余权重按开头决策表随时补齐。
【免费下载链接】generative-modelsGenerative Models by Stability AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-models
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考