拓十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Stability AI 模型权重下载与推理验证完整指南:SDXL 到 SV4D 2.0 一次跑通

Stability AI 模型权重下载与推理验证完整指南:SDXL 到 SV4D 2.0 一次跑通

Stability AI 模型权重下载与推理验证完整指南:SDXL 到 SV4D 2.0 一次跑通

【免费下载链接】generative-modelsGenerative Models by Stability AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-models

本文针对 Stability AI 官方 generative-models 仓库的模型下载与首次推理验证,覆盖文生图(SDXL)、图生视频(SVD/SV3D)、4D 资产合成(SV4D 2.0)三类场景,带你走通选模型、用 huggingface-cli 拉权重到 checkpoints/ 目录、跑通第一段视频的完整流程。

该下哪个模型?按任务查表决定

先想清楚你要生成什么,再从下表定位权重文件。所有权重都放在仓库根目录的checkpoints/下,仓库里scripts/sampling/configs/各配置文件的ckpt_path已写死这个位置,落对地方就能直接加载,无需手写任何配置:

你的任务推荐模型权重文件(落盘到 checkpoints/)体积
文本生成图像 / 图生图SDXL base 1.0sd_xl_base_1.0.safetensors约 6.9GB
静态图变 14 帧短视频SVDsvd.safetensors见模型页
静态图变 25 帧长视频SVD-XTsvd_xt.safetensors见模型页
单图合成多视角环绕视频SV3Dsv3d_u.safetensors、sv3d_p.safetensors见模型页
短视频合成 4D 资产SV4D 2.0sv4d2.safetensors30GB 以上

⚠️ 单个文件从 6.9GB 到 30GB 以上不等,建议目标磁盘至少预留 100GB 空闲空间。

动手前的 5 分钟自查

先确认本地环境满足最低要求,四条命令逐个敲一遍即可:

工具最低版本验证命令
Python3.10python --version
PyTorch2.0.1python -c "import torch; print(torch.__version__)"
CUDA11.8nvidia-smi
Hugging Face CLI支持 download 子命令huggingface-cli --version

仓库尚未克隆时,先执行:

# 获取代码仓库并进入根目录 git clone https://gitcode.com/GitHub_Trending/ge/generative-models cd generative-models

另外记住一个特性:huggingface-cli 默认支持断点续传,中断后重放同一条命令即可继续,不必重下。

一条通用下载命令 + 三个模型的差异点

三条路径共用同一个命令模板,差异只在"仓库名"和"文件名"两个位置:

huggingface-cli download <HF 仓库名> \ <文件名1> <文件名2> \ --local-dir checkpoints # 统一落到仓库根目录 checkpoints/

不带文件名会拉整个仓库,所以务必保留文件名参数,只拿你需要的权重。

SDXL 文生图权重下载命令

文生图 / 图生图任务,是仓库里验证最充分的模型,建议作为第一个下载对象:

# 只拉 base 权重(约 6.9GB),落盘到 checkpoints/ huggingface-cli download stabilityai/stable-diffusion-xl-base-1.0 \ --include "*.safetensors" --local-dir checkpoints

预期落盘:checkpoints/sd_xl_base_1.0.safetensors(与scripts/demo/sampling.py的默认路径一致)。校验方式:

ls -lh checkpoints/sd_xl_base_1.0.safetensors # 约 6.9GB、目录内无 .incomplete 残留即算成功

SVD 图生视频与 SV3D 多视角权重怎么拿

让单张静态图动起来(SVD 出 14 帧或 25 帧视频),或由单图合成环绕多视角视频(SV3D):

# SVD 14 帧版与 25 帧版各拉一个 huggingface-cli download stabilityai/stable-video-diffusion-img2vid \ svd.safetensors --local-dir checkpoints huggingface-cli download stabilityai/stable-video-diffusion-img2vid-xt \ svd_xt.safetensors --local-dir checkpoints

# SV3D 两个变体:u(均匀视角)与 p(可控轨道) huggingface-cli download stabilityai/sv3d \ sv3d_u.safetensors sv3d_p.safetensors --local-dir checkpoints

显存紧张时可加拉图像解码器变体:

# 可选:低显存场景使用的图像解码器 huggingface-cli download stabilityai/stable-video-diffusion-img2vid \ svd_image_decoder.safetensors --local-dir checkpoints

校验:

ls -lh checkpoints/svd.safetensors checkpoints/svd_xt.safetensors \ checkpoints/sv3d_u.safetensors checkpoints/sv3d_p.safetensors # 4 个文件均存在且大小非零即可进入推理

SV4D 2.0 4D 资产主权重下载命令

由一段短视频合成新视角的 4D 资产,每次生成 48 帧(12 帧 × 4 视角),输入建议用白底运动物体视频:

# SV4D 2.0 主权重(30GB 以上),对应 sv4d2.yaml 配置 huggingface-cli download stabilityai/sv4d2.0 \ sv4d2.safetensors --local-dir checkpoints

校验:

ls -lh checkpoints/sv4d2.safetensors # 数十 GB 且无 .incomplete 残留即算成功

两个补充:8 视角变体把文件名换成sv4d2_8views.safetensors(同仓库)即可;若要跑初代 SV4D,还需从stabilityai/sv4d仓库拉sv4d.safetensors,其采样脚本同时依赖上文的sv3d_u.safetensors。

网络慢或中断:镜像、续传与并发三连招

技巧命令说明
镜像端点export HF_ENDPOINT=https://hf-mirror.com仅当前会话生效;镜像文件列表有同步延迟,新权重找不到时取消该变量回退官方端点
断点续传重放下文任一下载命令无需删已有文件;不要手动移动或清理本地缓存与目标目录,否则断点重置
aria2c 并发aria2c -x 16 -s 16 -o svd.safetensors "<直链>"16 连接并发拉单文件;直链需从模型页面手动复制,不参与 hf 的续传机制

常见报错与处置

现象可能原因处置
加载时报Missing key(s) in state_dict权重不完整,或版本与配置不匹配删除该文件后重放下载命令,重下前对照模型页文件清单
CUDA out of memory显存不足采样脚本加--decoding_t=1(或--encoding_t=1)降低单批解码帧数,或把输出分辨率降到 512
模型能加载,但画面模糊、畸变配置与权重版本对不上核对scripts/sampling/configs/下 yaml 的ckpt_path与checkpoints/实际文件名来自同一发布版本
中断后残留 0 字节文件或.incomplete传输中断留下的残片重放同一条 huggingface-cli 命令续传,仍慢则切换镜像端点

表中招不中时可按三步兜底排查:

sha256sum checkpoints/sd_xl_base_1.0.safetensors # 与 README.md Inference 一节列出的文件哈希比对(base 与 refiner 均给出)
  1. 用上面的哈希结果对照 README.md Inference 一节的官方数值;
  2. 逐项核对scripts/sampling/configs/各配置的ckpt_path与checkpoints/内实际文件名是否一一对应;
  3. 删除整个本地checkpoints/目录,重放该模型的完整下载命令。

跑通第一帧:SVD 图生视频最小推理验证

以 SVD 为例,用仓库自带测试图跑一次最小推理,确认整条链路就绪:

# 仓库自带测试图,SVD 默认 14 帧 / 25 步 python scripts/sampling/simple_video_sample.py \ --input_path assets/test_image.png --version svd

跑完后终端无 traceback,outputs/simple_video_sample/svd/目录新增:

000000.jpg # 输入图存根 000000.mp4 # 生成的 14 帧视频

两个文件都出现,说明模型下载与推理链路已跑通 ✅。其余模型的入口都在 scripts/sampling/(SVD/SV3D 用simple_video_sample.py,SV4D 2.0 用simple_video_sample_4d2.py),模型结构配置见 configs/inference/。

低显存提示:--decoding_t/--encoding_t可控制单批解码的帧数,显存吃紧时调小即可,也可把输出分辨率降到 512 再跑。首帧顺利产出后,其余权重按开头决策表随时补齐。

【免费下载链接】generative-modelsGenerative Models by Stability AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-models

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

返回列表