十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

SadTalker部署:1张照片、1段音频,20分钟做出第一条说话视频

SadTalker部署:1张照片、1段音频,20分钟做出第一条说话视频 SadTalker部署1张照片、1段音频20分钟做出第一条说话视频【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker一句话功能SadTalker照片生成说话视频——照片负责长相音频负责口型、表情和头动产出一段 MP4。它是 CVPR 2023 的音频驱动单图说话人项目本地运行完全离线。全文按“装机 → 拿模型 → 出片”的顺序写三个系统各有动线本地跑不动还有两条云端路。跟着做完你能独立完成四件事浏览器里点按钮出片、命令行出片、按模式挑参数、报错时照速查表自救。⚙️ 先体检这台机器够不够格项目底线配置流畅配置系统Windows 10 / macOS / 主流 LinuxWin11 / Ubuntu 22.04运行时Python 3.8ffmpeg 在 PATH 中同左另配 CUDA 11.3内存8 GB16 GB显卡无加 --cpu 可纯 CPU 跑NVIDIA 4 GB 显存硬盘10 GB 空闲模型约几个 GBSSD20 GB 空闲没独显也能跑只是速度从“分钟级”掉到“十分钟级”。 本地装机三条系统动线模型一次拿齐克隆仓库的命令固定用这条git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalkerWindows装齐前置件剩下靠双击装 Python 3.8安装器上勾选 Add Python to PATH装 ffmpeg 并进环境变量有 Scoop 时一行搞定scoop install ffmpeg装 Git官网安装包即可。然后双击 webui.bat脚本自动建 venv、装依赖、拉起 WebUI全程不用手敲命令。分步细节见 安装文档。macOS / Linux一个 conda 环境装齐conda create -n sadtalker python3.8 conda activate sadtalker conda install ffmpeg pip install -r requirements.txt pip install dlib # macOS 必装NVIDIA 显卡的 Linux 建议装 CUDA 11.3 的 PyTorchpip install torch1.12.1cu113 torchvision0.13.1cu113 torchaudio0.12.1 --extra-index-url https://download.pytorch.org/whl/cu113启动就一条命令bash webui.sh浏览器打开 127.0.0.1:7860看到上传面板即装好了。 SadTalker模型下载一行脚本或网盘bash scripts/download_models.sh脚本会把权重拉进 checkpoints/ 和 gfpgan/weights/ 两个目录。网络受限时手动下百度网盘 https://pan.baidu.com/s/1kb1BCPaLOWX1JJb9Czbn6w 提取码 sadt解压到项目根目录。最终 checkpoints/ 里必须有 mapping_00109-model.pth.tar、mapping_00229-model.pth.tar、SadTalker_V0.0.2_256.safetensors、SadTalker_V0.0.2_512.safetensors 四件套缺一个都起不来。 出片把照片和音频变成 MP4WebUI 页面分三块照片、音频、参数开关。素材两条底线照片要正面、单人、光线均匀examples/source_image/ 里全是现成样例音频只认 wav 和 mp3格式不对会直接解码报错examples/driven_audio/ 里也备了样例音频。点 Generate成片自动存进 results/ 下的时间戳目录。WebUI 还支持输入文字直接合成配音macOS/Linux需先pip install TTSWindows 版直接传音频文件。想脚本化就走命令行一条命令顶界面所有勾选python inference.py --driven_audio 音频.wav --source_image 照片.png \ --still --preprocess full --enhancer gfpgan三种生成模式选错观感差很多--preprocess决定出片方式WebUI 里对应生成模式开关模式命令取值适合素材观感特点裁脸crop默认半身、特写只渲染脸部头动最自然整图resize证件照式构图整图等比输出全身照效果差全身full --still全身照、生活照脸动完贴回原图头位基本锁定⚠️ 全身模式必须配 --still否则头部位移和背景对不上。追求画质再加 --enhancer gfpgan修脸或 --background_enhancer realesrgan修全片代价是更慢。☁️ 不想折腾本地SadTalker云端部署两条路Docker 镜像社区维护的 wawa9000/sadtalker 可直接拉本机装好 Docker 和 NVIDIA 驱动即可docker run --gpus all --rm -v $(pwd):/host_dir wawa9000/sadtalker \ --driven_audio /host_dir/deyu.wav --source_image /host_dir/image.jpg --still浏览器直跑仓库自带 quick_demo.ipynb导入 Google Colab 就能免费用 GPU图省事的话官方在线空间可直接体验https://huggingface.co/spaces/vinthony/SadTalker 。两条路都不占本地资源适合先验效果再决定要不要 SadTalker本地运行。 翻车自救SadTalker报错解决速查装机阶段ffmpeg is not recognizedffmpeg 没进 PATHWindows 重装并确认环境变量Linux 用conda install ffmpegM 芯片报Illegal Hardware Error单独跑pip install dlib重装ModuleNotFoundError: No module named aiepoch_20.pth 没下完整重下该文件。生成阶段FileNotFoundError: .../similarity_Lm3D_all.mat、unexpected EOF这类模型没下全或下坏了回上一步补齐 checkpoints/ 与 gfpgan/CUDA out of memory先降 --size默认 256再设PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128重跑音频解码报错确认是 wav 或 mp3其他容器格式不支持。完整问答在 FAQ版本变化看 changelog。⚡ 提速三招与进阶入口提速关掉 enhancer 省近一半时间显存紧张把--size压到 256多张照片批量出片用 src/generate_batch.py省掉逐张启动的开销。接下来可以干什么吃透参数最佳实践 讲了 --expression_scale在 0.51.5 之间调表情强度、--ref_eyeblink / --ref_pose借参考视频的眨眼与头动、free-view 视角控制换个宿主WebUI 扩展教程 把它挂进 Stable Diffusion WebUI往 3D 走face3d 文档 配合 --face3dvis 同时产出 3D 脸与关键点需额外装依赖。合规提醒项目为研究学习用途的开源作品商用与发布前请确认开源许可生成内容涉及他人肖像时务必先取得本人授权并遵守当地法律法规。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表