十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

从10秒视频到会说话成片:Duix.Avatar本地数字人部署指南

从10秒视频到会说话成片:Duix.Avatar本地数字人部署指南 从10秒视频到会说话成片Duix.Avatar本地数字人部署指南【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarDuix.Avatar 是一个本地开源数字人项目上传约 10 秒的说话视频就能克隆形象和声音之后输入文案或音频即可生成口型同步的播报视频。全流程在自己的机器上离线跑完从装环境到出第一支成片顺利的话半小时左右。先跑起来架构分两部分Docker 服务端ASR、TTS、视频合成三个模型服务 Electron 桌面客户端。所有算力在服务端客户端只负责操作所以部署顺序是「先服务端、后客户端」。1. 拉代码起服务端。Windows 需要先装 Docker DesktopWSL2 后端Ubuntu 22.04 直接装 Docker 即可git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deployUbuntu 缺依赖先执行sudo apt install docker.io docker-compose然后在 deploy 目录执行docker-compose up -d首次拉镜像约 70G看网速半小时到一小时。Docker 里看到Duix.Avatar-asr、Duix.Avatar-tts、Duix.Avatar-gen-video三个服务全部 Running 就算服务端就绪。NVIDIA 50 系列显卡改用docker-compose -f docker-compose-5090.yml up -d显存紧张、只想跑视频合成的用 lite 版 compose 文件单服务。2. 启动客户端。从项目 Releases 下载 Windows 安装包.exe或 Ubuntu 的 AppImage双击即用无需装环境。偏好源码构建的装 Node.js 18在仓库根目录npm install npm run dev即可客户端代码在 src/ 目录。3. 产出第一个结果。客户端里两步Create Avatar上传一段 10 秒左右、人正在说话的带声音视频。服务端做音画分离、ASR 转写、声音建模得到一个数字人模型Create Video选中该模型输入播报文案稍等几分钟即可导出成片口型与语音自动对齐。能做出什么输入固定是「一个数字人模型 一段文案或音频」输出是带口型的说话视频。几个实际用法电商商品口播输入商品卖点文案 店主 10 秒片段输出固定出镜人的商品介绍视频换一版卖点改文案重新生成就行不用重录。客服帮助中心输入 FAQ 单条答案文本输出数字人讲解视频嵌进帮助页新用户的完播率通常好于纯文字。周报/内部公告输入周报摘要输出统一数字人形象的口播视频适合要求「视频里要有真人感」又不想真人露面的内部分发。原理扫一眼整条链路四步上传视频先被拆成无声视频 音频音频进 ASR 服务FunASR得到参考文本同时进 TTS 服务fish-speech完成声音克隆生成时TTS 先把文案合成语音视频合成服务再按音频节奏驱动原视频口型逐帧变化最后渲染成口型对齐的成片。三个服务都是本地 Docker 容器数据不出机器各接口的调用逻辑可以看 src/main/service/video.js。调优与排错最低配置要求显卡是硬门槛没有 NVIDIA 显卡或驱动没装好三个服务起不来。推荐 RTX 4070 级别8G 显存可用内存建议 32G 以上硬盘空闲 100G镜像约 70G再留空间存成片。Windows 上 C 盘不够时在 Docker Desktop 的 Settings → Resources → Advanced 里把 WSL 镜像目录改到其他盘。参数建议建模视频 10 秒足够画面清晰、人在说话、环境音少声音建模质量直接决定后续 TTS 相似度文案分段生成每段 30~50 字比较稳接口的 topP 0.7、temperature 0.7 等参数默认值即可5090 或 30/40 系列装 CUDA 12.8 的统一走 5090 那份 compose 文件。首次生成失败排查docker-compose up -d报 registry-1.docker.io 连接超时Docker Hub 官方源不稳定在/etc/docker/daemon.json里配 registry-mirrors 指向国内镜像源或开全局代理创建模特报错上传的视频必须有人说话且带声音静音片段会在 ASR 环节直接失败服务反复重启、客户端报 Connection refused先nvidia-smi确认能输出显卡信息再看三个服务是否都 Running都正常的话按 doc/常见问题.md 的自查步骤走。定位问题时最有用的是两份日志客户端日志在应用内的日志入口查看服务端日志直接打开对应 Docker 服务的 Logs 页具体位置 doc/常见问题.md 里有配图。成片质量基本由建模视频决定而重做一次只花几分钟——挑一段最清晰的 10 秒拍完就够用了。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表