拓十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Duix.Avatar 本地部署实战:Docker 三步拉服务,10 秒素材生成数字人视频

Duix.Avatar 本地部署实战:Docker 三步拉服务,10 秒素材生成数字人视频

Duix.Avatar 本地部署实战:Docker 三步拉服务,10 秒素材生成数字人视频

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

Duix.Avatar 是一款完全开源免费的 AI 数字人项目。给它一段 10 秒左右带说话的视频,克隆出你的形象和声音;再输入文字或上传音频,就能产出口播视频。全程离线,在你的机器上完成。这篇文章按时间线记录从空机器到出片的全过程,耗时和坑都标出来了。

头 5 分钟:确认你的机器和素材达标

先说硬结论:没有 NVIDIA 显卡,这个项目跑不起来,所有算力都压在本地 GPU 上。

官方给出的配置基线:

  • 显卡:NVIDIA,推荐 RTX 4070 及以上
  • 内存:32G 及以上,这是硬性要求
  • 磁盘:镜像和数据共需 100G 左右空闲
  • 系统:Windows 10 19042.1526 以上,或 Ubuntu 22.04 Desktop

素材有个容易翻车的规则:必须是人在说话。声音克隆直接取视频里的音频,静音视频会直接让建模失败。10 到 15 秒足够,正面、光线足、别遮挡,其余不用讲究。

接下来 25 分钟:Docker 三步拉起来

架构上是三个服务:Fun-ASR 做语音识别,fish-speech 做声音克隆,duix.avatar 做视频合成。编排文件在仓库的deploy/目录下,常用端口是 18180(语音)和 8383(视频合成)。

先克隆仓库:

git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar

再启动服务:

cd deploy docker-compose up -d

启动前记住三件事:

  1. 预留半小时。三个镜像下载约 70G 流量,内网环境建议先配好 Docker 镜像源。
  2. 盯一下磁盘位置。Windows 版 C 盘不足 100G 时,在 Docker Desktop 的 Settings - Resources 里把 disk image location 指到别的盘。
  3. 按硬件选 compose 文件。默认用docker-compose.yml;50 系显卡(如 5090)换docker-compose-5090.yml;Ubuntu 用docker-compose-linux.yml;只跑视频合成可选 lite 版,只有一个容器。

三个服务(tts、asr、gen-video)全部 Running,服务端就齐了。

最后 5 分钟:装客户端,出第一条片

客户端是 Electron 桌面应用,从 Release 页面取安装包:Windows 双击 exe 安装;Ubuntu 的 AppImage 双击即跑,root 用户启动需加--no-sandbox参数。

打开软件后流程就三步:

  1. 点 Create Avatar,上传 10 秒说话视频
  2. 等待训练完成,通常几分钟
  3. 点 Create Video,输入口播文案或上传音频,等出片

不想走界面的话,服务端暴露了本地 API:模型训练和视频合成分别在 127.0.0.1 的 18180、8383 端口,请求格式可参考src/main/service/目录下的接口文件,接自己的流水线用这个入口就够。

省时间的地方:两个真实场景

企业培训视频。传统做法是约棚、专家出镜、后期剪辑,一条片好几天。现在:剪 10 秒专家讲话视频克隆分身,输入培训文案批量生成,一天工作量换成 10 秒素材。

课程或自媒体日更。传统做法每条都录,录制加剪辑很耗人。现在:录一次 10 秒自我介绍,之后只换脚本,文字或音频都能驱动。文案支持中、英、日、韩等 8 种语言,一个分身能产出多语言版本。

两个高频坑:镜像拉不下来、ASR 连接被拒

坑 1:docker-compose up -d报 connection timed out,镜像拉取失败。原因是 Docker Hub 官方源不稳定。解法:在/etc/docker/daemon.json的 registry-mirrors 里配置镜像源,README 里给了现成配置,照抄即可。

坑 2:克隆形象报 Connection refused,训练失败。原因是 ASR 服务启动慢,容器刚 Running 还没就绪。解法:三个服务起来后等 3 到 5 分钟再操作。另外内存只有 16G 可能直接起不来,这也是 32G 写进硬性要求的原因。

报错持续时看日志定位:客户端日志在右上角菜单的 Open Log;服务端日志在 Docker 的容器页面复制。

动手前记住三点

  • 算力和数据全留在本地,素材不出机器,个人免费商用(用户量超 10 万或年营收超 1000 万美元的企业需签许可协议)
  • 素材规则只有四条:10 秒、正面、在说话、光线足
  • 服务端想更新,到deploy目录重新执行docker-compose up -d即可,无需其他操作

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

返回列表