Duix.Avatar 本地部署:10秒视频克隆数字分身,离线生成口播视频
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
外包一条口播视频给工作室,3000元起步、交付要等一周;把员工的人脸和声音素材传到第三方云端服务,一旦泄露,处置成本远高于制作费。这是很多人不敢用数字人的两个原因。Duix.Avatar 是一款免费开源、全离线运行的数字人工具:上传10秒左右的视频就能克隆你的脸和声音,之后输入文案或上传音频,直接生成口型同步的播报视频。使用门槛是一台带 NVIDIA 显卡的电脑加 Docker,Windows 和 Ubuntu 都能完成部署。
它是什么:10秒视频克隆脸和声音
Duix.Avatar 是一个桌面客户端加本地 Docker 服务的组合:上传10秒左右的清晰视频,系统自动拆出人脸特征和声音特征,生成一个长你、声音也你的数字分身。之后你输入文案或上传音频文件,它就生成口型同步的口播视频,脚本支持中、英、日、韩、法、德、阿拉伯、西语共8种语言。它不做三件事:不替你拍摄和剪辑素材,不提供云端托管(全部算力在你本机),不支持非 NVIDIA 显卡。
4个理由选本地部署
素材不出机器。三个服务启动后,所有接口调用都走本机 127.0.0.1(声音服务18180端口,视频合成8383端口),人脸和声音素材全程不碰外网。
10秒素材就够。克隆只需要一段10秒左右的视频,不用长时间对着镜头录制,素材准备成本几乎可以忽略。
商用免费。开源协议支持全球免费商用,只有用户量超10万或年营收达1000万美元的企业需要另签商业许可。
部署路径短。服务端就是一条 docker-compose 命令,客户端装完即用,不需要自己配深度学习环境。
从零到跑通:5步装好服务端和客户端
硬件基准按官方推荐配置来:NVIDIA 显卡(推荐 RTX 4070)、32G 内存、Docker 存储盘100G空闲、Windows 用户另需 D 盘30G存放数据。
第1步:验证显卡驱动。终端执行nvidia-smi。看到显卡型号和驱动版本,这步通过;提示找不到命令或驱动,先去 NVIDIA 官网装好驱动再重新验证。
第2步:克隆项目。
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar验证点:进入目录后能看到src和deploy两个文件夹。
第3步:装好 Docker。Windows 用 Docker Desktop(WSL 2 后端),Ubuntu 22.04 用 apt 装 docker 和 docker-compose。执行docker --version能看到版本号即通过。
第4步:一条命令拉起三个服务。首次会拉取三个镜像,约70G流量,耗时半小时左右,取决于网速:
cd deploy docker-compose up -dUbuntu 换成 linux 编排文件执行docker-compose -f docker-compose-linux.yml up -d;RTX 50 系列显卡用docker-compose-5090.yml;显存紧张可用 lite 编排文件,它只跑一个视频合成服务。验证点:Docker 界面里 duix-avatar-tts、duix-avatar-asr、duix-avatar-gen-video 三个容器均为 Running 状态(lite 版只有一个 duix-avatar-gen-video)。
C 盘不足100G时,在 Docker Desktop 的 Settings → Resources → Advanced 里用 Browse 把磁盘镜像位置改到别的盘。
第5步:安装客户端。到项目的 Release 页下载对应系统的安装包,Windows 双击 exe 安装,Ubuntu 双击 AppImage 直接运行(root 桌面用户需在终端加--no-sandbox启动)。验证点:打开后看到"创建视频"和"创建数字分身"两张卡片,即可使用。
还能做什么:3个批量口播场景
自媒体口播批量生产
- 输入:3个选题文案
- 操作:选中同一个数字分身,依次粘贴文案生成
- 输出:3条口型同步的口播成片,直接排期发布
企业内部培训标准化
- 输入:讲师一段10秒自我介绍录像
- 操作:克隆讲师分身,输入课程讲稿
- 输出:讲师形象和声音讲解的系列课程视频
同一内容多语言出片
- 输入:同一篇讲稿的中文和英文版本
- 操作:用同一个分身分别驱动生成
- 输出:两个语言的口播视频文件,投不同渠道
3个最常见的坑及修复方法
坑1:镜像下载慢或失败(概率最高)。判断依据:docker-compose up -d长时间卡在拉取,docker images里缺镜像;首装约70G流量,国内直连 Docker Hub 不稳定。解决动作:在 Docker 的 Docker Engine 配置里加 registry-mirrors 国内镜像源,重启后重新拉取。
坑2:服务起不来或反复重启。判断依据:容器状态是 restarting 或 exited,日志报 GPU 相关错误;本项目全部算力在本地显卡,驱动没装好服务一定起不来。解决动作:更新 NVIDIA 驱动,nvidia-smi能显示显卡后重新执行docker-compose up -d。
坑3:克隆或生成时报"file not exists"。判断依据:客户端进度卡住或生成失败,容器日志出现 FileNotFoundError;多为服务端与客户端版本不一致。解决动作:客户端点右上角设置齿轮选 Open Log 看本地日志,服务端看对应容器日志定位报错,然后在 deploy 目录重新执行docker-compose up -d把服务更新到最新镜像再试。
关键代码在哪:4个值得先看的路径
想读代码或接入自己的系统,先看这四个地方:
- 模型训练服务:调用形象克隆训练接口,"创建数字分身"的入口逻辑
- 语音合成服务:声音素材上传与 TTS 合成调用
- 视频合成服务:提交视频生成任务并轮询进度
- Docker编排文件:三个服务的定义、端口映射和 GPU 挂载方式
服务端启动后在本地暴露 HTTP 接口,模特训练、音频合成、视频合成的参数都写在前三个文件里;想接到自己的工作流,直接调 127.0.0.1 的 18180 和 8383 端口即可。
一句话总结:适合谁,不适合谁
如果你需要高频产出口播视频、在意人脸和声音素材的隐私、手头正好有 NVIDIA 显卡,这个开源数字人工具值得花一个下午部署;如果你没有 GPU,或不打算碰服务端,可以先看它配套的 API 服务,不必自己装。
下一步动作:先在终端跑一遍nvidia-smi确认机器达标,达标就按第4步开始拉镜像。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考