十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

用10秒视频克隆你的开源数字人:Duix.Avatar 本地部署实战

用10秒视频克隆你的开源数字人:Duix.Avatar 本地部署实战 用10秒视频克隆你的开源数字人Duix.Avatar 本地部署实战【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar给同一段产品介绍录了八遍音导演说还是让 AI 念吧。可你又不想要个没脸的通用形象Duix.Avatar 是个能选的路子免费开源的数字人工具丢给它一段10秒的、有你在说话的视频它就把你的脸和声音都拷走。全程离线素材不出你的电脑。它到底能干嘛10秒视频克隆数字人流程很短。先拍一段10秒的自拍视频——重点是有说话的声音这一步不只是采你的脸连声音也要一起克隆。上传它数字人就建好了。接下来去Create Video里打一段文案或者直接传一个 mp3出来的就是你在念稿、口型跟音频对得上的成片。自媒体口播、课程讲解、企业产品演示够用了。文案支持中、英、日、韩等8种语言念英文稿它就念英文。所有环节都在本地算合同讲解、内部培训这类敏感素材也敢往里放。第一次打开 Duix.Avatar主界面走读客户端装好后双击启动。主界面很干净上方两张大卡片左边Create Video右边Create Avatar。下方两个页签对应My Works和My Avatars生成的视频归左边克隆好的数字人归右边还能按名字搜。右上角 Setting 菜单能打开日志、切中英界面、看协议。你第一件要做的事很明确点右边那个Create Avatar上传10秒视频、起个名字后端服务没跑起来会报错所以先去看下一节。从0到跑通一条 docker-compose 命令起三个服务动手前对一下单子系统Windows 1019042.1526 以上或 Ubuntu 22.04显卡NVIDIA 且驱动装好RTX 30/40/50 系列内存32GB 及以上磁盘100GB 以上空闲拉镜像大约 70GB 流量建议连 WiFi第一步装 Docker。Windows 用户先用wsl --list --verbose确认 WSL 装没装然后安装 Docker DesktopUbuntu 用户直接跑sudo apt install docker.io docker-composeWindows 这步耗时看网速卡了就重试。第二步拉代码。git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar仓库很小一般一分钟内结束。第三步起服务端。配置文件在deploy目录一条命令把 ASR、TTS、视频合成三个服务全拉起来cd deploy docker-compose up -dUbuntu 用户要加文件参数docker-compose -f docker-compose-linux.yml up -d显存 8G 左右的低配机器可换 lite 版。这步要 30 分钟上下Docker 在偷偷下载三套镜像终端看着像死了其实没死。Docker 里看到三个服务都是 Running就算成了第四步装客户端。到仓库 Releases 页下载对应系统的安装包Windows 双击.exeUbuntu 双击.AppImage直接跑root 用户跑不起来就加个--no-sandbox参数。翻车记录镜像拉不下来和卡在20%的自救最常踩的是三个坑。先是镜像拉不动第三步的报错里全是Client.Timeout exceeded说明网络够不到 Docker Hub先别怀疑显卡。救法Docker Desktop 右上角齿轮进 Docker Engine在配置里加一段registry-mirrors国内镜像源自己搜最新的一批填进去Apply restart再重跑第三步那条命令。第二个是创建数字人失败。九成是上传的视频没声音程序要拿视频里说话的声音做克隆无声视频、只有 BGM、拍的是别处背景都会挂。重拍一条人脸正面清楚、1020秒即可。第三个是生成卡在20%。问题出在音频处理环节在 Docker 里找到 heygen-tts 容器打开 Logs 页签大概率看到 file not exists 之类的报错多半是音频路径不对或服务没完全起来重启对应容器通常就好。还不行就按顺序查三个服务是否都 Running、nvidia-smi是否认得显卡、服务端客户端是不是最新版。延伸一下三个微服务与本地开放的 API这套界面背后是三个微服务fun-asr 管音频转文字fish-speech 管文字转音频18180 端口视频合成引擎挂在 8383 端口做口型驱动。端口都暴露在 127.0.0.1 上想接进自己的工作流模型训练、音频合成、视频合成三组接口直接调用调用姿势在src/main/service/video.js等几个文件里写着。踩到上面没盖到的坑先看 doc/常见问题.md没答案就去仓库 Issues 里搜多半有人先摔过。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表