
Duix.Avatar 实操指南8G 显存本地跑通 AI 数字人克隆与口播视频生成【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarDuix.Avatar 是一个全离线的开源 AI 数字人工具上传一段 10 秒左右的真人视频就能同时克隆形象和声音之后输入文案或音频本地显卡直接合成口型匹配的口播视频。整个流程不依赖网络所有算力跑在自己的 NVIDIA GPU 上。这篇指南按查硬件 → 起服务 → 建形象 → 接 API → 排错的顺序讲一遍照着做即可。硬件门槛与准备工作结论一块装了驱动的 NVIDIA 显卡 32G 内存是硬性条件缺了哪个三个服务都起不来。官方推荐的参考配置如下来自 README 的前置条件项目要求说明显卡NVIDIA 显卡 最新驱动所有服务以 nvidia runtime 启动用nvidia-smi能查到显卡才算驱动装好内存32G 及以上官方标注必要常见问题文档明确提到 16G 内存可能起不来 ASR 服务CPU参考 i5-13400F13 代酷睿无硬性最低线磁盘WindowsD 盘 ≥ 30G 存数据C 盘 ≥ 100G 存镜像C 盘不够时可在 Docker Desktop 里改磁盘镜像位置系统Windows 10 19042.1526或 Ubuntu 22.04内核 6.8.0-52其他 Linux 版本官方未做兼容测试显存方面官方推荐是 RTX 4070 级别但仓库共创作品区的社区实测视频标注 8G 显存可用8G 卡可以先试轻量版再上完整版。Windows 用户还要先把 WSL 装好wsl --install网络原因失败就多试几次然后wsl --update再装 Docker DesktopUbuntu 用户直接sudo apt install docker.io docker-compose即可另需安装 NVIDIA Container Toolkit 让 Docker 能调用 GPU。30 分钟启动本地服务三个部署方案任选结论克隆代码后在deploy目录执行一条 docker-compose 命令等镜像拉完约 70G 流量、半小时左右建议连 WiFi就完成部署。git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy # 完整版ASR TTS 视频合成三个服务 docker-compose up -d # 轻量版只启动视频合成服务 docker-compose -f docker-compose-lite.yml up -d # RTX 50 系显卡30/40 系 CUDA 12.8 也可用 docker-compose -f docker-compose-5090.yml up -d # Ubuntu使用 linux 专用编排文件 docker-compose -f docker-compose-linux.yml up -d三个方案的差别看这张表依据deploy/目录下的编排文件整理方案编排文件启动的服务适用场景完整版docker-compose.ymlTTS 语音合成端口 18180、ASR 语音识别10095、视频合成8383想走文本 → 语音 → 视频完整链路轻量版docker-compose-lite.yml只有视频合成8383自己已有音频只做口型驱动与合成50 系版docker-compose-5090.ymlTTS5090 专用镜像 视频合成5090 镜像基于 5090 实测无 ASR 服务5090 等新卡用户使用 torch 官方预览版判断标准很简单docker ps里对应容器都是 Running 即成功。拉镜像失败几乎都卡在网络下一节排错里给出了国内镜像源的做法。克隆第一个数字人10 秒视频 一份文案结论客户端里上传视频建形象 → 输文案生成视频两步走完就能得到第一条口播视频。客户端从项目的 Release 页面下载官方构建安装包Windows 是Duix.Avatar-x.x.x-setup.exeUbuntu 是 AppImageroot 用户直接跑不动需要加--no-sandbox参数启动。点 Create Avatar 选一段 10 秒左右的视频。这里有个容易踩的坑视频必须有声音、且是人在说话因为声音克隆就是用这段音频训练的没声音直接报错。客户端后台做的事在src/main/service/model.js里可以看清先用 ffmpeg 把视频转 H264再分离出 wav 音频调 TTS 服务的预处理接口做声音克隆最后把模特信息写进本地 SQLite。形象建好后在 Create Video 里输入文案或上传音频数字人就会按文本内容做口型合成。文案支持 8 种语言中、英、日、韩、法、德、阿拉伯、西班牙。生成结果归档在 My Works 里形象可以多个并存、随时切换。用 API 接入自己的应用三个本地端口结论服务端起来后本地就暴露了现成接口客户端自己也是调它们你的批量生成脚本可以直接复用。入口都在http://127.0.0.1具体调用示例参考src/main/service/下的model.js、voice.js、video.js用途接口备注声音预处理/克隆18180/v1/preprocess_and_tran入参含音频路径与语言返回的reference_audio等字段要存下来文本转语音18180/v1/invoke用上一步返回的 reference 字段固定参数见 README 示例提交口型合成8383/easy/submit传音频路径 形象视频路径 唯一 code查询合成进度8383/easy/query?code{taskCode}GET 请求code 用 submit 时传的典型流水线就是四步分离音频 → 预处理克隆声音 → 合成语音 → 合成视频。如果你的业务只需要给一段音频换一个嘴轻量版服务 easy/submit就够了。四个高频报错的排查路径结论绝大多数问题落在镜像拉不下来、服务没起完就操作、素材不合规三类里先自查再提问。1.docker-compose up -d报连接失败Client.TimeoutDocker Hub 官方源不稳定在 Docker 守护进程配置里加国内镜像源registry-mirrorsREADME 和常见问题文档都给了现成的配置片段镜像源列表会随时间变化自行搜最新的。2. 定制模特报 Connection refusedfunasr 连接异常ASR 服务启动比较慢服务刚拉起就点克隆会连不上——等几分钟再试。另外内存只有 16G 的机器可能根本起不来 ASR。3. 新增模特报错99% 是视频没有声音或画面里不是人在说话声音克隆没原料可用。换一段口播视频即可。4. 拿不准就看两边日志客户端右上角设置菜单里点 Open Log 取日志服务端直接打开对应容器的 Logs 标签页常见如 TTS 服务的file not exists基本都指向音频路径/挂载问题。商用前必看的授权条款⚠️ 结论Duix.Avatar 不是宽松的 MIT 协议用的是 DUIX.COM 社区许可证正式商用前先花两分钟读一遍 LICENSE。README 的说法是支持全球免费商用但用户量超过 10 万或年营收达 1000 万美元以上的企业需签署商业许可协议而 LICENSE 文件里还有一条基于月活MAU阈值的商用授权条款两处口径不完全一致——团队在扩张、产品要对外收费之前建议逐条核对必要时联系官方README 留了联系邮箱 jamesduix.com确认。另外分发你的产品时需按协议展示 Built with DUIX.COM 等署名信息。资源获取与求助渠道客户端安装包去项目的 Release 页面下载官方构建版本部署与排错的细节看仓库里的 doc/常见问题.md 和 README_zh.mdREADME 中还附了技术交流群二维码问题先翻文档和 Issues再进群问会快很多。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考