
从10秒视频到数字分身Duix.Avatar本地部署的完整路径【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarDuix.Avatar 是一个完全开源的数字人工具包你上传一段 10 秒左右的视频它就能克隆你的形象和声音之后输入文案或音频本地即可生成口播视频。全程离线不需要把影像资料传到任何服务器。下面按先体检、再部署、会排障、能二开的顺序把我跑通这套流程的关键判断都写出来你照着走就能在自己电脑上跑起来。跑之前先认识它的三个服务装之前值得花一分钟搞懂它由什么组成后面排障会省事很多。整个服务端是三个 Docker 容器都在本地占用 NVIDIA 显卡算力duix-avatar-asr语音识别基于 FunASR、duix-avatar-tts声音克隆基于 fish-speech、duix-avatar-gen-video口型与视频合成。端口分别是 10095、18180、8383定义在 deploy/docker-compose.yml 里。客户端是 Electron Vue 写的桌面应用负责上传素材、管理数字人和作品数据存在本地 SQLite视频处理交给 src/main/util/ffmpeg.js。数据流是说话视频 → 拆出画面和声音 → 分别训练 → 新文案驱动口型首尾都在你本机完成这是它全离线能力的来源。显卡、驱动、硬盘三道必答题必须是一张 NVIDIA 显卡且驱动装好了。这一点没有商量余地——官方文档原话是本项目所有算力都在本地没有英伟达显卡或没有驱动程序三个服务是启动不了的。推荐配置是 13 代 i5-13400F、32GB 内存文档标注为必要项、RTX 407016GB 内存的机器则可能起不来 ASR 服务后面排障一节还会提到。装完驱动后在终端敲一下nvidia-smi能看到显卡型号和驱动版本就说明显卡这道题通过了。硬盘方面首次部署要下载约 70GB 的镜像流量所以空间要提前留足检查项WindowsUbuntu 22.04系统版本Win10 19042.1526 或更高官方完成适配验证的是 22.04 Desktop内核 6.8.0-52-generic存镜像的空间C 盘空闲 100GB 以上硬盘空闲 100GB 以上存数据的位置必须有 D 盘空闲 30GB 以上数字人和作品数据都落在这客户端 AppImage 直接跑推荐配置i5-13400F / 32GB 内存 / RTX 4070同左C 盘紧张的话不用慌装完 Docker 后可以在 Docker Desktop 的设置里把镜像位置指到另一个空闲大于 100GB 的磁盘文件夹服务端怎么拉起来先把代码拿下来git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar服务端跑在 Docker 里所以这一步的意义是把跑服务的底座先装好容器后面全靠它。Ubuntu 先装 Docker 和 composesudo apt update然后sudo apt install docker.io docker-compose。再装 NVIDIA Container Toolkit 并配置nvidia-ctk runtime configure --runtimedocker最后重启 docker——这一步是让 Docker 能看见你的显卡缺了它容器里就没有算力。Windows 则用 WSL2 打底wsl --list --verbose看看装没装没有就wsl --install再wsl --update更新到最新版之后装好 Docker Desktop首次启动接受协议、跳过登录即可。底座就绪后真正启动服务只有这一条命令cd deploy docker-compose up -d它会按 deploy/ 下的配置一键拉起三个容器。首次执行要耐心等下载约 70GB官方提示半小时左右、看网速注意连 WiFi。如果报request canceled之类的连接错误是 Docker Hub 官方源不稳定在 Docker 设置里加国内镜像源registry-mirrors再重试就行。看到 Docker 里出现三个 Running 的服务asr、tts、gen-video就算成功了。这里有两个可选变体只要视频生成能力跑docker-compose -f docker-compose-lite.yml up -d只起一个Duix.Avatar-gen-video容器吃资源最少50 系新显卡30/40 系搭配 CUDA 12.8 也可以用docker-compose -f docker-compose-5090.yml up -d对应的是官方 torch 预览版方案。装客户端克隆你的第一个数字人客户端不需要自己编译直接去项目官方 Releases 下载Windows双击Duix.Avatar-x.x.x-setup.exe安装Ubuntu双击Duix.Avatar-x.x.x.AppImage即可运行无需安装。提醒一下如果用 root 用户登录桌面双击可能没反应改到终端执行并加上--no-sandbox参数即可。客户端本身就是全离线工具主界面分成我的数字人和我的作品两栏克隆出来的形象和生成的视频分别落在两边第一次克隆形象的操作要点 上传一段 10 秒左右、光线充足、背景简单的正面视频。⚠️ 视频里必须有人声、而且在说话。官方 FAQ 明确写了程序要用这段声音做声音克隆静音视频会直接报错。训练完成后就能输入文案或上传音频来驱动数字人。文案支持英语、日语、韩语、中文、法语、德语、阿拉伯语、西班牙语八种语言文字会被合成为你的克隆音色再和形象画面做口型同步产出口播视频。卡住或报错时按这三步查我踩过的坑基本都是下面这几类按顺序排查效率最高看服务状态。客户端右上角菜单里检查三个服务是否都是 Running查显卡与驱动。nvidia-smi出不了显卡信息基本就是驱动没装好。查日志。客户端日志从客户端菜单里导出服务端日志点开 Docker 里对应容器的输出把关键几行复制下来再对照 官方 FAQ 搜关键词两个高频问题官方 FAQ 里都有现成答案克隆时报Connection refused一般是duix-avatar-asr启动慢服务端刚起完等几分钟再操作内存偏小比如 16GB的机器也可能起不来 ASR。镜像下载失败就是前面说的 Docker Hub 不稳定换国内镜像源必要时开全局代理。还有一个容易忽略的动作把服务端和客户端都更新到最新版。这个项目社区更新很频繁到/deploy目录重新执行docker-compose up -d、客户端拉取新代码重新构建很多问题在新版本里已经修掉了。想二开本地开放了哪些接口如果你想把数字人能力接进自己的系统Docker 起来后本地就暴露了几个 API代码参照 src/main/service/ 下的 model.js、video.js、voice.js视频合成http://127.0.0.1:8383/easy/submit提交任务http://127.0.0.1:8383/easy/query?code任务code查进度声音克隆http://127.0.0.1:18180/v1/preprocess_and_tran做音频预处理http://127.0.0.1:18180/v1/invoke做音频合成。参数细节都在 README_zh.md 的开放 API一节写得很清楚。最后交代一句商用边界开源本地部署全球免费商用但用户量超 10 万或年营收超 1000 万美元的企业需要签商业许可协议条款见 LICENSE。先去 deploy 目录跑通 lite 版把第一个数字人克隆出来再考虑上完整版和二开。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考