十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

10 秒把自己变成AI数字人:Duix.Avatar本地部署新手完整指南

10 秒把自己变成AI数字人:Duix.Avatar本地部署新手完整指南 10 秒把自己变成AI数字人Duix.Avatar本地部署新手完整指南【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarDuix.Avatar 是一款真正开源的 AI 数字人克隆工具只需提交一段 10 秒左右的正面视频就能在本机完成数字人形象和声音的克隆之后输入一段文案或上传一段音频即可自动生成口型匹配的口播视频。整套流程全离线运行素材不离开你的电脑。下面从它能做什么、需要什么配置、怎么部署、怎么用四个角度把这套开源数字人方案讲清楚。 先看成品一个界面两个核心动作两个主按钮Create Avatar 与 Create Video客户端主界面很克制核心就两个入口Create Avatar上传一段你自己的视频10 秒左右系统会同时提取你的外貌和声音生成一个可复用的数字人模型。Create Video选择已训练好的模型输入文字或上传音频点生成得到一条口型同步的数字人口播视频。下方的 My Works / My Avatars 列表分别管理你的视频作品和数字人模型支持多模型导入与切换方便按场景挑选不同分身。全离线不是噱头是它的核心卖点商业数字人产品大多把素材传到云端处理。而这个项目把 ASR、TTS、视频合成三个服务全部跑在你自己的显卡上录制的形象视频、写的文案、生成的音频全程不上网。对企业内训视频、内部宣传稿这类不方便外发的场景这一点几乎是刚需。 动手之前先核对硬件和磁盘一张可直接照抄的配置表项目最低/官方要求备注系统Windows 10 19042.1526 或 Ubuntu 22.04 Desktop内核 6.8.0-52-generic 已验证GPUNVIDIA 显卡 正确安装的驱动硬性要求没有它服务起不来内存32G 及以上官方标注必要CPU推荐 i5-13400F 级别参考配置为 RTX 4070磁盘WindowsD 盘空闲 30GDocker 镜像盘 100G镜像默认存 C 盘不足可改位置带宽首次拉镜像约 70G 流量建议连 WiFi耗时约半小时Ubuntu 版本要求更简单磁盘空闲 100G 以上即可。当前项目版本为 1.0.6客户端基于 Electron Vue3 构建。按你的显卡选一份 docker-composedeploy/ 目录下有四份编排文件对应不同场景docker-compose.yml标准三服务ASR TTS 视频合成绝大多数人选它docker-compose-lite.yml轻量版只启动视频合成服务适合已有 TTS/ASR 方案的玩法docker-compose-5090.yml面向 RTX 50 系列显卡官方已用 5090 测试通过30/40 系列 CUDA 12.8 用户也可用docker-compose-linux.ymlUbuntu 环境专用。 新手部署时间线从空机到三个服务跑起来第 1 步装 WSL 2 和 DockerWindows命令行执行wsl --install安装 WSL再用wsl --update更新到 2 版然后安装 Docker Desktop。这里有个容易忽略的点镜像默认存在 C 盘的 WSL 目录里如果 C 盘不足 100G可以在 Docker 的 Settings → Resources 里把 Disk image location 改到别的盘。第 2 步拉镜像并启动服务先克隆仓库git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -d这一行命令会拉取guiji2025/fun-asr、guiji2025/fish-speech-ziming、guiji2025/duix.avatar三个镜像合计约 70G视网速约半小时。完成后用docker ps检查三个容器都处于 Running 状态即部署成功。拉镜像如果一直失败参考 doc/常见问题.md 里配置的国内镜像源方案。第 3 步装客户端开始克隆从官方 Release 下载对应安装包Windows 为 exeUbuntu 为免安装的 AppImage双击安装后连接本机服务端即可。右上角菜单的 Open Log 可以随时查看客户端日志排查连接问题很有用。 幕后拆解一条视频是怎么被拼装出来的三个服务各管一段整套流水线由三个容器协作完成职责清晰fun-asr语音识别把训练视频里的声音转成文字作为克隆声音的参照文本。它基于开源的 FunASR 项目fish-speech-ziming语音合成基于 fish-speech用你 10 秒的录音作参考音频把任意文案读成你的声音支持中、英、日、韩、法、德、阿拉伯、西语共 8 种语言duix.avatar视频合成用你的形象视频 上一步生成的音频驱动口型输出最终视频。理解这条链路后任何一个环节出错都能快速定位到对应服务。记住三个端口和两个数据目录端口服务用途18180TTS声音克隆、音频合成10095ASR语音转文字8383视频合成提交/查询合成任务数据落在两个约定目录Windows 下为D:\duix_avatar_data\的voice/data与face2face映射关系在 deploy/docker-compose.yml 里可以看到清理磁盘或换盘时心里有数。️ 进阶玩法绕过界面用 API 自己组流程三个接口覆盖完整链路服务端在本地暴露了 HTTP 接口官方在 src/main/service/ 目录的model.js、video.js、voice.js里就是现成的调用示例POST http://127.0.0.1:18180/v1/preprocess_and_tran提交参考音频返回后续合成要用的asr_format_audio_url和reference_audio_text相当于模特训练POST http://127.0.0.1:18180/v1/invoke传入文本和上一步的返回值得到克隆声音的音频文件POST http://127.0.0.1:8383/easy/submit提交音频形象视频做合成再用/easy/query?code任务码轮询进度。有了这三个接口你就可以把数字人写进自己的自动化脚本批量文案进、批量口播视频出适合课程更新、账号矩阵等高频场景。不想折腾部署两条捷径社区已有基于 Docker 单镜像的 8G 显存可用整合包模型约 10G不再要求 100G 硬盘显存紧张的朋友可以去社区搜一搜项目同时上线了 Coze 平台的克隆智能体与插件免部署直接使用适合先体验效果再决定要不要本地自建。⚠️ 使用边界这几个限制要提前知道NVIDIA 显卡是硬性入场券本项目所有算力都在本地 GPU 上跑没有 NVIDIA 显卡或驱动没装好三个服务直接起不来。动手前先执行nvidia-smi验证显卡和驱动正常——这是官方提问前自查清单里的第一条。最容易踩的两个坑训练视频必须有真人说话的声音。形象克隆同时依赖画面和声音上传一段无声视频会直接报错这是新增模特时最常见的失败原因服务端日志是排查第一现场。出问题优先看三个容器的日志Docker 里点对应容器的 Logs 页客户端侧用 Open Log 查看。比如下面这个 TTS 容器的file not exists报错就是典型的素材路径/文件缺失问题商用边界项目支持全球免费商用但用户量超过 10 万或年营收达 1000 万美元以上的企业需签署商业许可协议协议见仓库根目录 LICENSE 及模型社区许可协议 PDF。个人和中小团队正常使用没有额外费用。回到最开始的场景你有一张能跑的 NVIDIA 显卡、约 100G 空闲磁盘和半小时带宽时间就能拥有一套完全私有化的 AI 数字人产线——10 秒视频克隆形象与声音文案进、口播视频出全程数据不出内网。它的边界同样明确必须依赖 NVIDIA GPU、首次拉镜像较重、口型效果以可用而非电影级为标准。对于内部培训、自媒体口播、批量内容生产这类高频场景这套开源方案的性价比几乎没有对手而追求极致口型效果或企业级 SLA 的团队则可以把本文的 API 链路作为起点在自有服务上做更深的定制。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表