十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

本地免费制作口播数字人视频:Duix.Avatar 数字人克隆与视频生成完整教程

本地免费制作口播数字人视频:Duix.Avatar 数字人克隆与视频生成完整教程 本地免费制作口播数字人视频Duix.Avatar 数字人克隆与视频生成完整教程【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar把一段十秒左右、带人声的正面视频交给 Duix.Avatar你的电脑会在本地训练出一个属于你的数字形象之后再输入一段文字就能得到一段由你开口说话的口播视频口型、音色都来自你本人。这就是 Duix.Avatar 能帮你做出来的东西——一个完全离线运行的开源 AI 数字人视频工具形象克隆、声音克隆和文本驱动视频合成都发生在你自己机器上不经过任何第三方服务器。先认识一下项目为什么数字人克隆工具值得跑在本地用过云端数字人服务的人大概都感受过两件事按月扣费的账单以及我的素材要传到对方服务器上这件事本身。Duix.Avatar 的思路是把这两件事都去掉项目完全开源克隆算法和合成框架直接放在代码仓库里部署之后所有 AI 计算都在本地 GPU 上跑录制的形象视频和声音样本不会离开你的硬盘。看什么云端数字人服务Duix.Avatar 本地部署持续费用按月订阅视频越多开销越大部署完成后使用不产生费用资料去向视频和声音样本需上传服务商文件始终留在本地磁盘生成速度受网络与排队影响直接取决于你的显卡能改到什么程度只能用产品提供的功能源码开放可随需求扩展它还顺手解决了几个容易踩的坑界面是图形化的没有技术背景也能上手支持导入多个形象并统一管理客户端在英文和中文之间可以自由切换。动手之前数字人克隆的硬件与系统环境要求操作系统Windows 1019042.1526 或更高版本或 Ubuntu 22.04 Desktop。确认命令Windows 用winverUbuntu 用lsb_release -a。磁盘Windows 部署要求必须有 D 盘D 盘存数字人和项目数据空闲大于 30GBC 盘存镜像文件空闲大于 100GB不足的话装完 Docker 后可以把磁盘镜像位置改到空间更大的盘。显卡必须是 NVIDIA 显卡并装好驱动。三个核心容器都声明了runtime: nvidia没有 NVIDIA 显卡或驱动没装对服务根本起不来——这一点比 CPU 重要得多。配置档位参考档位CPU内存显卡存储大致表现入门尝鲜第 10 代酷睿 i5 或同档 AMD16GBRTX 30606GB 显存256GB SSD 1TB HDD可完成基础形象训练合成 720p 视频进阶创作第 13 代酷睿 i7-13700F32GBRTX 407012GB 显存512GB SSD 2TB SSD训练速度明显更快合成 1080p 视频专业批量第 14 代酷睿 i9-14900K64GBRTX 409024GB 显存1TB SSD 4TB SSD大批量任务与 4K 合成选件时优先保显卡显存如果预算只够加一项建议加内存到 32GB训练中途内存不足的报错并不少见。从 clone 代码到服务全部跑通安装部署步骤先拿到代码git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix.Avatar接着按顺序做四件事确认系统版本winver或lsb_release -a不达标就先换系统或升级。Windows 用户准备 WSL执行wsl --list --verbose查看是否已安装没有或版本旧就执行wsl --update。安装 DockerWindows 下载 Docker Desktop首次启动接受协议、跳过登录即可Ubuntu 执行sudo apt update后安装docker.io与docker-compose并安装 NVIDIA Container Toolkit 让 Docker 能用上显卡详见 README 的 Ubuntu 安装说明。磁盘镜像位置可以在 Docker 设置里改到空间更大的盘。启动服务进入deploy目录执行docker-compose up -d。这个目录下还有docker-compose-lite.yml、docker-compose-linux.yml等变体按需选择。首次启动会下载大约 70GB 的镜像请留在 WiFi 环境等待约半小时期间不要反复 CtrlC。完成后执行docker ps看到fun-asr、fish-speech-ziming、duix.avatar三个容器状态都是 Up即部署成功cd deploy docker-compose up -d docker ps三者分别负责语音识别、语音合成和视频合成对外暴露在http://127.0.0.1的 18180 与 8383 端口上客户端会自动连接不需要你手动配置。一次完整创作从克隆形象到生成视频部署完成后打开客户端首页有「Create Video」和「Create Avatar」两个入口下方分别是我的作品和我的数字人列表。一次完整的创作按三步走。第一步建数字人形象进入 Create Avatar上传一段 10 秒左右的正面视频。注意两个硬性要求分辨率建议 720p 以上、光线均匀视频里必须有人声因为系统要用这段声音做克隆——只有画面没有声音的视频会直接报错。提交后本地开始训练基础配置大约 30 分钟训练完成后你会得到一个可反复复用的数字形象。第二步声音随形象一起克隆声音克隆依赖你上传视频里的人声克隆出来的音色、语调和你本人一致后续生成的语音都基于它。脚本支持 8 种语言英语、日语、韩语、中文、法语、德语、阿拉伯语、西班牙语语速、音调等参数都可以调。如果只想换音色而不想重录形象可以在声音样本上单独处理对应接口走的是 18180 端口的合成服务。第三步输入文字生成口播视频进入 Create Video选择已训练好的形象把口播文案贴进文本框。系统会把文字转成克隆的语音再驱动形象做出对应的口型与表情最终输出一条音视频对齐的视频。整个过程就是文本 → 语音 → 视频一条线不需要你在中间手动拼接任何素材。数字人视频用在哪里三个真实场景课程与培训录播录制教师正面视频训练形象把讲义变成口播稿语速调到自己讲解时习惯的节奏一条课程视频不需要反复进棚。企业宣传物料用代言人的形象批量产出产品介绍、活动预告。声音样本建议在安静环境、用质量好的麦克风录口播稿统一成品牌口吻后后续只需替换文字。自媒体批量更新固定一个虚拟主播的形象和声音保证账号辨识度文案批量准备后逐条合成省去反复拍摄剪辑。常见问题排查与日常优化容器起不来。先执行docker ps看是哪几个容器不在 Running再用netstat -ano | findstr 18180 8383确认端口没被占用检查 NVIDIA 驱动是否为最新最后确认磁盘至少还有 30GB 空闲。多数服务起不来最终都落在这四处之一。训练卡住或报错。最常见的原因还是素材视频没有人声、分辨率低于 720p、或光线过暗。重录一段必要时转成 H.264 编码的 MP4 再试显存吃紧的机器可以适当降低训练参数或者把其他占显存的程序关掉。另外 asr 服务启动比主服务慢容器刚起来时别急着提交训练等几分钟再操作。合成变慢或卡顿。关掉与合成竞争 CPU 和内存的应用用系统监控工具观察显存是否被占满定期清理缓存目录~/.duix_avatar/cache/。日常维护上每月更新一次 Docker 镜像、每周清一次临时文件训练任务一次只跑一个多个视频任务集中排队处理比穿插执行更稳。排障时需要看日志客户端日志入口在右上角菜单的 Open Log文件位于AppData\Roaming下的 logs 目录服务端日志则直接打开对应容器的 Logs 页复制即可。继续探索源码、接口与文档想往下挖的话按目录看代码效率最高模型训练 / 视频合成 / 声音合成的 API 调用逻辑src/main/service/端口与服务地址等运行配置src/main/config/各服务接口实现f2f、ttssrc/main/api/本地数据库与存储src/main/db/部署编排文件含 lite 精简版与 Linux 版deploy/中文排障文档含镜像源配置、模特报错等常见案例doc/常见问题.md遇到问题时顺序建议是先读一遍 doc/常见问题.md再到仓库 Issues 里搜关键词最后带着复现步骤和容器日志去提问——项目更新比较频繁很多问题在新版本里已经修掉了。结尾从克隆第一个形象开始找一段十秒、有清晰人声的正面视频按上面流程把服务跑起来然后输入你的第一段口播文案。跑通之后把训练好的模型和项目文件备份到外部存储剩下的事情就是慢慢扩展你的使用场景了。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表