十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

别再为找不到伴奏发愁:用 UVR 轻松完成 AI 人声分离的完整指南

别再为找不到伴奏发愁:用 UVR 轻松完成 AI 人声分离的完整指南 别再为找不到伴奏发愁用 UVR 轻松完成 AI 人声分离的完整指南【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremoverguiUVRUltimate Vocal Remover是一款免费开源的 AI 人声分离工具它借助深度神经网络能把一首歌干净地拆成「纯人声」和「纯伴奏」两份独立音频。无论你是想录翻唱、做混音还是给视频配乐这篇文章会用一次真实的实操带你从安装走到成品。先搞清楚一件事AI 人声分离到底在做什么周五晚上你兴致勃勃准备录一首翻唱结果在平台上找了两个小时伴奏不是带着原唱就是音质差得没法用。这时候摆在面前的选择只有两个要么忍着人声一起录要么自己动手把伴奏从原曲里抠出来。早年间大家用的办法无非是相位抵消和滤波。相位抵消要求拿到立体声版本能不能成还得看混音师当初怎么摆声像运气成分很大滤波更粗暴人声和吉他挤在同一段频率时一刀切下去两边一起受伤。面对现代流行歌动不动几十条音轨的复杂编曲这两种老办法经常束手无策。UVR 的思路完全不同。它把海量原曲 干净分轨的配对音频喂给神经网络让模型自己在频谱里寻找人声的规律。模型见得多之后哪怕遇到一首从没听过的歌也能判断出哪一段更像人声、哪一段更像乐器。它依据的不只是频率高低还有声音在时间轴上的连贯性、和声之间的呼应这类更抽象的特征。想验证这一点直接打开项目里的lib_v5目录就能看到lib_v5/mdxnet.py是 MDX-Net 的推理实现lib_v5/tfc_tdf_v3.py负责时频变换相关的网络模块lib_v5/spec_utils.py则是频谱处理的地基。三套引擎共用这套底层只是各自的上层结构不同脾气也不同。UVR 内置了三种分离算法用大白话概括就是MDX-Net最省心的大众款流行歌、网络热歌表现均衡第一次用闭眼选它基本不会错Demucs编曲复杂、乐器密集的时候更稳处理古典或大编制也不容易翻车VR Architecture可调节的选项最多适合愿意花时间慢慢打磨的老手。没有哪个算法能通吃所有歌关键在于找到当下这首曲子最合拍的那一个。怎么判断后面实操里会给你一套简单的办法。动手之前把这三样东西备齐你不需要懂深度学习但需要先准备三样东西一个能跑 Python 的环境、一套依赖库以及模型文件。前两样弄好大概花十分钟。先从仓库拉下代码并装依赖git clone https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui cd ultimatevocalremovergui pip install -r requirements.txt如果电脑里有 NVIDIA 显卡强烈建议把 PyTorch 换成 CUDA 版本处理速度能拉开好几倍的差距没有独显也不用慌CPU 一样能跑只是慢一些。Mac 用户用 M1 芯片的话开启 GPU 转换时软件会自动走 MPS 加速。再说模型。打开models目录会看到三个子文件夹对应三种算法Demucs_Models、MDX_Net_Models、VR_Models。首次启动时软件会自动下载需要的模型如果网络不争气也可以手动把模型文件放进对应的子目录VR_Models里已经预置了一个UVR-DeNoise-Lite.pth可供体验。一切就绪后运行python UVR.py就会弹出主界面。界面虽然控件多但可以看作三段上方是输入输出区负责选歌曲文件、定输出目录和音频格式中间是算法与模型区选 MDX-Net 还是 Demucs、用哪个模型、分段多大都在这里下方是附加参数包括 GPU 加速开关、只输出人声还是只输出伴奏。理清这三段剩下的就是往里面填内容。第一次分离十分钟出两个文件选一首你熟悉且音质不错的歌跟着这个顺序走一遍点击Select Input选中你的音频文件点击Select Output指定结果保存的文件夹处理方式选MDX-Net模型选一个带 HQ 后缀的比如 MDX23C-InstVoc HQSegment Size 保持 256Overlap 保持 8如果前面配好了 GPU勾选GPU Conversion按下Start Processing去倒杯水。过几分钟回来输出目录里会出现两个文件一个叫歌名_(Vocals).wav另一个叫歌名_(Instrumental).wav。前者是提纯后的人声后者是去掉了人声的伴奏到这一步你的第一份成品就算出炉了。这里有必要解释一下 Overlap 为什么重要。软件并不是一次性处理整首歌而是把长音频切成小段逐个计算段与段之间需要留出重叠区域重叠越多拼接处的接缝越不明显代价是计算量变大。你可以把它想象成贴壁纸要对花——重叠就是给拼接处留的余量余量小了接缝处就容易露出破绽。怎样用 GPU 让人声分离更顺滑如果你有支持 CUDA 的 N 卡处理速度的提升会非常直观。同样一首五分钟的歌CPU 可能要等上十几分钟GPU 往往两三分钟就交卷。差别在于AI 推理本质上是一大堆并行的小运算GPU 天生擅长同时算几千个CPU 只能排队一个个来。动手前可以做一个简单测试勾选 GPU Conversion 跑一次再取消勾选跑同一首歌对比一下耗时你心里就有数了。Mac 用户同样可以用M1 上的 GPU 转换会调用 MPS 加速。如果中途遇到显存报错英文通常包含 out of memory优先把 Segment Size 从 256 调小到 128或者暂时关掉 GPU 转换。这不会牺牲太多质量只是处理时间会变长。从 60 分到 90 分模型与进阶选项怎么选第一版结果如果只是能听但不完美别急着删你有几条路可以走。用采样模式先试听。界面上有个 Sample Mode30s选项勾选后只处理前 30 秒。换模型、调参数之前先跑一小段满意了再整首跑能帮你省下大量等待时间。想试几种模型的时候这个功能几乎是必备的。不同风格换不同算法。如果 MDX-Net 在你这首歌上人声残留明显切到 Demucs 试试编曲特别复杂的段落处理得脏再换 VR Architecture 调调后处理阈值。多试几个组合找到让这首歌最干净的那一套比死磕一个参数有用得多。批量处理整批文件。当你需要一口气处理一个文件夹的歌可以开启 MDX-Net 或 VR Architecture 的 Batch Mode软件会按队列依次处理不用守在屏幕前一首首点。让两个模型合伙干活。进阶玩法是 Secondary Model Mode主模型出结果后再让一个辅助模型参与微调你还能控制它的影响权重。效果未必每次都更好但值得在难搞的曲子上试一把。把当前配置存下来。调出一套满意的参数后通过保存设置功能记录下来下次打开软件直接加载省得重新填一遍。新手最容易踩的四个坑以及应对办法把平时大家问得最多的几个问题汇总在一起遇到对号入座即可界面打不开、报 TclError 之类的错多半是系统缺了 tkinter。Linux 上装一下 python3-tk 再启动就好。报 CUDA out of memory显存不够。把 Segment Size 调小或者关掉 GPU 转换改用 CPU 跑。模型一直下载不下来软件内置了手动下载入口也可以自己去把模型文件放进models下对应的子目录启动时它会自动识别。分离结果有人声残留或者断断续续先把 Overlap 提到 16 或 24 试试如果没改善换一种算法重跑大概率能找到更好的组合。记住一个原则先改一个变量跑 30 秒采样验证再改下一个。一次动好几个参数出了问题你都分不清是谁的锅。最后说两句UVR 的价值在于它把原本属于专业音频工作站的能力变成每个人都能点开的图形界面。第一次跑出干净的伴奏时那种惊喜值得你亲自体验。选一首最喜欢的歌按上面的流程走一遍不满意就换参数再跑——一个晚上你就能拥有属于自己的伴奏库。【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表