十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

新技术分享:ComfyUi+MinimaxH3进阶教程(三)H3音频生成

新技术分享:ComfyUi+MinimaxH3进阶教程(三)H3音频生成 说明若对文章中的内容有任何困惑的地方可以对文章进行赞赏赞赏后可以发私信给作者赞赏金额不限制多少都可以如果说上一章我们说用MinimaxH3来做图片生成和编辑还是一种探索一种尝试那么用MinimaxH3来代替类似Index-TTS这样的音频模型来生成音频。我个人觉得就已经是可以实实在在去接入生成的了。在正式开始我们今天的课程之前我们先对我们原来的工作流做个小改动。我们最开始搭建这个MinimaxH3的工作流的时候用了“MiniMax H3 Easy 加载器”这个组件来加载模型。这里面加载了一个图生视频的模型还加载了一个参考生视频的模型。仔细看过前面文章的朋友应该清楚其实这里面的两个模型我们用的是同一个模型都是图生视频的模型里面的参考模型只是我们用图生视频改了一下名字。但这样的操作就然我们白白的多加了一个模型其实加载的那个参考生视频的模型就仅仅是占个位置其实可以说没啥用。因此呢我就把这块改了一下不用他这个聚合组件向我们原来一样还是分开再单独加一个模型的聚合结点把他聚合起来就行如下图这样我们就不用加载按个假的参考生视频模型了把图生视频模型一分二给他传进去。我们也可以在硬盘里把那个假的参考生视频的模型给删掉省一点硬盘空间。好了工作流改造完成下来正式开始我们今天的课程。和上一章的MinimaxH3转图片模型的文章一样我们还是先 说原理。我们用H3做视频的时候他会自己生成对应的音频。那么我们在做视频的时候把画面的分辨率降到最低再把时间相应的拉长是不是就可以 得到一个只要音频不要视频的结果。下来我们开始做实验我们先去用提示词Skill去生成一段提示词提示词Skill的安装和使用请请看MinimaxH3从部署到生成系列文章。我给Skill的原文是文生视频一个帅气的20岁男主播用充满磁性的、有仙气的声音抑扬顿挫的朗读天姥连天向天横势拔五岳掩赤城天台四万八千丈对此欲倒东南倾。纯人声 。​​​​如上图我们把分辨率改成Custom(自定义)给他个64*64然后把时长调到15s。再把图像解码和视频合成那块给他禁用掉给音频解码那块链接要给保存音频如下图。15s的音频只用了29s的时间。效果非常好,感觉好好研究研究用这个做有声书那无敌了因为这个Minimax他生成的音频是需要参考画面的也就是说是带有感情的需要的话也是可以加载背景音效的。相比于原来那种只是生成音频的模型不知好了多少-------结束线---------我建了一个交流群方便大家在学习的过程中相互交流。有兴趣的朋友可以加一下课程中提到的相关资料都会在群里进行分享。如果大家在阅读文章的时候有什么困惑可以在文章的底部留言我看到的第一时间就会进行回复。
返回列表