Pixelle-Video AI短视频生成:从一句主题到成片只需3条命令
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
你想每天发布一条竖屏口播短视频,但不会写稿、不会剪辑、也不会配音。Pixelle-Video 是一个开源的 AI 全自动短视频生成引擎:你只输入一个主题,它自动完成写文案、生成 AI 配图、合成语音解说,最后合成完整视频。整套流程 3 条命令跑通,一条 5 分镜的视频大约 2-5 分钟出片。
🚀 快速上手:从克隆到看到结果的最短路径
这节回答"我要装什么、跑什么命令才能看到第一个视频"。前置依赖只有两个:Python 包管理器uv和视频合成工具ffmpeg(Ubuntu 用sudo apt install ffmpeg,macOS 用brew install ffmpeg)。然后执行:
git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video uv run streamlit run web/app.py浏览器会自动打开http://localhost:8501的 Web 界面。首次使用展开「⚙️ 系统配置」面板:填一个 LLM 的 API Key(推荐通义千问,预设会自动填好 base_url 和模型名),图像生成选默认的 RunningHub 云端工作流并填 API Key,点击「保存配置」即可。Windows 用户可以直接下载官方一键整合包,解压后双击start.bat,省去装 Python 和 ffmpeg 的步骤。
🎯 核心能力:按使用场景看它能做什么
这节回答"它具体能帮我完成哪几类活,产出是什么"。
场景一:只有主题,要一条完整成片。解决"没有脚本能力也不想剪辑"的问题。在左侧栏选「AI 生成内容」模式,输入主题(如"为什么要养成阅读习惯"),设好分镜数(默认 5 个)。系统依次生成标题、分镜文案、每句配图的提示词,再逐帧合成语音、生成配图、套模板渲染、拼接成视频。产出是一个保存在output/目录的 MP4,右侧栏直接预览,5 分镜大约 2-5 分钟。
场景二:已有自己的照片和视频素材。解决"素材和文案不匹配"的问题。选「自定义素材」流水线,上传你的照片或视频,AI 先分析素材内容,再生成与之匹配的脚本和解说,产出的是"围绕你的素材"的定制视频,而不是凭空想象的配图。
场景三:想用自己的声音。解决"AI 配音太机械"的问题。选择支持声音克隆的 TTS 工作流(如 Index-TTS),上传一段参考音频,系统用你的音色朗读整个文案;生成前可以用「预览语音」试听。
场景四:一鱼多吃,多平台尺寸分发。解决"不同平台要求不同画幅"的问题。模板按尺寸分组:竖屏 1080x1920 有 20+ 套(抖音、小红书),横屏 1920x1080 有 5 套(B站、YouTube),方形 1080x1080 用于朋友圈、Instagram。同一份文案换尺寸重新生成即可。
⚙️ 工作原理:一条主题如何变成视频
这节回答"数据在代码里怎么走,哪些模块管哪段"。
系统分四层:Streamlit Web 层(web/)负责交互,核心服务层(pixelle_video/services/)封装 LLM、图像、TTS、视频能力,流水线层(pixelle_video/pipelines/)编排完整流程,最底层接 ComfyUI 工作流(workflows/selfhost/)或直连 API 供应商(DashScope、OpenAI、ARK、Kling,配置在 pixelle_video/services/api_services/)。
标准流水线的数据流是单向的:
主题 → LLM 生成标题和分镜文案 → 为每句生成图像提示词 → 逐帧处理(TTS 生成音频 + 图像生成 + HTML 模板渲染成画面)→ 各分镜片段拼接 → 混入 BGM → 输出到output/
其中模板系统是画面风格的载体,位于 templates/,按尺寸分目录,命名即类型:static_*.html纯文字不生成媒体、image_*.html用 AI 图做背景、video_*.html用 AI 视频做背景。模板只暴露title、text、image三个变量,所见即所得。
💡 实战技巧:来自文档和配置的真实经验
这节回答"哪些坑文档里已经踩过,你可以直接抄答案"。
- 没有本地显卡就别折腾 ComfyUI。config.example.yaml 默认图像工作流就是
runninghub/image_flux.json(云端),只填 RunningHub API Key 就能跑通;生成大尺寸视频片段时选 48GB 显存实例更稳。 - 新手第一支视频用
static_静态模板。它不生成任何媒体,速度最快,适合先验证流程,再换image_模板加配图。 - 配图风格靠提示词前缀统一。
config.example.yaml里的prompt_prefix必须是英文(默认是黑白火柴人简笔画风格),所有分镜共用这一个前缀,改它比改模板省事。 - 自定义 BGM 就是往文件夹里扔文件。把你的 MP3/WAV 放到
bgm/目录,界面 BGM 选项里直接选,还能试听。 - 成本控制:Ollama(本地 LLM)+ 本地 ComfyUI 组合可以做到 0 元跑全流程;通义千问 + 本地 ComfyUI 的口径是每条约 0.01-0.05 元。另外 RunningHub 并发默认 1(
runninghub_concurrent_limit),会员等级允许时可调到 10 并行出图。
⚖️ 适合谁,不适合谁
这节回答"什么情况下别用这个项目"。
适合:要批量生产竖屏知识、生活、科普类短视频的创作者;没有本地 GPU、想纯云端跑图的人;想用零成本方案(Ollama + 本地 ComfyUI)先跑通流程的人;想通过 Python API(PixelleVideoCore)把它集成进自己系统里的开发者。
不适合:需要逐帧精确控制剪辑节奏的人——模板只暴露标题、文本、图片三个变量,做不了复杂转场和画中画;追求电影级画面质感的人——AI 配图的观感上限取决于你选的图像模型;既没有 API Key 又没有本地 ComfyUI 的人——文案和语音能生成,但配图和视频素材无从产生,成不了片。如果目标是剪辑已有素材而非从零生成,传统剪辑软件更合适。
📚 继续深入
这节给出按使用深度排列的入口。
- 快速上手:docs/zh/getting-started/quick-start.md
- 配置说明:docs/zh/getting-started/configuration.md
- 模板开发(含全部模板预览):docs/zh/user-guide/templates.md
- ComfyUI 工作流定制:docs/zh/user-guide/workflows.md
- Python API 集成:docs/zh/user-guide/api.md
- 声音克隆教程:docs/zh/tutorials/voice-cloning.md
- 自定义视觉风格:docs/zh/tutorials/custom-style.md
- 常见问题与故障排查:docs/zh/faq.md、docs/zh/troubleshooting.md
- 完整配置样例:config.example.yaml(注意文件头部警告:
config.yaml含 API Key,不要提交到 Git)
Pixelle-Video 把"主题到成片"的链路收敛成了可替换的几段:LLM、图像、TTS、模板各自独立,哪段不满意换哪段。下一步很简单:装好依赖,用默认模板生成一条你最熟悉主题的 5 分镜视频,先确认流程跑通,再逐个换模板和音色。
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考