十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Vision-Agents 实时视频风格迁移拆解指南

Vision-Agents 实时视频风格迁移拆解指南 Vision-Agents 实时视频风格迁移拆解指南【免费下载链接】Vision-AgentsOpen Vision Agents by Stream. Build voice and vision agents quickly with any model or video provider. Uses Streams edge network for ultra-low latency.项目地址: https://gitcode.com/GitHub_Trending/vi/Vision-Agents视频通话中,摄像头画面被实时重绘成动画风格,这就是 Vision-Agents 提供的实时视频风格迁移。这个开源框架把任意模型与视频提供商拼进同一条低延迟管线,风格转换只是它众多能力之一。从 clone 到跑通风格迁移的最短路径 先把仓库拉下来:git clone https://gitcode.com/GitHub_Trending/vi/Vision-Agents,进入目录后执行uv sync装好依赖。仓库是多包结构,框架核心在agents-core,各提供商能力以插件形式放在plugins/下,Decart 插件即在其中。接下来配置密钥。Decart 负责云端画面重绘,Stream 负责音视频传输:DECART_API_KEYyour_decart_key STREAM_API_KEYyour_stream_key STREAM_API_SECRETyour_stream_secret初始化本身只有一件事:把 RestylingProcessor(一个负责视频重绘的处理器)放进 Agent 的processors列表。风格由initial_prompt指定,模型选lucy_2_rt:agent Agent( edgegetstream.Edge(), agent_userUser(nameStyled AI), llmopenai.LLM(modelgpt-5), processors[ decart.RestylingProcessor( modellucy_2_rt, initial_promptStudio Ghibli animation style, ) ], )上面这段同时决定了三件事:通话信令走 Stream 边缘网络,大脑是 LLM,画面走 Decart 重绘。跑uv run decart_example.py run,浏览器打开演示页后,通话里显示的画面就已经不是原始摄像头流了。可运行的完整版本见 plugins/decart/example/decart_example.py。底层机制:一条 WebSocket 双向链路 RestylingProcessor 的文档把链路写得直白:接收本地视频轨道,经 WebSocket 发给 Decart 实时 API,拿到转换后的帧,发布为新轨道。拆开看是四段:入站:通话里参与者的本地轨道是MediaStreamTrack,即按时间排队的一帧帧视频流。process_video收到轨道后触发_connect_to_decart,带着初始 prompt 建立连接。上行:本地帧持续经 WebSocket 推到 Decart,由云端实时模型逐帧重绘。下行:_on_remote_stream回调拿到转换流,后台任务循环调用recv()拉帧,写入自建的DecartVideoTrack。出站:publish_video_track把新轨道交给框架,对其他参与者而言,它就是一路新摄像头。稳定性也有兜底:处理循环每秒检查连接状态,断开即用当前轨道自动重连,参与者离开则清理任务。通话本身的低延迟由 Stream 边缘网络承载,重绘流回注同一通话,端到端延迟可控。进阶:动态切换 Prompt 换风格 ️初始 prompt 只是起点。更常见的玩法是让 LLM 根据对话内容随时改风格——把换风格注册成 LLM 的工具函数:llm.register_function( descriptionChange the video style prompt ) async def change_prompt(prompt: str) - str: await processor.update_prompt(prompt) return fStyle changed to: {prompt}用户说把画面变成暴风雨的夜晚,LLM 识别意图后调用该函数,update_prompt通过已建立的连接把新 prompt 推给 Decart,随后的帧逐步切到新风格,无需断开重连。示例项目里的虚拟换装更进一步:用update_state把 prompt 与参考图原子地一起替换,避免换装头几帧出现半新半旧的画面。落地场景:风格迁移能拼进哪些产品先看讲故事。上面演示里那通通话就是 story teller 场景——LLM 边讲边推进剧情,画面风格跟着叙事走,听众看到的是被画出来的现场。风格迁移负责沉浸感,语音链路(ASR LLM TTS)沿用框架现成组件即可。第二类是虚拟试穿。示例把它做成虚拟衣橱:语音下令穿件夹克,LLM 调用change_costume,update_state同时替换 prompt 和参考图,人物即换装。这类应用的难点在状态更新与语音指令的衔接,示例代码已处理好。第三类偏内容生产:直播或点播叠加风格层,固定风格做品牌包装,或按环节切换(开场动画风、正片写实风),走的就是前面的动态 prompt 通道。项目资源与延伸完整示例:plugins/decart/example/decart_example.py,配套说明在 plugins/decart/README.md处理器实现:plugins/decart/vision_agents/plugins/decart/decart_restyling_processor.py框架总览与更多插件索引:README.md想调输出分辨率、镜像或 prompt 增强,直接看 RestylingProcessor 的构造参数(width/height/mirror/enhance),默认输出 1280x720。【免费下载链接】Vision-AgentsOpen Vision Agents by Stream. Build voice and vision agents quickly with any model or video provider. Uses Streams edge network for ultra-low latency.项目地址: https://gitcode.com/GitHub_Trending/vi/Vision-Agents创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表