
今天带大家演示一套基于 Qwen2-VL 的 ComfyUI 图像反推描述词工作流。整个流程围绕“上传图像、调用大模型解析、输出精细文本描述”展开,让读者能直观看到如何把图片内容转成可直接使用的描述词。工作流结构简单但高效,核心由图像加载、视觉语言模型推理、文本展示三部分组成,能够在一次推理中生成连贯、细致的图像描述,非常适合做提示词反推、图像分析、内容理解等任务。文章目录工作流介绍核心模型Node节点工作流程大模型应用图像内容解析节点概述使用方法应用场景开发与应用工作流介绍这套工作流通过 LoadImage 节点载入图片,再交由 Qwen2VLNode 执行反推描述,最后使用 ShowText 节点输出可阅读内容。它围绕一张输入图像展开分析,从主体、背景到风格信息逐层提取,并通过大模型的语言能力将视觉信息转成自然语言。核心模型负责内容理解与文本生成,节点之间连接清晰,各自承担图像输入、模型推理、结果呈现的职责,使整体流程流畅稳定。核心模型这套工作流依托 Qwen2-VL-7B 模型完成视觉内容解析。模型具备强大的图像理解能力,能够识别人物、环境、颜色和抽象信息,并以自然语言输出结构完整的描述文本。通过 Balanced 8-bit 推理模式,模型保持了性能与显存占用之间的平衡,使流程易于在日常设备上运行。模型的温度、top_p 和生成长度在节点内均可调整,以便控制描述的细致度和风格,从而让结果更贴近真实图像内容。模型名称存储需求内存使用推理速度精度表现功能描述应用场景模型特性/硬件要求Qwen2-VL-2B