十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

GLM-4V-9B图像理解实战:10分钟搭建支持OpenAI接口的多模态看图对话应用

GLM-4V-9B图像理解实战:10分钟搭建支持OpenAI接口的多模态看图对话应用 GLM-4V-9B图像理解实战10分钟搭建支持OpenAI接口的多模态看图对话应用【免费下载链接】GLM-4GLM-4 series: Open Multilingual Multimodal Chat LMs | 开源多语言多模态对话模型项目地址: https://gitcode.com/zai-org/GLM-4GLM-4V-9B 是智谱AI推出的开源多模态视觉大模型支持看图对话、图像理解与描述。本文将带你快速搭建一个支持 OpenAI 接口的 GLM-4V-9B 多模态看图对话应用只需启动一个本地服务就能像调用 OpenAI 接口一样让模型看懂图片并和你继续多轮对话全程不到10分钟。为什么选择 GLM-4V-9B 做图像理解️原生看图能力GLM-4V-9B 不仅能描述图片内容还能结合上下文进行多轮追问比如这是春天还是冬天拍的这正是多模态对话区别于普通图片识别的关键。兼容 OpenAI 接口仓库自带的 glm4v_server.py 提供标准的/v1/chat/completions端点现有 OpenAI SDK 代码只需改一个base_url就能接入迁移成本极低。部署门槛友好BF16 精度下单卡约 28GB 显存即可运行INT4 量化后最低仅需 10GB 显存消费级显卡也能玩。环境准备一键安装依赖先获取仓库代码git clone https://gitcode.com/zai-org/GLM-4 cd GLM-4/inference然后安装推理依赖依赖清单见 requirements.txtpip install -r requirements.txt 建议提前安装 CUDA 版本的 PyTorch模型会自动根据显卡能力选择 BF16 或 FP16 精度。三步搭建 OpenAI 兼容的多模态服务第1步启动 GLM-4V 图像理解服务一条命令启动服务模型将从THUDM/glm-4v-9b自动下载约20GB也可替换为本地模型路径python glm4v_server.py THUDM/glm-4v-9b服务启动后默认监听8000端口并自动开启 CORS支持浏览器跨域调用。服务内部会自动处理图片的 base64 解码、对话历史整理和多轮图像上下文核心逻辑见 glm4v_server.py 中的process_history_and_images函数。第2步发送第一次看图请求仓库提供了现成的客户端脚本 glm4v_api_request.py默认会读取当前目录下的 demo.jpg 湿木栈道图片向模型提问图里有什么再追问这是春天还是冬天拍的python glm4v_api_request.py如果你想在自己的项目里调用核心就是标准的 OpenAI 消息格式——把图片转成 base64以image_url形式放进content数组即可完整示例可参考 glm4v_api_request.py 中的glm4v_simple_image_chat函数。第3步用网页界面体验看图对话嫌命令行太枯燥直接运行 Gradio 网页版源码见 trans_web_vision_demo.pypython trans_web_vision_demo.py启动后浏览器打开本地地址上传图片就能边看图边聊天效果类似下图的多模态对话界面此外仓库还提供命令行交互版 trans_cli_vision_demo.py适合终端爱好者。显存要求与性能参考官方在 H100 环境下的实测数据详见 README_zh.md精度显存占用首Token延迟输出速度BF16单卡28 GB0.1s33.4 tokens/sINT4单卡10 GB0.1s28.7 tokens/s 显存不足的显卡可以优先尝试 INT4 量化加载速度损失很小。常见问题速查Q调用报错 400 Invalid requestA检查最后一条消息的role是否为user且messages至少包含一条。Q图片传不进去A本地图片需编码为data:image/jpeg;base64,xxxx格式也支持直接传可访问的图片 URL。Q想用 vLLM 替代 transformersA纯文本模型可用vllm serve启动 OpenAI 兼容服务参考 vllm_cli_demo.pyGLM-4V 的 OpenAI 服务则推荐本文的glm4v_server.py方案。小结通过本文的 3 步流程你已经拥有了一个本地可用的 GLM-4V-9B 图像理解服务glm4v_server.py起服务、OpenAI 格式发消息、Gradio 网页玩对话。后续还可以把它接入自己的应用实现文档截图解析、电商图片问答等场景感兴趣的读者可以进一步查看 inference/ 目录下的完整示例代码。【免费下载链接】GLM-4GLM-4 series: Open Multilingual Multimodal Chat LMs | 开源多语言多模态对话模型项目地址: https://gitcode.com/zai-org/GLM-4创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表