十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

markitdown 图像处理:把图片变成结构化 Markdown 的完整上手指南

markitdown 图像处理:把图片变成结构化 Markdown 的完整上手指南 markitdown 图像处理把图片变成结构化 Markdown 的完整上手指南【免费下载链接】markitdownPython tool for converting files and office documents to Markdown.项目地址: https://gitcode.com/GitHub_Trending/ma/markitdown把一张论文截图或产品图丢进文档转换管道出来的往往只有一句这是一个 JPG 文件。图里的文字、拍摄信息、它承载的上下文全被静默丢弃。markitdown 图像处理模块干的就是补上这个洞一边提取图片的身份信息一边让多模态模型能吃进图片的大语言模型写语义描述最后合成一份 Markdown。本文带你把这两条链路从装到跑走一遍读完就能在自己的管道里接上图片转换。它到底能看出什么AI 图片描述的两层产物 最终产物是一份 Markdown 文本分两层。第一层是写死在文件头里的结构化元数据尺寸、标题、作者、拍摄时间、坐标第二层是多模态大模型生成的图里画了什么。两段按顺序拼接互不依赖。ImageSize: 1615x1967 Title: AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation Description: AutoGen enables diverse LLM-based applications Author: AutoGen Authors DateTimeOriginal: 2024:03:14 22:10:00Description:这是一张 arXiv 论文首页截图。标题为 AutoGen: Enabling Next-Gen LLM Applications... 配图说明了该框架支持可对话、可定制的代理以及多种对话模式...第一层是键值对机器好读直接能进索引第二层是自然语言直接可进检索或 RAG检索增强生成流程。上面的样例来自仓库测试集里的一张真实图——一篇学术会议的论文首页元数据全部来自文件头描述则完全由模型看图写出两条链路并行ExifTool 元数据提取与多模态图片理解两层输出来自两条互不干扰的链路ExifTool你可以理解为图片的身份证阅读器只读文件头纯本地跑、不联网LLM 链路把图片 Base64 编码后发给模型要走 API。两条链路在同一条文件流上各自读完、汇合输出任何一条失败只跳过自己不拖垮对方。为什么要拆成两条因为两者本质不同元数据提取是确定性的、免费的描述生成是概率性的、花钱的。拆开之后没配 API key 你照样拿得到元数据不放心走网络时也能只关 LLM 这一条。从零到第一张图⚡ 最小可运行配置如下装好包、把 API key 放进环境变量十行代码就能出结果。from markitdown import MarkItDown from openai import OpenAI client OpenAI() # 读环境变量 OPENAI_API_KEY md MarkItDown( llm_clientclient, # 多模态客户端负责看图 llm_modelgpt-4o, # 任意 OpenAI 兼容模型 exiftool_path/usr/bin/exiftool, # 省略则自动探测 ) print(md.convert(test.jpg).text_content) # 一次调用跑出来的就是上一节那个样子。如果机器上没装 exiftool输出就只剩描述部分不会报错——这是刻意为之的设计两条链路各自降级。换一句提示词换一种人设提示词决定描述视角不是模型在猜你要什么是你在指挥它看什么。markitdown 把llm_prompt一路透传给模型改这一句输出的口吻、详略、关注点就跟着变。三种可以直接用的风格技术文档风让描述贴着架构说话。md MarkItDown(llm_clientclient, llm_modelgpt-4o, llm_prompt作为技术文档工程师描述这张架构图中的组件、数据流向和涉及的技术栈。)学术论文风按图注规范来客观精确。academic_prompt ( 按学术论文图注规范描述图示内容、实验设置、数据趋势、 比例尺与单位如可见。保持客观精确。 )电商产品风从卖点出发给运营看。commerce_prompt ( 从电商角度描述这张产品图材质质感、使用场景、 视觉营销效果突出卖点。 )同一张图跑三种提示词会得到三段描述一段给工程师看一段给审稿人看一段给运营看。默认提示词只是一句英文写两句你自己的效果立竿见影。仓库里的测试图玩得更直接——图里写着描述时务必提到字符串 5bda1dd6而模型的输出里真的出现了这个字符串三个可以直接抄的场景技术文档批处理一堆架构图需要一图一 md方便检索。for f in glob(docs/**/*.png, recursiveTrue): Path(f).with_suffix(.md).write_text(md.convert(f).text_content)收益文档库从此有可全文检索的图片描述不再是图床黑盒。图片资产库自动打标每个 SKU 图生成元数据 描述灌进向量库。md MarkItDown(llm_clientclient, llm_modelgpt-4o, llm_promptcommerce_prompt) records [md.convert(f).text_content for f in sku_images]收益找图从按文件名猜变成按语义搜。学术图表辅助说明投稿前给每张配图生成图注初稿。md MarkItDown(llm_clientclient, llm_modelgpt-4o, llm_promptacademic_prompt) print(md.convert(fig1.png).text_content)收益图注初稿五分钟到手你只做审改。踩坑速查现象原因一行解法输出里没有元数据字段ExifTool 未安装或路径没探测到系统装好 exiftool或构造时显式传exiftool_pathLLM 调用报 429触发 API 限流套一层 tenacity 重试 指数退避大图转换超时Base64 体积过大请求慢先缩放到长边 2048px 再 convert描述空泛或跑偏默认提示词太泛用llm_prompt指定角色与关注点另有一个隐性检查ExifTool 版本必须不低于 12.24。工具会在提取前校验版本太旧直接报错——这是防已知安全漏洞的硬门槛别试图绕过。写在最后回到开头的场景那张论文截图不再是一个 JPG 文件而是带着尺寸、标题、作者、时间戳外加一段人话描述的结构化数据。元数据 语义这种两层输出大概率会成为文档转换、OCR、图片理解这条流水线上的默认约定。现在就挑仓库里一张图给它跑一次 convert看看出来的 Markdown。【免费下载链接】markitdownPython tool for converting files and office documents to Markdown.项目地址: https://gitcode.com/GitHub_Trending/ma/markitdown创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表