十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

文档问答能否全走内网:RAG-Anything 本地部署与 LMStudio 集成指南

文档问答能否全走内网:RAG-Anything 本地部署与 LMStudio 集成指南 文档问答能否全走内网RAG-Anything 本地部署与 LMStudio 集成指南【免费下载链接】RAG-AnythingRAG-Anything: All-in-One RAG Framework项目地址: https://gitcode.com/GitHub_Trending/ra/RAG-Anything如果你手上的合同、实验报告不能上传到云端 API可以把RAG-Anything与LMStudio结合做本地部署文档解析、检索和回答生成全部在你自己的机器上完成。下面是一条三步走通的部署路径外加几组容易踩的坑。 内网文档出不了机器本地部署为什么值得合规审查、实验数据这类文档直接丢给云端大模型接口可能违反数据管理规定。同时云 API 按 token 计费文档量大、长期使用时成本会持续累积。对这两类场景来说把推理搬到本地不是可选项而是账本上更划算的那一项。 方案概览本地模型 多模态解析流水线一句话说明这套方案RAG-Anything 负责把文档解析、切分、建索引LMStudio 负责在本地跑大模型和嵌入模型把文字转成可检索的数值向量的部件两者通过 OpenAI 兼容接口对接都指向同一个本地端口。 三步完成本地部署1. 安装 Python 依赖RAG-Anything 通过 OpenAI 兼容客户端访问 LMStudio所以除了主包外还要装openaipip install raganything openai python-dotenv2. 启动 LMStudio 本地服务在 LMStudio 中加载一个大语言模型示例用openai/gpt-oss-20b和一个嵌入模型示例用text-embedding-nomic-embed-text-v1.5点 Start Server确认默认端口1234已在监听模型加载完成后再继续下一步。3. 配置环境变量并初始化 RAG创建.env把 LLM 和嵌入两类绑定都指向 LMStudio 的本地地址LLM_BINDINGlmstudio LLM_MODELopenai/gpt-oss-20b LLM_BINDING_HOSThttp://localhost:1234/v1 LLM_BINDING_API_KEYlm-studio EMBEDDING_BINDINGlmstudio EMBEDDING_MODELtext-embedding-nomic-embed-text-v1.5 EMBEDDING_BINDING_HOSThttp://localhost:1234/v1 EMBEDDING_BINDING_API_KEYlm-studio然后在代码中初始化配置表格和公式处理可按需开关config RAGAnythingConfig( working_dir./rag_storage_lmstudio/demo, parsermineru, parse_methodauto, enable_image_processingFalse, enable_table_processingTrue, enable_equation_processingTrue, )完整可运行的流程见 示例脚本初始化逻辑的实现在 核心模块。 能力与边界能处理哪些文档和模型支持解析的文件类型共 16 种覆盖PDF、DOC/DOCX、PPT/PPTX、XLS/XLSX、TXT、MD以及 JPG、PNG、TIFF、WebP 等图片格式。解析器可选mineru、docling、paddleocr三种按文档质量选表格与数学公式LaTeX识别可独立开关LLM 与嵌入模型可各自指向不同本地模型互不影响客观说局限向量检索的质量受嵌入模型约束示例模型为768 维、上下文 8192 token纯 CPU 或低显存环境下20B 级模型的响应时间会是分钟级与云 API 的秒级有明显差距。⚠️ 常见坑与调优连接失败、模型 404、显存不足连接超时LMStudio 服务器没启动或实际端口不是 1234。先确认 Start Server 已点开再核对LLM_BINDING_HOST指向的地址。连得上但模型 404LLM_MODEL填写的名字和已加载的模型不一致。跑一遍示例里的test_connection()它会列出当前可用的全部模型按输出填。显存不足 / 推理极慢模型体积超过显存容量被换出到内存运行。换更小参数的模型或调低MAX_CONCURRENT_FILES的并发数。首次查询特别慢向量索引尚未建完首批文档要边入库边构建。用批量入口先离线建好索引再开查询服务。 适合谁用本地部署还是云 API推荐本地部署文档涉密或受合规限制的团队内网离线环境文档量大、想省掉长期 token 账单的场景。不建议本地部署没有可用 GPU、又追求秒级响应和高并发的服务文档不敏感、总量小的短期项目——这种情况下云 API 更省事也更省钱。本地 RAG 的核心收益是数据不出机器的同时保留图检索加向量检索的双通道能力。下一步复制env.example把两处 binding 改成lmstudio然后运行 示例脚本能打印出模型列表即部署成功。【免费下载链接】RAG-AnythingRAG-Anything: All-in-One RAG Framework项目地址: https://gitcode.com/GitHub_Trending/ra/RAG-Anything创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表