十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

qmd 本地文档搜索指南:一条命令装好,三步跑通混合检索

qmd 本地文档搜索指南:一条命令装好,三步跑通混合检索 qmd 本地文档搜索指南一条命令装好三步跑通混合检索【免费下载链接】qmdmini cli search engine for your docs, knowledge bases, meeting notes, whatever. Tracking current sota approaches while being all local项目地址: https://gitcode.com/GitHub_Trending/qmd1/qmdqmdQuery Markup Documents是一个全本地运行的文档搜索引擎把索引指到你的 Markdown 笔记、会议记录或团队 wiki关键词和自然语言都能查全程不经过任何云服务。适合那些笔记越攒越多、却总找不到东西的开发者与知识工作者。 一条命令装好 qmdqmd 运行需要 Node.js 22 或 Bun官方包直接全局安装即可不需要自己构建npm install -g tobilu/qmd装完后终端里敲qmd status能正常返回就说明装好了。首次搜索时它会自动下载三个本地模型缓存在~/.cache/qmd/models/加起来约 2GBembeddinggemma 做向量、qwen3-reranker 做重排、还有一个作者微调的 1.7B 查询扩展模型。想从源码跑的话git clone https://gitcode.com/GitHub_Trending/qmd1/qmd进目录npm install再npm link就行。 建集合先让 qmd 认识你的文档qmd 用集合collection管理文档一个集合就是一个目录。几个目录一次登记qmd collection add ~/notes --name notes qmd collection add ~/Documents/Meetings --name meetings qmd context add qmd://notes 个人笔记与想法 qmd context add qmd://meetings 会议记录前两条把目录登记进来后两条给每个集合写一句描述。context 会跟着搜索结果一起返回帮 LLM 更准地判断相关性——README 里作者专门强调别小看这个功能。登记完目录生成向量并同步索引qmd embed qmd updateqmd embed把文档按约 900 token 切块并生成向量qmd update重新扫描磁盘更新全文索引。想确认状态用qmd status安装环境有问题sqlite-vec、GPU 等就qmd doctor诊断一下。 三种搜索模式按场景选命令qmd 提供三种不同深度的搜索命令日常推荐queryqmd search project timeline # BM25 关键词搜索最快 qmd vsearch how to deploy # 向量语义搜索 qmd query quarterly planning # 混合检索 LLM 重排质量最好每条结果带路径、docid、标题、context、0–1 的分数和一段高亮命中词的摘要。拿到结果后按路径或 docid 直接取全文qmd get meetings/2024-01-15.md qmd multi-get journals/2025-05*.md常用选项-n控制条数-c notes限定某个集合--min-score 0.3过滤低分结果--json/--md输出机器友好格式--explain能看到每条结果的 RRF 打分明细。配置要点index.yml 里都有什么上面这些集合与 context 命令最终都读写同一个配置文件默认在~/.config/qmd/index.yml仓库里的 example-index.yml 是带完整注释的模板。常用字段字段含义示例collections.name.path要索引的绝对目录~/Documents/Meetingspattern文件过滤 glob默认**/*.md**/*.{md,txt}ignore额外排除模式仅 YAML 可写drafts/**update每次qmd update前执行的命令git pull --ff-onlyincludeByDefault是否参与默认搜索falsecontext路径前缀 → 描述最长前缀生效/api: API 文档global_context所有集合统一的前置描述我的项目知识库记一条纪律改了path/pattern/ignore要跑qmd update重建索引换了 embedding 模型要跑qmd embed配置本身不会自动触发任何索引动作。一条查询是如何变成有序结果的以qmd query为例整条链路分五步全部在你机器上执行查询扩展本地 1.7B 模型把你的原话拆成lex关键词、vec自然语言、hyde假设答案三类子查询并行检索原查询与各类子查询分别打 BM25 全文索引和向量索引lex走全文vec/hyde走向量RRF 融合多份排名列表按倒数排名融合原查询权重 ×2保留前 30 个候选LLM 重排reranker 模型对候选逐条打 0–1 分位置感知混合排名靠前的偏信检索分、靠后的偏信重排分输出最终排序。这套设计让精确关键词命中不会被扩展查询稀释重排也无法推翻高置信度的检索结果。如果你不想交给扩展模型自动决策可以直接手写多行查询完整语法见 docs/SYNTAX.mdqmd query $lex: rate limiter algorithm\nvec: how does rate limiting work常见问题与下一步首次搜索很慢模型在首次使用时才下载等它下完之后走本地缓存。中文召回不佳把 embedding 模型换成语种覆盖更广的 Qwen3-Embedding-0.6B设QMD_EMBED_MODEL再qmd embed -f重建向量。纯 CPU 机器search/vsearch照常可用query加--no-rerank跳过重排只拿 RRF 分数。接 AI 工具qmd mcp --http把搜索暴露为本地 HTTP 服务默认 localhost:8181MCP 客户端指向它即可查询扩展模型的训练与微调脚本在 finetune/ 目录里感兴趣可以翻翻。qmd 的价值一句话把写过但忘了的笔记变成可检索的资产。下一步挑一个你最乱的知识目录建个集合用一个你一直想不起来答案的问题跑一遍qmd query——检索效果好不好一次就能看出来。【免费下载链接】qmdmini cli search engine for your docs, knowledge bases, meeting notes, whatever. Tracking current sota approaches while being all local项目地址: https://gitcode.com/GitHub_Trending/qmd1/qmd创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表