十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

GenieX 使用指南:在高通骁龙设备上本地运行 LLM 与 VLM 的 6 条路径

GenieX 使用指南:在高通骁龙设备上本地运行 LLM 与 VLM 的 6 条路径 GenieX 使用指南在高通骁龙设备上本地运行 LLM 与 VLM 的 6 条路径【免费下载链接】GenieXRun frontier LLMs and VLMs locally on Qualcomm devices across NPU, GPU, and CPU with a few lines of code项目地址: https://gitcode.com/GitHub_Trending/ne/GenieXGenieX 是面向高通骁龙设备的端侧生成式 AI 推理运行时可以把 Hugging Face 上的 GGUF 模型或 Qualcomm AI Hub 的预编译模型包拉到本地直接跑在 Hexagon NPU、Adreno GPU 或 CPU 上。它底层是同一套 C SDK对外提供 CLI、Python、Android、Docker 和 OpenAI 兼容服务 5 种入口且仅支持骁龙平台。双运行时设计llama.cpp 走覆盖AI Engine Direct 走性能GenieX 内置两套推理后端分别解决能不能跑和跑得多快llama_cpp走高通的 GGML Hexagon 后端可加载 Hugging Face 上几乎任意 GGUF 模型CPU、GPU、NPU 都能跑是模型覆盖最广的路径qairtQualcomm AI Engine Direct只接受按芯片组预编译、预量化的模型包且只跑在 NPU 上换来的是骁龙上最快的 NPU 路径。选哪个取决于模型来源自己手里的 GGUF 用前者AI Hub 上发布的模型用后者。两条路径的详细对比见 平台与运行时文档。骁龙平台支持清单Windows ARM64、Android 与 Linux ARM64GenieX 不做 x86 构建只覆盖三类骁龙设备方向芯片可用入口计算Copilot PC骁龙 X Elite / X2 EliteCLI、Python、本地服务移动骁龙 8 Elite / 8 Elite Gen 5Android SDKKotlin/JavaIoTDragonwing IQ-9075 / IQ-8275CLI、Docker、Python芯片组会自动探测也可用geniex config get chipset确认、geniex config set chipset手动指定。计算单元方面有 4 个别名npu默认、gpu、cpu以及骁龙上速度最快的hybrid——后者把每个算子按 HTP/CPU 各自擅长点分发。模型怎么选GGUF 选 Q4_0 才能上 NPU拉 GGUF 模型时CLI 会让你选精度而精度直接决定模型落在哪块硬件上Q4_0默认llama.cpp 中对 Hexagon NPU 支持最好的格式大多数模型建议选它Q8_0/F16质量更高但体积和耗时约 2 倍通常跑在 GPU/CPU 上AI Hub 模型包量化在编译期就定死多为w4a16运行时无法更改要换精度只能换一个模型包。模态方面文本所有模型都支持图像输入任何 VLM 都行音频输入仅支持 llama.cpp 后端中带 conformer 编码器的 mmproj 模型如google/gemma-4-E2B-it-qat-q4_0-gguf且一次对话可以同时带文本、图片和音频。完整清单见 模型支持文档。从安装到首次推理Linux 一行装好geniex infer 开聊Linux ARM64 上安装 CLI 只需要一行无需 sudocurl -fsSL https://qaihub-public-assets.s3.us-west-2.amazonaws.com/qai-hub-geniex/install.sh | shWindows ARM64 用户从发行版下载安装包运行即可Python 方向则是pip install geniex另有geniex-llama-cpp、geniex-qairt两个只装单一后端的精简包Android 方向在build.gradle.kts中加入com.qualcomm.qti:geniex-android依赖。装好后一行命令就能和模型对话VLM 直接拖入图片geniex infer google/gemma-4-E4B-it-qat-q4_0-gguf # HF 的 GGUF → llama.cpp geniex infer ai-hub-models/Qwen2.5-VL-7B-Instruct # AI Hub 模型包 → NPUPython 侧的用法对齐 Hugging Face transformers 风格AutoModelForCausalLM.from_pretrained(unsloth/Qwen3.5-2B-GGUF, precisionQ4_0)后调用model.generate(prompt, streamTrue)即可流式输出代码示例见 bindings/python/。OpenAI 兼容服务把本地模型接进 LangChain 等现有应用geniex serve启动一个本地 OpenAI 兼容 API默认监听http://127.0.0.1:18181/v1任何 OpenAI 客户端改个base_url就能复用LangChain 这类 agent 框架同样适用geniex pull ai-hub-models/Qwen3-4B-Instruct-2507 geniex serve服务自带 Swagger UI直接访问http://127.0.0.1:18181端点包括/v1/chat/completions支持 VLM 图文混排与工具调用、面向编辑器代码补全的/v1/completions以及模型列表查询。日常会用到的命令整理如下命令功能geniex pull 模型从 AI Hub / HF / 本地路径拉取模型进缓存geniex infer 模型交互式推理支持--compute、--think、--nctxgeniex serve启动 OpenAI 兼容本地服务geniex list/geniex remove 模型/geniex clean查看 / 删除 / 清空缓存模型geniex-bench独立基准工具测 TTFT、prefill 与 decode 速度用 geniex-bench 实测 NPU 收益从文档与测试入手想知道模型在你设备上真实快多少用独立的geniex-bench工具测三个指标首 token 延迟ttft、prefill 与 decode 速度。官方教程给出的实测参考值骁龙 X Elite 上 Qwen3-1.7BQ4_0的hybrid模式 decode 约 27.4 tok/s比纯 CPU 的 18.5 tok/s 高出 48%Dragonwing IQ-9075 上 22.6 对 15.2 tok/s。工具支持矩阵扫描多种模型 × 设备组合并输出 JSON 报告详见 基准测试教程。仓库内还有这些入口可以深入CLI 命令参考、Python 绑定文档bindings/python/、Android 示例与 集成文档以及覆盖 CLI、两种后端的 测试套件。项目采用 BSD 3-Clause 许可目前处于开发者预览阶段。端侧推理的价值很直接数据不出设备、无网络延迟也没有按 token 计费。下一步建议在你的骁龙设备上装好 CLI跑一条geniex infer ai-hub-models/Qwen3-4B10 分钟内看到第一个本地回答。【免费下载链接】GenieXRun frontier LLMs and VLMs locally on Qualcomm devices across NPU, GPU, and CPU with a few lines of code项目地址: https://gitcode.com/GitHub_Trending/ne/GenieX创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表