十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

在自己硬件上跑 OpenAI 兼容的本地推理服务:LocalAI 部署完全指南

在自己硬件上跑 OpenAI 兼容的本地推理服务:LocalAI 部署完全指南 在自己硬件上跑 OpenAI 兼容的本地推理服务LocalAI 部署完全指南【免费下载链接】LocalAILocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required.项目地址: https://gitcode.com/GitHub_Trending/lo/LocalAI⚡ 一个反直觉的起点你正在按 token 付费调用的那个/v1/chat/completions接口在没有 GPU 的家用电脑上就能跑而且每次调用都是零成本。LocalAI 是一个开源的本地推理服务OpenAI 和 Anthropic 的 REST API 替代方案离线大模型、图像生成、语音、视频模型全都能跑在你自己的硬件上现有代码只需要改一个 base URL。它和主流全家桶方案的核心差异在于它不是一个捆绑包而是一个小核心。路由、Web 界面、权限认证都在一个核心里而 llama.cpp、vLLM、whisper.cpp、stable-diffusion、MLX 等 60 多个推理后端各自是独立的镜像只在某个模型需要它时自动拉取——你只安装用到的东西。️ 能力全景一张表说清楚下表是 README 与官方文档能力矩阵的浓缩版先给你一个边界感能力支持程度典型后端 / 模型硬件门槛文本生成 / 对话完整函数调用、语法约束、多轮llama.cpp、vLLM、SGLang、transformersQwen3、Llama 3.x、Granite 等CPU 可用GPU 更快图像生成完整stable-diffusion-ggml、diffusersSD3、Flux 等建议 GPU语音完整TTS、STT、实时语音Kokoro、Piper、whisper.cpp、parakeetCPU 可跑嵌入 / 重排序完整bge-m3、sentencetransformers、rerankersCPU 可用视觉 / 目标检测完整llava、phi-3-vision、RF-DETR、Depth-Anything视模型而定视频生成完整LTX、WANggml建议 GPUAgent内置MCP 工具、RAG、技能支持工具调用的 LLM视 LLM 而定表里没列、但值得知道的两点一是 Realtime API基于 WebRTC一种低延迟实时通信协议做到音频进、音频出可以直接搭一个开口说话的语音助手不用自己串 ASRLLMTTS 的流水线二是内置多用户管理API key、按用户配额、角色访问意味着它能当小型内部平台用而不只是单人玩具。说话人分离、UI 里直接微调、运行时量化也都有。 三条部署路径按你愿意花多少时间分30 秒级一行命令跑起来这条命令拉取官方 CPU 镜像并映射 8080 端口docker run -ti --name local-ai -p 8080:8080 localai/localai:latest打开 http://localhost:8080 就能看到内置 Web 界面聊天、从模型库装模型、建 agent、看系统资源不需要额外工具。验证是否成功另开终端执行curl http://localhost:8080/readyz返回 200 即服务就绪。5 分钟级带上模型启动这条命令会在启动时顺带预装 qwen3-4b 模型体积小、CPU 友好且支持工具调用docker run -ti --name local-ai -p 8080:8080 localai/localai:latest qwen3-4b关键参数就两个末尾的模型名会在服务启动前自动下载-p 8080:8080是端口映射。CLI 方式下local-ai run qwen3-4b是等价操作。验证是否成功curl http://localhost:8080/v1/models列表里能看到 qwen3-4b。深度定制级多后端、多硬件、生产环境硬件按 GPU 选镜像——NVIDIA CUDA、AMD ROCm、Intel oneAPI、Apple SiliconMetal/MLX或 Vulkan核心会自动探测并拉取匹配的后端。生产开启多用户认证LOCALAI_AUTHtrue或用 LOCALAI_API_KEY 做访问门禁模型目录可用 LOCALAI_MODELS_PATH 固定位置。扩展分布式模式基于 PostgreSQL NATS 做多节点路由与模型分片。验证是否成功看docker logs local-ai里后端拉取与模型加载的日志出问题对照故障排查指南。 按你想用它做什么组织用例一跑一个能回答问题的对话服务场景交付物是一个真正返回文本的聊天 API任何基于 OpenAI SDK 的现有应用改个 base URL 就能接。关键配置装一个聊天模型如 qwen3-4b端点是 /v1/chat/completions参数与 OpenAI 方言一致。注意首个请求会触发模型加载进内存第一次调用慢、第二次起正常model 字段必须填你装好的名字。这条命令向聊天端点发一次请求返回模型的回复curl http://localhost:8080/v1/chat/completions -H Content-Type: application/json \ -d {model:qwen3-4b,messages:[{role:user,content:hi}]}用例二把文字变成能听的音频场景交付物是一段朗读音频文件或者一份录音转写文本构成最小语音流水线。关键配置装一个 TTS 模型Kokoro、Piper 等和一个 ASR 模型whisper.cpp分别调 /v1/audio/speech 与 /v1/audio/transcriptions。注意TTS 按语言和音色选模型Piper 一家就覆盖 42 种语言、60 多个音色中文场景优先确认音色可用。用例三搭一个离线的向量知识库场景交付物是内部文档、产品手册的语义检索向量表数据不出内网。关键配置装一个嵌入模型bge-m3、sentencetransformersPOST /v1/embeddings。注意向量维度要和模型匹配配一个重排序模型对检索结果按相关性二次打分能明显提升 top-k 精度。⚠️ 边界在哪里坦诚的局限性磁盘和内存是硬约束模型文件按规模与量化档位在 1–30GB 之间下载需要预留模型大小 2–3 倍的空闲空间放不进内存的模型会慢得让人怀疑人生。量化降低数值精度以省内存如 Q4_K_M 约为原始体积的 75%是常规取舍手段。首次代价是真实的后端按需拉取某类模型第一次运行要先下载后端镜像、再加载权重首调用明显慢第二次起才正常——第一次别急着怀疑网络。兼容不等于完全一样OpenAI 的主要端点都有实现但个别参数与字段和官方存在细微差异模型名也是本地名而不是 gpt-4llama.cpp 后端的默认采样mirostat还会让跑分和裸 llama.cpp 对不上模型配置里设mirostat: 0可关闭。 在整个工具链里的位置LocalAI 处在工具链的推理服务层它的下层是 llama.cpp、vLLM、whisper.cpp、stable-diffusion 这些推理引擎每个都被包成独立的 gRPC 服务gRPC 是一种高性能进程间通信协议你只要知道后端可以单独升级、互不牵连即可按需拉取它的上层是任何会说 OpenAI/Anthropic API 的东西——SDK、聊天客户端、Agent 框架改个 base URL 就能接上。一句话对比Ollama 更聚焦 LLM、上手更简单LocalAI 多给的是完整 OpenAI 兼容端点、多模态和多用户管理直接用 llama.cpp 则省掉管理层但路由和运维要自己搭。单机不够时它的分布式模式PostgreSQL NATS VRAM 感知路由接管集群层worker 甚至可以跑在与核心不同的机器上。如果你手里有一台几 GB 内存的机器和一个想替换掉 OpenAI API 的应用从 30 秒级那条命令开始跑起来打开 Web 界面聊两句——剩下的判断看到效果之后再做也不迟。【免费下载链接】LocalAILocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required.项目地址: https://gitcode.com/GitHub_Trending/lo/LocalAI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表