
前言llama.cpp 是本地大模型推理的高效后端引擎而 LM Studio 则通过图形化界面与 API 服务对 llama.cpp 的 GGUF 模型格式提供了深度集成与封装显著降低了本地模型的部署与调用门槛。DeepSeek-Harness 是 DeepSeek AI 推出的开源 Agent 智能体框架其核心理念为“一切皆插件”——模型、工具、界面及智能体行为均可按需添加、移除或替换。该插件式架构由 Cordis 驱动使开发者能够精细掌控 Agent 的执行逻辑而非受限于固定工作流。本章将围绕 llama.cpp 与 DeepSeek-Harness系统阐述如何构建本地大模型推理与 Agent 智能体系统内容涵盖简介、环境配置与实际使用三个方面。目录1 简介2 环境配置3 实际使用1 简介LM Studio 是一款能在本地电脑上完全免费、离线运行大语言模型的桌面工具既提供了类似ChatGPT的聊天界面也提供了兼容OpenAI的API服务器实现文本补全、工具调用函数定义、自主Agent通过Bionic以及文本嵌入生成并支持按需加载和卸载模型以高效管理内存。DeepSeek Harness简称dsh是 DeepSeek AI 开源的智能体框架agent harness采用“一切皆插件”的架构设计目前处于快速迭代的开发者预览阶段。它基于 Node.js 环境运行用户可通过npx deepseek-ai/dsh web命令一键启动或通过源码运行启用默认在http://127.0.0.1:3080提供 Web UI 界面。该框架支持开发者通过插件机制进行扩展并提供了开发指南和架构文档其社区还设有 GitHub Discussions 和企业微信群用于交流反馈。2 环境配置环境配置分为两步安装并配置LM Studio以发布本地大语言模型(LLM)服务再安装并配置DeepSeek Harness以对接该服务并构建本地智能体。可通过官方下载并安装LM Studio Bionic:https://lmstudio.ai/下载并安装完毕后可根据自身机器的情况下载合适的模型并发布服务。以Qwen3.5-9B Q8_0模型为例打开软件后新建工程并点击软件左上角【折叠】按钮右下角可现实【设置】。接着通过点击【设置】按钮进入设置界面并选择【探索】Tab页进入模型浏览页面在模型浏览页面左上角可输入Qwen3.5-9B并选择Q4_K_M量化版进行安装。同时可以通过【资源库】Tab页设置模型下载到本地的路径在【本地模型API】Tab页可修改用于发布模型本地服务的API地址可得到本地模型服务地址http://localhost:1234/v1。接着配置DeepSeek-Harness环境可按照官方说明(https://github.com/deepseek-ai/deepseek-harness/blob/master/README.zh.md)进行安装命令如下git clone https://github.com/deepseek-ai/deepseek-harness.git cd deepseek-harness pnpm install pnpm run build pnpm dsh web而pnpm环境的安装可通过如下命令winget install OpenJS.NodeJS.LTS npm install -g pnpmlatest-10安装完毕后可通过地址http://127.0.0.1:3080启动UI界面初始状态下可设置一个API Key或者稍后配置API Key获取可通过官网DeepSeek获取。而本地发布的模型服务可通过【添加自定义提供方】的方式设置首次运行会提示本地运行失败可在配置文件中添加验证头解决同时给标识模型具备文本和图片解析能力settings.yaml(.dsh文件夹下)文件修改前后对比如下前ui-onboarding: welcomeNoticeVersion: 2026-08-13.1 llm-pi-ai: providers: qwen3-5-9b: api: openai-completions baseURL: http://localhost:1234/v1 models: - id: qwen/qwen3.5-9b - id: text-embedding-nomic-embed-text-v1.5 agent-default-model: provider: qwen3-5-9b model: qwen/qwen3.5-9b后ui-onboarding: welcomeNoticeVersion: 2026-08-13.1 llm-pi-ai: providers: qwen3-vl-8b: api: openai-completions baseURL: http://localhost:1234/v1 headers: Authorization: Bearer lm-studio models: - id: qwen/qwen3-vl-8b input: [ text, image ] - id: text-embedding-nomic-embed-text-v1.5 agent-default-model: provider: qwen3-vl-8b model: qwen/qwen3-vl-8b3 实际使用3.1 识图与对话使用本地发布的qwen3-vl-8b模型识图与对话。token速度达到8.7 tok/s处于基本可用状态。3.2 修改代码使用DeepSeek-V4-Flash修改代码尝试过用qwen3-vl-8b模型修改代码代码始终未修改成功。以开源项目osgPotree为例将其头文件(h)和源文件(cpp)全部修改未UTF8-BOM编码对话如下速度达到42 tok/s代码提交记录如下编码改为UTF8-BOM · e19505f · osg_opensource/osgPotree - Gitee.com3.3 图标生成参照开源项目OpenSceneGraph、VulkanSceneGraph给osgPotree生成一个logo。生成结果