
Self-LLM 实战Hunyuan-A13B-Instruct 基于 SGLang 的部署与 OpenAI 兼容接口调用指南【免费下载链接】self-llm《开源大模型食用指南》针对中国宝宝量身打造的基于Linux环境快速微调全参数/Lora、部署国内外开源大模型LLM/多模态大模型MLLM教程项目地址: https://gitcode.com/datawhalechina/self-llm混元大模型 A13B 采用共享专家 Top-k 专业专家的 MoE 稀疏架构与双模式推理链快思考/慢思考其 Instruct 版本具备类 Qwen3 的显式思考能力。本文基于开源仓库 self-llm 的官方教程手把手带你完成从环境准备、模型下载到 SGLang 服务器启动、OpenAI 兼容 API 调用、思考模式控制与 curl 验证的完整闭环。读完本文你将掌握在 LinuxCUDA环境下用 SGLang 高吞吐、低延迟地部署 Hunyuan-A13B-Instruct并能在自己应用中自如切换思考/非思考模式。为什么用 SGLang 部署 Hunyuan-A13B-Instruct在正式动手前先理解 SGLang 在本次部署中的定位。SGLang 是一个高性能的大语言模型推理与编程框架其核心特性正好匹配混元 A13B 这类大规模 MoE 模型的部署诉求快速后端运行时采用RadixAttention实现高效前缀缓存支持零开销 CPU 调度器、推测解码、分页注意力、连续批处理、分块预填充、结构化输出、张量并行、管道并行、专家并行以及多种量化格式FP8/INT4/AWQ/GPTQ支持多 LoRA 批处理提供高吞吐低延迟服务。其中专家并行Expert Parallel对 MoE 模型尤为关键可将不同专家跨设备分布突破单机显存限制灵活的前端语言提供直观的编程接口支持链式调用、高级提示设计、控制流、多模态输入、并行执行和外部交互便于构建复杂应用广泛的模型支持兼容多种主流模型如 LLaMA、Gemma、Mistral、Qwen、DeepSeek、LLaVA 等、嵌入模型如 e5-mistral、GTE、MCDSE以及奖励模型如 Skywork支持扩展接入新模型开源与社区SGLang 是开源项目拥有活跃的开发社区并被多个组织和项目采用。混元 A13B 是腾讯混元大模型的开源版本采用大规模稀疏专家模型MoE架构由1 个共享专家 64 个细粒度非共享专家训练阶段 8 个同时激活组成并搭配 SwiGLU 激活函数、Grouped-Query Attention 与双模式推理链框架详见仓库内 模型架构解析文档。其 Instruct 版本输出中带有think.../think思考标签而 SGLang 的--reasoning-parser qwen3参数即可解析该类格式这正是本教程选择 SGLang 作为推理框架的直接原因。环境准备与依赖安装本文基础环境如下---------------- ubuntu 22.04 python 3.12 cuda 12.4 pytorch 2.5.1 ----------------本文默认学习者已配置好以上Pytorch (cuda)环境如未配置请先自行安装。首先为pip换源加速下载并安装依赖包python -m pip install --upgrade pip pip config set global.index-url https://pypi.tuna.tsinghua.edu.cn/simple pip install --upgrade pip pip install sglang[all]0.4.6.post4 pip install modelscope pip install openai各依赖的用途说明sglang[all]0.4.6.post4SGLang 推理框架本体[all]表示安装全部扩展含 torch、flashinfer 等配套组件版本号下限0.4.6.post4保证launch_server、reasoning-parser等本教程用到的特性可用modelscope用于从 ModelScope 魔搭社区下载模型权重openai官方 OpenAI Python 客户端用于对接 SGLang 暴露的 OpenAI 兼容接口。模型下载使用 modelscope 中的snapshot_download函数下载模型第一个参数为模型名称参数cache_dir为模型的下载路径。新建model_download.py文件并在其中输入以下内容粘贴代码后记得保存文件。from modelscope import snapshot_download model_dir snapshot_download(Tencent-Hunyuan/Hunyuan-A13B-Instruct, cache_dir/root/autodl-tmp, revisionmaster)然后在终端中输入python model_download.py执行下载这里需要耐心等待一段时间直到模型下载完成。注意记得修改cache_dir为你的模型下载路径哦~下载完成后模型目录结构为cache_dir/Tencent-Hunyuan/Hunyuan-A13B-Instruct后续所有启动命令中的--model-path均指向该目录。代码准备启动服务器SGLang 框架提供了简单的方法来启动服务器。下面的代码展示了如何启动一个 SGLang 服务器该服务器将加载 Hunyuan-A13B-Instruct 模型并在指定端口上提供服务。新建start_server.py文件并在其中输入以下内容from sglang.test.test_utils import is_in_ci from sglang.utils import launch_server_cmd, wait_for_server, print_highlight, terminate_process server_process, port launch_server_cmd( python3 -m sglang.launch_server --model-path /root/autodl-tmp/Tencent-Hunyuan/Hunyuan-A13B-Instruct --host 0.0.0.0 --port 8080 --tp-size 2 --mem-fraction-static 0.8 --trust-remote-code --reasoning-parser qwen3, port 8080 ) wait_for_server(fhttp://localhost:{port}) print(fServer started on http://localhost:{port})注意请将--model-path参数修改为你的模型实际下载路径。在终端中执行以下命令启动服务器python start_server.py成功启动后你将看到类似以下的输出启动日志中会出现Application startup complete.、Uvicorn running on http://0.0.0.0:8080以及Server started on http://localhost:8080等关键信息启动流程中脚本内部依次完成了三件事launch_server_cmd以子进程方式拉起sglang.launch_server并返回进程句柄与端口号wait_for_server轮询http://localhost:8080实际探测/get_model_info接口直至服务就绪随后打印启动提示。is_in_ci等工具函数来自 sglang.test.test_utils 所在环境主要用于自动化场景手工部署时亦可跳过脚本直接使用下文的命令行方式。基本调用示例SGLang 提供了与 OpenAI API 兼容的接口可以通过 Python 的 OpenAI 客户端库进行调用。以下是几个基本的调用示例。文本补全示例新建test_completion.py文件并在其中输入以下内容from openai import OpenAI # 补全 API 与聊天补全 API 类似但没有 messages 参数或聊天模板。 # 补全 API 接受 OpenAI Completions API 的参数。有关更多详细信息请查阅OpenAI Completions API。 openai_api_key EMPTY openai_api_base http://127.0.0.1:8080/v1 # 使用正确的端口 client OpenAI( api_keyopenai_api_key, base_urlopenai_api_base, ) response client.completions.create( model/root/autodl-tmp/Tencent-Hunyuan/Hunyuan-A13B-Instruct, prompt给我一个关于大模型的简短介绍。, temperature0, max_tokens600, n1, stopNone, ) print(fResponse: {response})结果如下Response: Completion(id092771d863de45d8bd40fd60b954c9a5, choices[CompletionChoice(finish_reasonlength, index0, logprobsNone, textthink\n好的用户需要一个关于大模型的简短介绍。首先我需要明确大模型的核心定义可能包括参数规模、训练数据、能力特点。然后要提到关键技术比如Transformer架构因为这是大模型的基础。接下来应用场景也很重要用户可能想知道大模型能做什么比如对话、生成、分析等。还要区分大模型和传统模型的不同比如参数规模、泛化能力。另外可能需要提到发展现状比如从GPT-3到GPT-4LLaMA系列说明技术进步。还要注意语言简洁避免太技术化保持易懂。需要结构清晰先定义再技术基础然后能力应用最后现状。检查有没有遗漏的关键点比如自监督学习、海量数据、上下文学习能力。确保信息准确比如Transformer是2017年提出的大模型参数通常在十亿到万亿级别。可能用户是普通读者所以需要通俗解释避免术语堆砌。最后总结大模型的影响比如推动AI发展改变应用模式。现在组织这些点形成一个连贯的简短介绍。\n/think\nanswer\n### 大模型Large Language Model, LLM简短介绍 \n\n**核心定义**大模型是一类基于深度学习的人工智能系统通过海量文本、代码等数据训练具备超大规模参数通常达十亿至万亿级别, matched_stopNone)], created1751258302, model/root/autodl-fs/Hunyuan-A13B-Instruct, objecttext_completion, usageCompletionUsage(completion_tokens300, prompt_tokens9, total_tokens309, completion_tokens_detailsNone, prompt_tokens_detailsNone))注意请将model参数修改为你的模型实际下载路径。可以观察到即使是最基础的补全接口模型默认也会输出think.../think思考内容思考与回答通过特殊标签分隔——这正是混元 A13B Instruct 双模式推理链快思考/慢思考在输出侧的体现也是后续启用/禁用思考能力时重点处理的字段。聊天补全示例带思考功能新建test_chat_with_think.py文件并在其中输入以下内容from openai import OpenAI # 修改 OpenAI 的 API 密钥和 API 基础地址以使用 SGLang 的 API 服务器。 def chatcompletionwiththink(messages): openai_api_key EMPTY openai_api_base http://127.0.0.1:8080/v1 # 使用正确的端口 client OpenAI( api_keyopenai_api_key, base_urlopenai_api_base, ) model /root/autodl-tmp/Tencent-Hunyuan/Hunyuan-A13B-Instruct # 使用服务器加载的模型 messages [{role: user, content: messages}] response client.chat.completions.create( modelmodel, messagesmessages, ) print() print(response) print(模型思考: \n, response.choices[0].message.reasoning_content) print(模型回答: \n, response.choices[0].message.content) print() def chatcompletionwiththinkbyargs(messages, enable_thinkingTrue): openai_api_key EMPTY openai_api_base http://127.0.0.1:8080/v1 # 使用正确的端口 client OpenAI( api_keyopenai_api_key, base_urlopenai_api_base, ) model /root/autodl-tmp/Tencent-Hunyuan/Hunyuan-A13B-Instruct # 使用服务器加载的模型 messages [{role: user, content: messages}] response client.chat.completions.create( modelmodel, messagesmessages, extra_body{ chat_template_kwargs: {enable_thinking: enable_thinking}, separate_reasoning: True } ) print() print(response) print(模型思考: \n, response.choices[0].message.reasoning_content) print(模型回答: \n, response.choices[0].message.content) print() if __name__ __main__: print(参数方式不启用思考) chatcompletionwiththinkbyargs(给我一个关于大模型的简短介绍。, enable_thinkingFalse) print(参数方式启用思考) chatcompletionwiththinkbyargs(给我一个关于大模型的简短介绍。, enable_thinkingTrue) print(提示词方式不启用思考) chatcompletionwiththink(/no_think 给我一个关于大模型的简短介绍。) print(提示词方式启用思考) chatcompletionwiththink(/think 给我一个关于大模型的简短介绍。)注意请将model参数修改为你的模型实际下载路径。结果大概如下参数方式不启用思考 ChatCompletion(id08aa899ef5ac40a7a0e4f386fc1a99f2, choices[Choice(finish_reasonstop, index0, logprobsNone, messageChatCompletionMessage(contentanswer\n大模型指的是大规模语言模型英文一般称为Large Language Model简称LLM。下面从基本定义、技术原理、特点、应用场景几个方面介绍\n- **基本定义**它是一种基于深度学习的人工智能算法通过海量文本数据进行预训练学习语言的模式、结构和语义信息。\n- **技术原理**以Transformer架构为基础使用自注意力机制捕捉文本中词语间的关联通过大规模无监督学习让模型学习语言规律和知识。\n- **特点**具备强大语言理解和生成能力能处理多种自然语言处理任务知识储备丰富可回答不同领域问题可扩展性强通过增加参数和数据提升性能。\n- **应用场景**在智能客服领域能快速准确响应用户咨询在内容创作上可生成文章、诗歌等还能辅助代码编写、翻译、绘画提示生成等。\n/answer, refusalNone, roleassistant, annotationsNone, audioNone, function_callNone, tool_callsNone, reasoning_contentNone), matched_stop127960)], created1751258348, model/root/autodl-fs/Hunyuan-A13B-Instruct, objectchat.completion, service_tierNone, system_fingerprintNone, usageCompletionUsage(completion_tokens190, prompt_tokens17, total_tokens207, completion_tokens_detailsNone, prompt_tokens_detailsNone)) 模型思考: None 模型回答: answer 大模型指的是大规模语言模型英文一般称为Large Language Model简称LLM。下面从基本定义、技术原理、特点、应用场景几个方面介绍 - **基本定义**它是一种基于深度学习的人工智能算法通过海量文本数据进行预训练学习语言的模式、结构和语义信息。 - **技术原理**以Transformer架构为基础使用自注意力机制捕捉文本中词语间的关联通过大规模无监督学习让模型学习语言规律和知识。 - **特点**具备强大语言理解和生成能力能处理多种自然语言处理任务知识储备丰富可回答不同领域问题可扩展性强通过增加参数和数据提升性能。 - **应用场景**在智能客服领域能快速准确响应用户咨询在内容创作上可生成文章、诗歌等还能辅助代码编写、翻译、绘画提示生成等。 /answer 参数方式启用思考 ChatCompletion(id29f1d349b6cc4aa1a63df628d16e5cd7, choices[Choice(finish_reasonstop, index0, logprobsNone, messageChatCompletionMessage(contentanswer\n### 大模型重新定义人工智能的“通用引擎” \n\n**大模型Large Language Model, LLM** 是近年来人工智能领域的突破性技术核心是通过海量参数通常达百亿至万亿级和大规模数据训练构建具备强泛化能力的通用型智能模型。其技术基础以2017年提出的 **Transformer架构** 为核心通过“自注意力机制Self-Attention”高效处理长序列数据如文本突破了传统模型对固定任务或短序列的依赖。 \n\n**关键特点** \n- **参数与数据“规模制胜”**参数规模从早期的亿级如BERT-base跃升至千亿级如GPT-3、PaLM甚至万亿级如GPT-4需TB级文本、图像等多模态数据训练 \n- **跨任务泛化**无需为每个任务单独设计模型通过“指令微调”即可适配对话、翻译、写作、代码生成等数百种场景 \n- **多模态融合**从单一文本扩展至文本图像如GPT-4V、语音、视频等理解与生成能力更接近人类。 \n\n**应用与影响** \n大模型已渗透至智能助手ChatGPT、文心一言、内容创作AIGC、代码开发GitHub Copilot、科研辅助蛋白质结构预测等领域推动AI从“专用工具”向“通用智能体”演进。同时其也引发对信息准确性、隐私安全、伦理风险如深度伪造的关注成为技术发展与治理平衡的关键议题。 \n\n简言之大模型是当前人工智能的“基础设施”正重塑人机交互方式并为通用人工智能AGI的探索提供核心支撑。\n/answer, refusalNone, roleassistant, annotationsNone, audioNone, function_callNone, tool_callsNone, reasoning_content好的用户让我写一个关于大模型的简短介绍。首先我需要明确大模型的核心是什么。大模型通常指参数规模极大的机器学习模型尤其是自然语言处理领域的比如GPT、BERT这些。用户可能想了解基本概念、特点、应用和影响。\n\n首先定义部分要简洁说明大模型是基于深度学习参数规模大通常千亿级以上。然后技术基础可能需要提到Transformer架构因为这是当前大模型的基础比如自注意力机制处理长序列的能力。\n\n接下来是关键特点参数规模大、数据需求大、计算资源需求高这些是大模型区别于传统模型的地方。然后是能力表现比如多模态处理文本、图像、语音、复杂推理、泛化能力这些能力让它们在各种任务上表现好。\n\n应用场景需要举几个例子比如对话交互、内容生成写文章、代码、智能助手、医疗诊断辅助这样用户更容易理解。然后是影响部分推动AI发展改变人机交互但也带来伦理问题比如信息准确、隐私、就业影响这样介绍更全面。\n\n用户可能的深层需求是快速了解大模型的全貌不需要太技术化的细节所以要保持简短易懂。需要避免专业术语过多用通俗的语言。还要注意结构清晰逻辑连贯从定义到技术基础再到特点、应用和影响这样用户能一步步理解。\n\n可能需要检查是否有遗漏的重要点比如大模型的发展历程但用户要简短可能不需要。重点突出核心要素。另外确保信息准确比如Transformer是2017年提出的大模型参数确实从亿级到千亿级甚至万亿级比如GPT-3是1750亿GPT-4可能更大。\n\n最后总结大模型的意义强调其作为通用人工智能AGI的探索既是技术突破也带来挑战。这样介绍会比较完整满足用户的需求。\n), matched_stop127960)], created1751258354, model/root/autodl-fs/Hunyuan-A13B-Instruct, objectchat.completion, service_tierNone, system_fingerprintNone, usageCompletionUsage(completion_tokens802, prompt_tokens11, total_tokens813, completion_tokens_detailsNone, prompt_tokens_detailsNone)) 模型思考: 好的用户让我写一个关于大模型的简短介绍。首先我需要明确大模型的核心是什么。大模型通常指参数规模极大的机器学习模型尤其是自然语言处理领域的比如GPT、BERT这些。用户可能想了解基本概念、特点、应用和影响。 首先定义部分要简洁说明大模型是基于深度学习参数规模大通常千亿级以上。然后技术基础可能需要提到Transformer架构因为这是当前大模型的基础比如自注意力机制处理长序列的能力。 接下来是关键特点参数规模大、数据需求大、计算资源需求高这些是大模型区别于传统模型的地方。然后是能力表现比如多模态处理文本、图像、语音、复杂推理、泛化能力这些能力让它们在各种任务上表现好。 应用场景需要举几个例子比如对话交互、内容生成写文章、代码、智能助手、医疗诊断辅助这样用户更容易理解。然后是影响部分推动AI发展改变人机交互但也带来伦理问题比如信息准确、隐私、就业影响这样介绍更全面。 用户可能的深层需求是快速了解大模型的全貌不需要太技术化的细节所以要保持简短易懂。需要避免专业术语过多用通俗的语言。还要注意结构清晰逻辑连贯从定义到技术基础再到特点、应用和影响这样用户能一步步理解。 可能需要检查是否有遗漏的重要点比如大模型的发展历程但用户要简短可能不需要。重点突出核心要素。另外确保信息准确比如Transformer是2017年提出的大模型参数确实从亿级到千亿级甚至万亿级比如GPT-3是1750亿GPT-4可能更大。 最后总结大模型的意义强调其作为通用人工智能AGI的探索既是技术突破也带来挑战。这样介绍会比较完整满足用户的需求。 模型回答: answer ### 大模型重新定义人工智能的“通用引擎” **大模型Large Language Model, LLM** 是近年来人工智能领域的突破性技术核心是通过海量参数通常达百亿至万亿级和大规模数据训练构建具备强泛化能力的通用型智能模型。其技术基础以2017年提出的 **Transformer架构** 为核心通过“自注意力机制Self-Attention”高效处理长序列数据如文本突破了传统模型对固定任务或短序列的依赖。 **关键特点** - **参数与数据“规模制胜”**参数规模从早期的亿级如BERT-base跃升至千亿级如GPT-3、PaLM甚至万亿级如GPT-4需TB级文本、图像等多模态数据训练 - **跨任务泛化**无需为每个任务单独设计模型通过“指令微调”即可适配对话、翻译、写作、代码生成等数百种场景 - **多模态融合**从单一文本扩展至文本图像如GPT-4V、语音、视频等理解与生成能力更接近人类。 **应用与影响** 大模型已渗透至智能助手ChatGPT、文心一言、内容创作AIGC、代码开发GitHub Copilot、科研辅助蛋白质结构预测等领域推动AI从专用工具向通用智能体演进。同时其也引发对信息准确性、隐私安全、伦理风险如深度伪造的关注成为技术发展与治理平衡的关键议题。 简言之大模型是当前人工智能的基础设施正重塑人机交互方式并为通用人工智能AGI的探索提供核心支撑。 /answer 提示词方式不启用思考 提示在chatcompletionwiththinkbyargs中通过enable_thinking布尔值切换思考模式separate_reasoning: True的作用是将思考内容reasoning与最终回答拆分到不同字段返回便于分别读取reasoning_content与content。从运行结果可以看出不启用思考时reasoning_content为None且输出不含think标签启用思考时模型先输出完整推理过程再给出结构化的最终回答。流式输出示例新建test_streaming.py文件并在其中输入以下内容from openai import OpenAI # 修改 OpenAI 的 API 密钥和 API 基础地址以使用 SGLang 的 API 服务器。 openai_api_key EMPTY openai_api_base http://127.0.0.1:8080/v1 # 默认端口可能会有所不同 client OpenAI( api_keyopenai_api_key, base_urlopenai_api_base, ) stream client.chat.completions.create( model/root/autodl-tmp/Tencent-Hunyuan/Hunyuan-A13B-Instruct, messages[{role: user, content: 给我一个关于大模型的简短介绍。}], streamTrue, # 可选择是否启用思考默认启用 # extra_body{ # chat_template_kwargs: {enable_thinking: True}, # separate_reasoning: True # } ) # 流式输出不论是否开启思考所有token都会放在content中 for chunk in stream: if chunk.choices[0].delta.content is not None: print(chunk.choices[0].delta.content, end)注意请将model参数修改为你的模型实际下载路径。需要特别留意流式模式的差异流式输出不论是否开启思考所有 token 都会放在content中。因此在流式场景下若需过滤掉思考内容应自行根据think//think标签对输出流做切分这与非流式模式下reasoning_content/content自动分离的行为不同。命令行方式启动服务器除了通过 Python 脚本启动服务器外你还可以直接在命令行中启动 SGLang 服务器。以下是命令行启动服务器的示例python -m sglang.launch_server \ --model-path /root/autodl-tmp/Tencent-Hunyuan/Hunyuan-A13B-Instruct \ --host 0.0.0.0 \ --port 8080 \ --tp-size 2 \ --mem-fraction-static 0.8 \ --trust-remote-code \ --reasoning-parser qwen3参数说明--model-path模型路径--host服务器主机地址0.0.0.0表示允许所有 IP 访问--port服务器端口--tp-size张量并行大小根据你的 GPU 数量调整。本文示例为 2即模型权重切分到 2 张 GPU 上分布式加载——对于 A13B 这类 MoE 模型配合 SGLang 的专家并行能力可进一步摊薄单卡显存压力--mem-fraction-static静态内存分配比例0.8表示将约 80% 的可用显存预留给 KV Cache 等静态分配过小会降低并发吞吐过大会导致 OOM建议结合显存实测调整--trust-remote-code信任远程代码。Hunyuan 系列模型的权重仓库中通常带有自定义 modeling 代码必须加上该参数才能正常加载--reasoning-parser推理解析器这里使用qwen3适用于解析think.../think格式的思考内容与混元 A13B Instruct 的思考输出格式一致。使用 curl 测试 API服务器启动后你可以使用 curl 命令测试 API。以下是一些示例查看模型列表curl http://localhost:8080/v1/models{ object: list, data: [ { id: /root/autodl-fs/Hunyuan-A13B-Instruct, object: model, created: 1751257651, owned_by: sglang, root: /root/autodl-fs/Hunyuan-A13B-Instruct, max_model_len: 32768 } ] }响应中的id即为模型标识max_model_len: 32768表明当前服务支持的最大上下文长度为 32K tokens调用时传入的model字段与之一致即可。测试补全 APIcurl http://localhost:8080/v1/completions \ -H Content-Type: application/json \ -d { model: /root/autodl-tmp/Tencent-Hunyuan/Hunyuan-A13B-Instruct, prompt: 给我一个关于大模型的简短介绍。, max_tokens:3000, temperature: 0 }{ id: 416c69caef134e16aaadc2dafcef2c27, object: text_completion, created: 1751258615, model: /root/autodl-tmp/Tencent-Hunyuan/Hunyuan-A13B-Instruct, choices: [ { index: 0, text: think\n好的用户需要一个关于大模型的简短介绍。首先我需要明确大模型的核心定义可能包括参数规模、训练数据、能力特点。然后要提到关键技术比如Transformer架构因为这是大模型的基础。接下来应用场景也很重要用户可能想知道大模型能做什么比如对话、生成、分析等。还要区分大模型和传统模型的不同比如参数规模、泛化能力。另外可能需要提到发展现状比如从GPT-3到GPT-4LLaMA系列说明技术进步。还要注意语言简洁避免太技术化保持易懂。需要结构清晰先定义再技术基础然后能力应用最后现状。检查有没有遗漏的关键点比如自监督学习、海量数据、上下文学习能力。确保信息准确比如Transformer是2017年提出的大模型参数通常在十亿到万亿级别。可能用户是普通读者所以需要通俗解释避免术语堆砌。最后总结大模型的影响比如推动AI发展改变应用模式。现在组织这些点形成一个连贯的简短介绍。\n/think\nanswer\n### 大模型Large Language Model, LLM简短介绍 \n\n**核心定义**大模型是一类基于深度学习的人工智能系统通过海量文本、代码等数据训练具备超大规模参数通常达十亿至万亿级别和强大泛化能力能理解、生成自然语言并完成复杂任务。 \n\n**技术基础**以Transformer架构2017年提出为核心通过自注意力机制Self-Attention捕捉长距离语义关联突破了传统循环神经网络RNN的局限使模型能并行处理海量信息显著提升学习效率。 \n\n**核心能力** \n- **上下文学习In-Context Learning**仅需少量示例甚至零样本即可理解新任务并生成符合要求的输出如写一首关于春天的诗 \n- **多模态扩展**从纯文本扩展到文本图像如GPT-4、DALL·E、文本语音等覆盖更复杂场景 \n- **逻辑与推理**通过训练数据中的隐含逻辑支持简单数学计算、代码生成、常识问答等。 \n\n**典型应用**智能对话如ChatGPT、内容生成文案/代码/绘画、信息分析总结/翻译/问答、行业垂直场景医疗/教育/金融的智能助手等。 \n\n**发展现状**自2020年GPT-31750亿参数起大模型进入万亿参数时代如GPT-4、LLaMA 2、PaLM 2技术迭代加速同时推动AI从专用向通用探索成为当前人工智能领域的核心方向。 \n\n**意义**大模型通过数据-参数-算力的规模效应重新定义了AI的能力边界正在重塑人机交互、内容生产、科学研究等领域的效率与模式。\n/answer, logprobs: null, finish_reason: stop, matched_stop: 127960 } ], usage: { prompt_tokens: 9, total_tokens: 669, completion_tokens: 660, prompt_tokens_details: null } }测试聊天补全 APIcurl http://localhost:8080/v1/chat/completions \ -H Content-Type: application/json \ -d { model: /root/autodl-tmp/Tencent-Hunyuan/Hunyuan-A13B-Instruct, messages: [ {role: user, content: 给我一个关于大模型的简短介绍。} ], extra_body: { chat_template_kwargs: {enable_thinking: true}, separate_reasoning: true } }{ id: dbc0af7e71c14d40959008c3e92caaa3, object: chat.completion, created: 1751257762, model: /root/autodl-fs/Tencent-Hunyuan/Hunyuan-A13B-Instruct, choices: [ { index: 0, message: { role: assistant, content: answer\n大模型通常指**大语言模型LLM**是近年来人工智能领域的突破性技术核心是通过海量数据训练、参数规模极大的深度学习模型展现出接近人类的复杂语言理解与生成能力。 \n\n### 技术基础 \n其底层多基于**Transformer架构**2017年提出的革命性神经网络模型通过自注意力机制捕捉文本中长距离的语义关联突破了传统循环神经网络的局限。训练模式通常为预训练微调先在万亿级文本如书籍、网页、对话等上通用预训练学习语言规律再针对具体任务如问答、翻译微调快速适配不同场景。 \n\n### 核心特点 \n- **涌现能力**参数超过一定阈值如千亿级后模型会突然具备小模型不具备的推理创作逻辑总结等能力仿佛跨越式进化。 \n- **强泛化性**无需为每个任务单独设计模型预训练的知识可跨领域迁移如用同一模型写代码、写文案、回答问题。 \n- **自然交互**支持多轮对话、上下文理解输出符合人类表达习惯的文本如对话、故事、代码、学术摘要等。 \n\n### 应用与影响 \n大模型已渗透至智能对话如ChatGPT、内容创作文案/代码生成、办公辅助会议纪要总结、多模态交互结合图像/视频理解等场景推动AI从工具向协作伙伴升级。同时其发展也引发对伦理的关注如虚假信息、算法偏见成为全球AI研究的核心方向之一。\n/answer, reasoning_content: 好的用户让我写一个关于大模型的简短介绍。首先我需要明确大模型的核心是什么。大模型通常指的是参数规模极大的机器学习模型尤其是基于深度学习的。现在最火的是Transformer架构比如GPT和BERT这些。\n\n用户可能想要的是简洁但涵盖关键点的介绍。需要包括定义、技术基础、特点、应用场景可能还要提到影响。要注意不要太技术化保持易懂。\n\n首先定义部分大语言模型LLM是深度学习模型参数规模大比如千亿甚至万亿级通过海量数据训练具备强大的语言理解和生成能力。\n\n然后技术基础Transformer架构是关键自注意力机制让模型能捕捉长距离依赖预训练微调的模式预训练在通用数据上微调适应具体任务。\n\n特点涌现能力小模型没有的比如推理、创作、泛化性强跨任务处理、交互自然对话、文本生成。\n\n应用场景智能对话ChatGPT、内容创作写文章、代码、辅助办公总结、翻译、多模态扩展结合图像、视频。\n\n影响推动AI发展改变人机交互促进各行业效率提升同时带来伦理挑战虚假信息、偏见。\n\n需要检查是否简短有没有冗余。可能用户是普通读者不是专业人士所以术语要解释比如Transformer可以简单说革命性架构。还要注意逻辑连贯从定义到技术再到特点和应用最后影响。\n\n可能用户的需求是快速了解大模型是什么所以结构要清晰重点突出。避免太深入的技术细节保持概述。需要确认信息准确比如参数规模现在主流是大语言模型参数从百亿到万亿比如GPT-3是1750亿GPT-4可能更大。预训练数据量也是关键比如万亿token。\n\n总结下来结构大概是定义→技术基础Transformer、预训练→特点涌现、泛化、自然交互→应用→影响。这样应该能满足用户的需求。\n, tool_calls: null }, logprobs: null, finish_reason: stop, matched_stop: 127960 } ], usage: { prompt_tokens: 11, total_tokens: 815, completion_tokens: 804, prompt_tokens_details: null } }通过以上 curl 示例可以看出 SGLang 完整兼容 OpenAI 的v1/models、v1/completions、v1/chat/completions三大端点且请求/响应结构id、choices、usage、finish_reason等字段与 OpenAI 规范一致因此任何基于 OpenAI SDK 的应用均可零改造接入。SGLang 特性思考能力控制Hunyuan-A13B-Instruct 模型通过 SGLang 框架可以启用思考能力类似于 Qwen3 系列模型。当启用思考模式时模型会在生成最终回答前先进行推理过程这有助于提升生成回答的质量——对应混元架构中的慢思考链路关闭思考则走快思考链路响应更快、输出更简洁。思考模式可以通过两种方式启用在 API 请求中设置extra_body参数{chat_template_kwargs: {enable_thinking: true}, separate_reasoning: true}在提示词前添加/think前缀相应地添加/no_think前缀则关闭思考两种方式可对照使用enable_thinking参数适合在代码中以变量方式动态控制便于程序化切换/think、/no_think前缀适合在交互调试或 prompt 模板中直接书写无需改动请求体结构。需要注意的是separate_reasoning: true只在非流式聊天补全场景生效流式输出时思考与回答会合并到content字段中。另外在以上所有的请求处理过程中API 后端都会打印相对应的日志和统计信息包括 Prefill/Decode batch 统计、#running-req、token usage、gen throughput (token/s)吞吐指标以及 HTTP 请求状态码等便于观测服务健康度与吞吐瓶颈常见问题与排查建议模型路径不一致启动时的--model-path、调用时的model字段必须指向实际下载目录如/root/autodl-tmp/Tencent-Hunyuan/Hunyuan-A13B-Instruct路径错误会直接导致 404 或加载失败加载报错找不到 modeling 代码混元权重仓库依赖自定义模型代码务必在启动命令中加入--trust-remote-code显存不足 / OOM调低--mem-fraction-static如 0.5~0.7或按 GPU 数量相应调整--tp-size思考内容与回答混在一起非流式请设置separate_reasoning: true并读取reasoning_content流式场景需自行按think//think标签切分端口占用更换--port与客户端base_url中的端口保持一致即可官方教程全文完整步骤与更多细节可查阅仓库内原文档 03-Hunyuan-A13B-Instruct-SGLang部署调用.md同目录下还提供 vLLM 部署方案、EvalScope 并发测试 与 LoRA 微调实践 供对比参考。至此你已经完成了 Hunyuan-A13B-Instruct 在 SGLang 上的完整部署链路环境搭建 → 模型下载 → 服务器启动脚本/命令行两种方式→ OpenAI 兼容接口调用补全、聊天、流式→ 思考模式控制 → curl 验证。这套流程同样适用于仓库中其他支持 SGLang 的模型如 Qwen3 系列的推理链模型可作为你在 self-llm 项目中的通用推理服务模板。【免费下载链接】self-llm《开源大模型食用指南》针对中国宝宝量身打造的基于Linux环境快速微调全参数/Lora、部署国内外开源大模型LLM/多模态大模型MLLM教程项目地址: https://gitcode.com/datawhalechina/self-llm创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考