
Qwen3-32B功能文本生成部署方式使用8卡 nvidia A100/asend 910b 部署模型下载pipinstallmodelscopemkdirQwen3-32B modelscope download--modelQwen/Qwen3-32B--local_dirQwen3-32B镜像nvidia镜像vllm/vllm-openai:latestasend镜像quay.io/ascend/vllm-ascend:v0.18.0模型部署vllm serve--modelQwen3-32B\--host0.0.0.0\--port8000\--tensor-parallel-size8\--max-model-len32768\--reasoning-parser qwen3\--trust-remote-code\--gpu-memory-utilization0.9参数说明:参数值说明--modelQwen3-32B模型权重路径mkdir 生成的文件夹目录--host0.0.0.0服务监听地址--port8000服务监听端口--tensor-parallel-size8张量并行数8卡并行--max-model-len32768最大上下文长度32K token--reasoning-parserqwen3推理内容解析器用于解析 Qwen3 的思维链thinking输出--trust-remote-code—允许执行模型仓库中自带的远程代码--gpu-memory-utilization0.9GPU/NPU 显存利用率上限90%模型请求curl命令请求curlhttp://localhost:8000/v1/chat/completions\-HContent-Type: application/json\-d{ model: Qwen3-32B, messages: [ {role: user, content: Please generating one chinese poetry!} ], max_tokens: 1024, temperature: 1.0, top_p: 0.95, presence_penalty: 1.5, extra_body: { top_k: 20 } }python请求方式fromopenaiimportOpenAI clientOpenAI(api_keyEMPTY,base_urlhttp://localhost:8000/v1,timeout3600)messages[{role:user,content:Please generating one chinese poetry!},]chat_responseclient.chat.completions.create(modelQwen3-32B,messagesmessages,max_tokens1024,temperature1.0,top_p0.95,presence_penalty1.5,extra_body{top_k:20,},)print(Chat response:,chat_response)请求参数说明:参数值说明modelQwen3-32B模型名称mkdir 生成的文件夹目录messages—对话消息列表max_tokens1024最大生成 token 数temperature1.0采样温度越高越随机top_p0.95核采样概率阈值从概率累积达95%的token中采样presence_penalty1.5存在惩罚抑制已出现token的重复top_k20Top-K 采样仅从概率最高的20个token中采样性能测试vllm bench serve --base-url http://localhost:8000\--backendvllm\--modelQwen3-32B\--tokenizerQwen3-32B\--dataset-name random\--input-len1024\--output-len1024\--max-concurrency1\--num-prompts10\--save-result\--result-dir /path/to/your_save_dir\--result-filename qwen3-32b_input1024_output1024_request1_num10.json参数说明:参数值说明--base-urlhttp://localhost:8000被测服务地址--backendvllm后端类型vllm 原生接口--modelQwen3-32B模型名称mkdir 生成的文件夹目录--tokenizerQwen3-32Btokenizer 路径mkdir 生成的文件夹目录--dataset-namerandom数据集类型随机生成输入--input-len1024每条输入 token 长度--output-len1024每条输出 token 长度--max-concurrency1最大并发数--num-prompts10测试请求总数--save-result—保存测试结果到文件--result-dir/path/to/your_save_dir结果保存目录--result-filenameqwen3-32b_input1024_output1024_request1_num10.json结果文件名