十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

【LLM】Qwen3-0.6B服务化部署、请求与性能测试

【LLM】Qwen3-0.6B服务化部署、请求与性能测试 Qwen3-0.6B功能文本生成部署方式使用1卡 nvidia A100/asend 910b 部署模型下载pipinstallmodelscopemkdirQwen3-0.6B modelscope download--modelQwen/Qwen3-0.6B--local_dirQwen3-0.6B镜像nvidia镜像vllm/vllm-openai:latestasend镜像quay.io/ascend/vllm-ascend:v0.18.0模型部署vllm serve--modelQwen3-0.6B\--host0.0.0.0\--port8000\--tensor-parallel-size1\--max-model-len32768\--reasoning-parser qwen3\--trust-remote-code\--gpu-memory-utilization0.9参数说明:参数值说明--modelQwen3-0.6B模型权重路径mkdir 生成的文件夹目录--host0.0.0.0服务监听地址--port8000服务监听端口--tensor-parallel-size1张量并行数1卡部署--max-model-len32768最大上下文长度32K token--reasoning-parserqwen3推理内容解析器用于解析 Qwen3 的思维链thinking输出--trust-remote-code—允许执行模型仓库中自带的远程代码--gpu-memory-utilization0.9GPU/NPU 显存利用率上限90%模型请求curl命令请求curlhttp://localhost:8000/v1/chat/completions\-HContent-Type: application/json\-d{ model: Qwen3-0.6B, messages: [ {role: user, content: 你好请你帮我生成一个关于春天的五言绝句} ], max_tokens: 1024, temperature: 1.0, top_p: 0.95, presence_penalty: 1.5, extra_body: { top_k: 20 } }python请求方式fromopenaiimportOpenAI clientOpenAI(api_keyEMPTY,base_urlhttp://localhost:8000/v1,timeout3600)messages[{role:user,content:你好请你帮我生成一个关于春天的五言绝句},]chat_responseclient.chat.completions.create(modelQwen3-0.6B,messagesmessages,max_tokens1024,temperature1.0,top_p0.95,presence_penalty1.5,extra_body{top_k:20,},)print(Chat response:,chat_response)请求参数说明:参数值说明modelQwen3-0.6B模型名称部署路径messages—对话消息列表max_tokens1024最大生成 token 数temperature1.0采样温度越高越随机top_p0.95核采样概率阈值从概率累积达95%的token中采样presence_penalty1.5存在惩罚抑制已出现token的重复top_k20Top-K 采样仅从概率最高的20个token中采样性能测试vllm bench serve --base-url http://localhost:8000\--backendvllm\--modelQwen3-0.6B\--tokenizerQwen3-0.6B\--dataset-name random\--input-len512\--output-len512\--num-prompts10\--num-warmups3\--max-concurrency1\--save-result\--result-dir /path/to/your_save_dir\--result-filename qwen3-0.6b_text_input512_output512_request1_num10.json参数说明:参数值说明--base-urlhttp://localhost:8000被测服务地址--backendvllm后端类型vllm 原生接口--modelQwen3-0.6B模型名称与部署路径一致--tokenizerQwen3-0.6Btokenizer 路径--dataset-namerandom数据集类型随机生成输入--input-len512每条输入 token 长度--output-len512每条输出 token 长度--num-prompts10测试请求总数--num-warmups3预热请求数不计入统计--max-concurrency1最大并发数--save-result—保存测试结果到文件--result-dir/path/to/your_save_dir结果保存目录--result-filenameqwen3-0.6b_text_...json结果文件名
返回列表