
Qwen3.6-35B无审查模型本地部署指南11个GGUF量化版本怎么选、怎么跑【免费下载链接】Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive项目地址: https://ai.gitcode.com/hf_mirrors/HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive如果你是第一次接触 Qwen3.6-35B 无审查模型即Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive克隆仓库后十有八九会愣在文件列表前11 个从 11GB 到 44GB 不等的 GGUF 文件并排躺着旁边还有个 899MB 的 mmproj。 全下硬盘告急。乱挑一个又怕显存爆掉。这篇文章就围绕怎么选、怎么跑、怎么调讲透照着操作跑通验证流程只需几条命令。它凭什么敢叫无审查先回答最基础的问题这个模型到底解除了什么官方测试数据是0/465 次拒绝也就是连续 465 个请求里没有一个被安全策略拦下来。而且它没有改动原模型的任何能力——35B 总参数、262K 原生上下文、多模态理解全部保留只是移除了拒绝生成的机制。Aggressive 后缀值得多说一句它是更强的解锁变体理论上完全不拒绝提示词但偶尔会附带一句简短免责声明。这不是拒绝而是基础模型训练时刻进去的习惯性输出正文内容照样完整给出。一句话理解 MoE 架构这个 35B 参数的模型有 256 个专家每个 token 只激活 8 个单次计算实际只动用约 3B 参数。所以 21GB 的 Q4_K_M 跑起来并不慢这正是大模型也能本地跑的核心原因。11 个版本其实是同一个模型的画质档位这些文件本质是同一模型的不同压缩率压得越狠如 IQ2_M文件越小、显存门槛越低但输出质量打折扣压得越轻如 Q8_K_P越接近原始精度代价是 44GB 的体积。这里要认识 HauhauCS 的招牌技术K_P 量化。普通量化一刀切压缩所有权重K_P 先对每个模型做特化分析把保真预算花在质量最敏感的权重上效果相当于白捡 1~2 个量化档位文件只比基础量化大 5%~15%且完全兼容 llama.cpp、LM Studio 等任何 GGUF 运行时。量化文件体积内存参考适合谁Q8_K_P44GB48GB专业研究、极限质量Q6_K_P31GB32GB高质量应用开发Q5_K_P28GB24GB质量与体积均衡Q4_K_P23GB16GB主流显卡推荐档位Q4_K_M21GB16GB性价比之选IQ4_NL / IQ4_XS20GB / 19GB12~16GB资源有限的机器IQ3_M / Q2_K_P15GB12GB 左右入门级 GPUIQ2_M11GB8~12GB老显卡兜底、CPU 尝鲜给个不走弯路的建议拿不准就选 Q4_K_P质量、体积、速度三者最均衡显存紧张退到 IQ4_XS如果只是先跑通流程用 IQ3_M 也够跑通后再换大档位。把模型跑起来就三步第一步拉取仓库所有量化版本和 mmproj 都在里面git clone https://gitcode.com/hf_mirrors/HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive第二步确认本机装好 llama.cpp或 LM Studio、koboldcpp 等 GGUF 兼容运行时。第三步执行这条命令llama-cli -m Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-Q4_K_P.gguf \ --mmproj mmproj-Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-f16.gguf \ --jinja -c 131072 -ngl 99别稀里糊涂复制先看懂几个关键参数--mmproj挂载视觉投影文件。模型原生支持图像/视频理解主 GGUF 和 mmproj 必须一起加载否则视觉能力会静默失效--jinja让 llama.cpp 正确套用聊天模板缺失时对话格式会错乱-c 131072保持 128K 上下文官方明确提示低于 128K 会削弱思考能力-ngl 99尽可能把层搬进 GPU显存不够时调小即可。跑通后随手验证一下让它写一段小故事你会看到它直接给出完整正文而不是一句抱歉我无法生成此类内容——这正是无审查模型和普通模型最直观的区别。参数调优两套模式两套参数这个模型支持思考与非思考两种模式官方推荐的参数差异不小用错组合输出风格会明显跑偏场景temperaturetop_ptop_kpresence_penalty思考·通用对话1.00.95201.5思考·编程/精确任务0.60.95200非思考·创意写作0.70.8201.5非思考·逻辑推理1.01.0402.0实用技巧写代码、做数学题把 temperature 压到 0.6 左右输出更稳创意写作时把 presence_penalty 提到 1.5模型会少些自我重复长篇内容更耐看。三个新手必踩的坑提前避雷坑 1LM Studio 里量化列显示?。这是 K_P 的显示识别问题不是文件损坏模型照常加载运行不用管。坑 2Hugging Face 页面显示的文件比实际少。官方硬件兼容组件不识别 K_P 命名会隐藏部分文件去 Files and versions 才能看到全部 12 个文件。坑 3视觉功能毫无反应。十有八九是没加载 mmproj 或漏了--jinja回查命令行即可。最后提醒一句模型不设限不代表使用可以不设限。生成内容前请自行把关遵守所在地的法律法规和基本伦理。下一步动手顺序建议先看显卡显存和系统内存 → 对照表格挑一个档位 → 下载对应文件 → 用上面的命令跑通 → 再按场景微调参数。跑顺之后可以试试 262K 超长上下文的文档处理或给--image参数丢一张图体验多模态的完整形态。选择困难不丢人丢人的是硬盘塞满 11 个模型却不知道哪个能跑。现在从 Q4_K_P 开始吧。【免费下载链接】Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive项目地址: https://ai.gitcode.com/hf_mirrors/HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考