- 大模型
- 模型量化
- 本地部署
- 多模态
【免费下载链接】Qwen3.8-27B-GSQ-RCO-GGUF
本文围绕 ISTA-DASLab 发布的Qwen3.8-27B-GSQ-RCO-GGUF模型仓库(README.md)展开,系统讲解 GSQ(Gumbel-Softmax 量化)与 RCO(黎曼约束优化)如何联合产出逐张量、非均匀的 GGUF 量化文件,涵盖文件清单、评测结果、llama.cpp / Ollama / LM Studio 三种部署方式、量化构建流程与可复现产物。读完本文,你将能够按内存预算挑选合适的量化档位,并在本地完成文本与多模态推理。
一、仓库定位:非均匀量化而非"一刀切"
与把全部权重张量统一套用一种量化类型的传统做法不同,本仓库中每一个模型文件都为每个张量单独指派一种量化类型。这个指派由一次基于梯度的搜索得到:搜索依据"逐张量敏感性"分配精度,并受"总文件大小预算"约束。最终产物是标准的 GGUF 文件,可直接在llama.cpp、Ollama 和 LM Studio 中原样运行,无需任何改造。
方法概要:GSQ 负责把每一个张量在给定量化类型下做到低比特高精度标量量化;RCO 负责在大小预算下为每个张量分配合适的量化类型。两者协作即产出目标大小的非均匀 GGUF。
1.1 两种核心方法(GSQ 与 RCO)
| 方法 | 说明 |
|---|---|
| GSQ(Gumbel-Softmax Quantization) | 后训练标量量化方法,通过 Gumbel-Softmax 松弛联合学习"逐坐标网格指派"与"逐组 scale"。在 2~3 bit 区间几乎填平了标量量化与向量量化之间的差距,同时仍可部署在 GGUF 等标准标量格式中。 |
| RCO(Riemannian Constrained Optimization) | 在总大小预算下,为 N 个张量分配 K 种量化类型之一。预算约束在 logit 空间中被改写为光滑的黎曼流形,从而允许直接在任务损失上做梯度优化,同时精确满足预算约束,无需针对约束做超参数调优。 |
两种方法均由奥地利科学技术研究所(ISTA)的Deep Algorithms and Systems Lab(DASLab)开发。对应参考实现分别以IST-DASLab/GSQ与IST-DASLab/RCO名称发布。
二、可用文件与命名约定
文件命名遵循<model>-GSQ-RCO-<type>.gguf约定,后缀表示量化档位类别;下表给出每个文件真实的全文件平均比特宽度(bpw)。mmproj文件携带视觉编码器与投影器(BF16),一份即可服务所有量化版本。
| 文件 | bpw | 大小 | 说明 |
|---|---|---|---|
Qwen3.8-27B-GSQ-RCO-IQ2_XS.gguf | 2.50 | 8.4 GB | 最小;零样本表现高于 BF16 基线 |
Qwen3.8-27B-GSQ-RCO-IQ2_S.gguf | 2.75 | 9.3 GB | 在 AIME25 上持平基座模型 |
Qwen3.8-27B-GSQ-RCO-IQ3_XXS.gguf | 3.00 | 10.1 GB | 全面均衡的工作点 |
Qwen3.8-27B-GSQ-RCO-IQ3_S.gguf | 3.50 | 11.8 GB | 推荐档位;任务无损 |
mmproj-Qwen3.8-27B-BF16.gguf | 16 | 0.9 GB | 视觉编码器 + 投影器,用于多模态 |
以上四个量化文件均直接存在于仓库根目录,可供直接下载使用。每个量化版本还提供可选的-mtp构建(体积约增加 0.35 GB),额外携带模型的Multi-Token Prediction(MTP)头,用于llama.cpp中的投机解码(speculative decoding);MTP 版本的其余权重与普通版本完全一致,因此质量不变。对应的文件为Qwen3.8-27B-GSQ-RCO-IQ2_XS-mtp.gguf、Qwen3.8-27B-GSQ-RCO-IQ2_S-mtp.gguf、Qwen3.8-27B-GSQ-RCO-IQ3_XXS-mtp.gguf、Qwen3.8-27B-GSQ-RCO-IQ3_S-mtp.gguf。
推荐档位 IQ3_S是任务无损工作点:在 AIME25(100.00)与 LiveCodeBench v6(85.71)上与基座模型完全一致,GPQA-Diamond 仅差 0.51 分,而体积仅为 BF16 的五分之一强。
三、评测结果
所有模型均对照BF16 基座模型与同基座的Unsloth Dynamic(UD)量化进行评测。指标包括:
- wikitext2、C4、FineWeb-Edu 上的困惑度(越低越好,表中用 ↓ 标注);
- 五个零样本任务(arc_easy、arc_challenge、hellaswag、winogrande、piqa)的平均值(ZS avg);
- 相对 BF16 的零样本平均恢复率(recovery);
- 三个推理与生成基准:AIME25、GPQA-Diamond、LiveCodeBench v6(越高越好,表中用 ↑ 标注)。
评测所用文件大小即表中 GB 列。
| Variant | bpw | GB | wiki↓ | c4↓ | fw↓ | ZS avg↑ | recovery | AIME25↑ | GPQA-D↑ | LCB v6↑ |
|---|---|---|---|---|---|---|---|---|---|---|
| BF16 | 16.00 | 53.8 | 7.05 | 11.45 | 8.14 | 74.34 | 100.0% | 100.00 | 89.90 | 85.71 |
| GSQ-RCO IQ2_XS | 2.50 | 8.4 | 7.69 | 12.98 | 9.19 | 74.54 | 100.3% | 96.67 | 84.85 | 76.57 |
| GSQ-RCO IQ2_S | 2.75 | 9.3 | 7.39 | 12.40 | 8.80 | 75.70 | 101.8% | 100.00 | 86.36 | 82.29 |
| GSQ-RCO IQ3_XXS | 3.00 | 10.1 | 7.20 | 12.13 | 8.59 | 74.81 | 100.6% | 100.00 | 88.89 | 84.57 |
| GSQ-RCO IQ3_S | 3.50 | 11.8 | 7.07 | 11.76 | 8.34 | 74.47 | 100.2% | 100.00 | 89.39 | 85.71 |
| UD-IQ2_S | 2.49 | 8.4 | 8.02 | 12.78 | 9.08 | 73.80 | 99.3% | 86.67 | 76.26 | 72.00 |
| UD-Q2_K_XL | 2.88 | 9.8 | 7.54 | 12.25 | 8.69 | 74.37 | 100.0% | 100.00 | 86.87 | 82.28 |
| UD-IQ3_S | 3.52 | 12.0 | 7.16 | 11.75 | 8.34 | 75.49 | 101.5% | 96.67 | 89.90 | 84.00 |
3.1 关键观察
- 3.50 bpw 的 IQ3_S 为任务无损档:在 AIME25(100.00)与 LiveCodeBench v6(85.71)上复现基座模型,GPQA-Diamond 落后 0.51 分,任务平均为 91.70,对比基座模型的 91.87(恢复 99.8%),体积仅 11.8 GB,约为 BF16(53.8 GB)的 4.6 倍缩小。
- 对 UD-IQ3_S,本档在 AIME25 领先 3.33 分、LiveCodeBench 领先 1.71 分,同时小 0.2 GB;UD 仅在 GPQA-Diamond 上领先 0.51 分。
- 3.00 bpw 已能打平基座:IQ3_XXS 在 10.1 GB 体积下 AIME25 即为满分。
- 同体积对比:同为 8.4 GB 时,IQ2_XS 相对 UD-IQ2_S 在 AIME25 领先 10.00 分、GPQA-Diamond 领先 8.59 分、LiveCodeBench v6 领先 4.57 分。
下图为 AIME25 随平均比特宽度的变化曲线,可见 GSQ-RCO 在 2.75 bpw 即触达满分并趋于饱和,而对比方案在高位仍存在回落:
GPQA-Diamond 与 LiveCodeBench v6 的完整对比曲线分别见 assets/plots/Qwen3.8-27B-gpqa_diamond_vs_avg_bit_width.png 与 assets/plots/Qwen3.8-27B-lcb_vs_avg_bit_width.png。整体任务平均曲线见文首插图。
四、部署与使用
4.1 llama.cpp(纯文本推理)
# 下载(需要:pip install -U "huggingface_hub[cli]") hf download ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF Qwen3.8-27B-GSQ-RCO-IQ3_XXS.gguf --local-dir . llama-cli -m Qwen3.8-27B-GSQ-RCO-IQ3_XXS.gguf -p "Explain mixed-precision quantization." -ngl 99说明:-ngl 99表示将尽可能多的层卸载到 GPU(根据显存调整);选择哪个.gguf文件,取决于你的内存/显存预算——见第二节文件表。
4.2 视觉多模态推理
hf download ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF mmproj-Qwen3.8-27B-BF16.gguf --local-dir . llama-mtmd-cli -m Qwen3.8-27B-GSQ-RCO-IQ3_XXS.gguf \ --mmproj mmproj-Qwen3.8-27B-BF16.gguf \ --image photo.jpg -p "Describe this image."该投影器直接从基座检查点转换而来,并已针对本仓库的全部量化版本验证过兼容性。
4.3 Ollama
ollama run hf.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF # 按你的内存预算选择对应文件4.4 LM Studio
在 LM Studio 中搜索仓库名,然后从文件列表中选择一个GSQ-RCO-*构建即可加载。
五、量化构建流程与源码级证据
README 给出了三步构建流程:
- 逐张量数据库:用 GSQ 将每个权重张量在每一种候选 GGUF 量化类型下量化,生成"量化张量变体"的可检索数据库;
- RCO 搜索:在预算约束下做黎曼搜索,为每个张量指派一种量化类型,使全文件平均比特宽度命中目标;
- 组装:把选中的逐张量变体拼接为单个标准 GGUF 文件。
5.1 从分配转储看"逐张量指派"的真实分布
仓库的 tensor-allocation/ 目录为每个发布文件保留了 RCO 搜索的完整结果。以 tensor-allocation/Qwen3.8-27B-GSQ-RCO-IQ3_S.rco-allocation.txt 为例(文件头信息即源数据):
- 目标全文件 bpw:3.50,GGUF version 3,共851个张量;
- 量化类型分布(文件第 5-9 行):
BF16=96, F32=353, IQ1_M=1, IQ2_S=17, IQ2_XS=9, IQ2_XXS=5, IQ3_S=144, IQ3_XXS=78, IQ4_XS=96, Q2_K=13, Q4_K=39; - 分配转储还包含固定的非 RCO 张量(如 F32/BF16),从而保证发布的 GGUF 完全可复现。
不同档位的分配策略差异明显,可对照各文件的量化类型计数头部(每个*.rco-allocation.txt的第 9 行):
| 档位(目标 bpw) | 低比特类型(IQ1_M/IQ1_S/IQ2 系列) | 中位类型(IQ3 系列) | 高位类型(IQ4_XS/Q4_K/Q2_K) |
|---|---|---|---|
| IQ2_XS(2.50) | 大量(IQ1_M=31、IQ1_S=36、IQ2_S=60、IQ2_XS=53、IQ2_XXS=70) | IQ3_S=47、IQ3_XXS=37 | IQ4_XS=11、Q4_K=4、Q2_K=53 |
| IQ2_S(2.75) | 较多(IQ1_M=18、IQ1_S=7、IQ2 系列约 167) | IQ3_S=64、IQ3_XXS=82 | IQ4_XS=14、Q4_K=9、Q2_K=41 |
| IQ3_XXS(3.00) | 收缩(IQ1_M=4、IQ1_S=4、IQ2 系列约 134) | 增多(IQ3_S=97、IQ3_XXS=83) | IQ4_XS=33、Q4_K=19、Q2_K=28 |
| IQ3_S(3.50) | 很少(仅 IQ1_M=1、IQ2 系列共 31) | 主体(IQ3_S=144、IQ3_XXS=78) | IQ4_XS=96、Q4_K=39、Q2_K=13 |
从分配文件内容可以推断,RCO 倾向于把少量对精度敏感的张量(如部分 attention 输出与 FFN 张量)保留在 IQ4_XS/Q4_K 等较高精度类型,同时把大量其余张量压到 IQ2~IQ3 区间以达成整体 bpw 预算——这正是"按敏感性分配精度"的实际体现。例如 IQ3_S 档中blk.63.attn_k.weight: IQ4_XS、blk.58.attn_qkv.weight: IQ2_XXS(分配文件第 788、853 行),同一层内不同类型并存即为混合精度最直观的证据。
5.2 MTP 头如何融入分配
-mtp版本有独立的分配转储。对比 tensor-allocation/Qwen3.8-27B-GSQ-RCO-IQ3_S-mtp.rco-allocation.txt:张量总数由 851 增至866,文件头注释明确说明它"包含与基座模型相同的逐张量指派,外加 MTP 头的 15 个张量",且头部新增Q6_K=8(文件第 9-12 行),整体 bpw 为 3.5457。MTP 头张量位于blk.64.*(如blk.64.nextn.eh_proj.weight: Q6_K、blk.64.nextn.enorm.weight: F32),并以 Q6_K 高位类型保存,用于投机解码时的一次多 token 预测。
六、可复现产物
每个发布的 GGUF 都附带审核其构建方式所需的文件:
| 文件 | 内容 |
|---|---|
tensor-allocation/<model>.rco-allocation.txt | 该文件中每个张量被指派的量化类型,附带量化类型直方图与目标比特宽度,即 RCO 搜索结果,无需打开模型即可审查分配 |
imatrix-qwen3.8-27b.gguf | 量化期间使用的重要性矩阵(importance matrix),由 1000 个 4096-token 的块计算而来 |
-mtp构建拥有各自的分配转储,内容为基座模型相同的逐张量指派外加 MTP 头的 15 个张量,详见 5.2 节。
七、引用与许可
若你使用了这些模型或方法,请同时引用两篇论文(引用内容直接取自仓库 README.md 的 Citation 一节):
@article{gsq2026, title = {GSQ: Highly-Accurate Low-Precision Scalar Quantization for LLMs via Gumbel-Softmax Sampling}, author = {Dadgarnia, Alireza and Tabesh, Soroush and Nikdan, Mahdi and Helcig, Michael and Kurtic, Eldar and Kleinegger, Maximilian and Alistarh, Dan}, journal= {arXiv preprint arXiv:2604.18556}, year = {2026} } @article{rco2026, title = {Model Compression with Exact Budget Constraints via Riemannian Manifolds}, author = {Helcig, Michael and Alistarh, Dan}, journal= {arXiv preprint arXiv:2605.00649}, year = {2026} }许可方面:这些量化权重继承基座模型(Qwen3.8-27B)的许可;GSQ-RCO 工具链由 DASLab 依据其仓库许可发布。
八、小结
Qwen3.8-27B-GSQ-RCO-GGUF演示了一条完整的"梯度驱动、按张量分配精度"的量化落地路径:GSQ 在低比特下保住单张量精度,RCO 用黎曼流形精确满足整体大小预算,产物是标准 GGUF,可直接在主流本地推理栈中使用。从 2.50 bpw 的 8.4 GB 最小档到 3.50 bpw 的任务无损档,再到可选 MTP 投机解码头,仓库同时提供了评测表、分配转储与重要性矩阵,为审校每一档量化质量提供了完整的证据链。若要在本地部署 Qwen3.8-27B,建议按内存预算对照第二节文件表选档,并在推理时搭配 mmproj-Qwen3.8-27B-BF16.gguf 启用视觉能力。
- 大模型
- 模型量化
- 本地部署
- 多模态
【免费下载链接】Qwen3.8-27B-GSQ-RCO-GGUF
相关推荐
如何单机跑27B模型:Qwen3.8-27B-GSQ-RCO-GGUF非均匀量化模型完全入门
如何单机跑27B模型:Qwen3.8 27B GSQ RCO GGUF非均匀量化模型完全入门 想在自家电脑单机跑 27B 大模型,却受限于显存和内存?本文带你快
大模型模型量化本地部署多模态原理深潜:GSQ Gumbel-Softmax量化如何帮助Qwen3.8-27B-GSQ-RCO-GGUF在2~3比特逼近向量量化精度
原理深潜:GSQ Gumbel Softmax量化如何帮助Qwen3.8 27B GSQ RCO GGUF在2~3比特逼近向量量化精度 Qwen3.8 27B
大模型模型量化本地部署多模态从53.8GB到11.8GB:Qwen3.8-27B-GSQ-RCO-GGUF终极FAQ——许可证、可复现性与非均匀量化全解答
从53.8GB到11.8GB:Qwen3.8 27B GSQ RCO GGUF终极FAQ——许可证、可复现性与非均匀量化全解答 Qwen3.8 27B GSQ
大模型模型量化本地部署多模态
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考