十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Qwythos-9B:1M长上下文无审查推理模型的完整本地部署指南

Qwythos-9B:1M长上下文无审查推理模型的完整本地部署指南 Qwythos-9B1M长上下文无审查推理模型的完整本地部署指南【免费下载链接】Qwythos-9B-Claude-Mythos-5-1M项目地址: https://ai.gitcode.com/hf_mirrors/empero-ai/Qwythos-9B-Claude-Mythos-5-1MQwythos-9B是基于Qwen3.5-9B全参数微调的无审查推理模型面向需要在本地处理网络安全、生物医学等敏感领域技术问题的工程师与技术决策者。它预置1,048,576 token长上下文窗口经超5亿token推理轨迹后训练MMLU准确率从0.232提升到0.575。它为什么值得选1M长上下文YaRN预置加载即用开箱即用的1,048,576 token上下文窗口是9B级开放权重模型中最长的之一。YaRN rope-scaling已默认写入config.jsonfactor 4.0将原生262,144扩展4倍至1M加载时自动生效无需运行时flag或后处理。官方冒烟测试验证了约137k token的长上下文推理单卡H100/H200可稳定处理256k–512k完整1M窗口需要多卡或KV缓存卸载。原生函数调用传tools即可无需包装器OpenAI/Qwen3.5风格函数调用无额外包装、无工具专项微调。将tools[...]传入apply_chat_template模型即按Qwen3.5规范输出合法tool_call块必选参数完整遵守。7提示工具测试全部命中数学题选python_executor10万以下质数计为9592Kerberos TGS-REP的hashcat模式-m 13100、PrintNightmare的CVE-2021-34527等硬事实均通过web_search找到并附来源引用。混合注意力架构内存增长亚二次方Gated DeltaNet线性注意力与Gated全注意力按3:1混合。32层文本骨干中每4层插入1层全注意力线性注意力层使256k以上上下文的内存增长保持亚二次方。这是单卡H100/H200能服务256k–512k上下文的原因长上下文成本明显低于同规格纯全注意力模型。无审查推理敏感领域直接作答深度无审查基座对技术性问题正面作答而非拒答或输出模板化免责声明。后训练数据为超5亿token的Claude Mythos/Fable轨迹CoT由内部工具rethink生成输出先think块再最终答案。25条提示的定性评审显示它能直接给出SQL注入缓解、TLS握手结构、CRISPR-Cas9机制、有机磷中毒解毒等完整技术内容。 性能验证7项基准对比数据两模型同harness、同采样参数、--limit 100评测任务指标基座Qwen3.5-9BQwythos-9BΔgsm8kexact_matchstrict0.5100.8100.300gsm8kexact_matchflexible0.6700.8600.190mmluacc0.2320.5750.343arc_challengeacc0.4700.4900.020gpqa_diamondCoT 0-shotexact_matchflexible0.6300.580−0.050MMLU 34.3是最大增益57个科目均值0.575政府/政治最高0.78大学生物学0.77。gsm8k strict 30是最干净的信号同harness、同采样、同抽取逻辑。gpqa flexible抽取回落5点是唯一退步两模型strict数值0.05/0.01均因正则抽取失败而退化flex分数才有参考意义。每任务与每科目明细见evals/lm_eval_results.md。 部署与使用vLLM与SGLang一键启动vLLMvllm serve empero-ai/Qwythos-9B-Claude-Mythos-5-1M --max-model-len 1010000SGLangSGLANG_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN1 python -m sglang.launch_server \ --model-path empero-ai/Qwythos-9B-Claude-Mythos-5-1M --context-length 1010000采样参数官方推荐默认值参数取值作用do_sampleTrue必须开启贪心解码会陷入重复循环temperature0.6Qwen3.5思考模式推荐值T≤0.3易重复循环top_p / top_k0.95 / 20Qwen3.5默认组合repetition_penalty1.05防止长生成中出现非终止推理循环max_new_tokens16384为think推理块与最终答案预留token预算用transformers本地加载时基座是多模态架构需用AutoModelForImageTextToText并安装flash-linear-attention与CUDA匹配的causal_conv1d否则线性注意力层回退到慢速且吃内存的PyTorch实现。实际场景怎么用场景1整个代码库跨文件重构。你要解决数十万行代码库的架构审查与跨文件重构。用到1M长上下文窗口把整个仓库一次性放入提示、无需RAG分块。得到单次前向完成的重构建议与架构评审不用搭检索管线。场景2安全运营精确标识符核验。你要确认CVE编号、hashcat模式这类精确标识符。用到原生函数调用给模型传入python_executor与web_search两个工具。得到PrintNightmare→CVE-2021-34527并正确区分CVE-2021-1675/34481变体、TGS-REP→-m 13100均带多来源引用完整过程见evals/tool_test_outputs.md。场景3多文档研究合成。你要把10–20篇论文加笔记和工作草案合成结论。用到1M窗口全部材料进一个提示由think块做长程科学推理。得到一份带推理链的连贯分析报告。实用建议参数调优与常见坑参数调优temperature0.6、top_p0.95、top_k20。受控复测中闭卷评审标记的6处错误在该配置下零复发含physostigmine错误结论与张冠李戴的CVE。repetition_penalty保持1.05。相对默认1.0的微小偏移防长生成非终止循环。常见坑贪心解码或T≤0.3易陷入重复循环是推理模型在此类提示上的已知失败模式。静态YaRNfactor 4.0在短上下文有微小质量损失只用原生262k窗口时可用仓内config.json.pre_yarn备份把rope_type恢复为default。单卡H100/H200适合256k–512k完整1M需张量并行多卡或激进的KV缓存卸载。安全注意模型无审查对技术难题不拒答面向最终用户的部署需自加应用层审查。闭卷推理可能过度自信地给出CVE、hashcat模式、生化位点等精确标识符精确值重要的场景用工具路径或检索系统核验。Qwythos-9B是一个9B体量、单GPU可服务、覆盖1M上下文的无审查推理模型适合本地部署长上下文敏感领域推理的组合需求。它的基座本身是多模态架构但本次只训练了文本路径视觉能力继承自基座且未经测试。后续方向是多模态扩展与威胁情报、药物发现等更细粒度的领域专业化训练。【免费下载链接】Qwythos-9B-Claude-Mythos-5-1M项目地址: https://ai.gitcode.com/hf_mirrors/empero-ai/Qwythos-9B-Claude-Mythos-5-1M创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表