← 返回首页

本地部署 Qwen3.6 35B MoE 模型实战

Qwen3.6-35B-A3B 是阿里通义团队推出的 MoE(混合专家)架构大语言模型,总参数量 35B,激活参数仅 3B。这意味着它可以在消费级显卡上运行,同时保持接近 35B 密集模型的推理质量。

硬件环境

测试机器配置:RTX 4090 24GB VRAM、64GB 系统内存、AMD Ryzen 9 7950X。使用 llama.cpp 作为推理引擎,GGUF 量化格式。

量化策略

经过对比测试,Q4_K_M 量化在推理速度和输出质量之间取得了最佳平衡:

# 下载 Q4_K_M 量化版本
huggingface-cli download Qwen/Qwen3.6-35B-A3B-GGUF \
  qwen3.6-35b-a3b-q4_k_m.gguf --local-dir ./models

推理性能

在 RTX 4090 上使用 llama.cpp 的 CUDA 后端,Q4_K_M 量化后模型文件约 20GB,完全加载到显存中。上下文窗口 32K tokens 时,推理速度稳定在 45-55 tokens/s,满足实时对话需求。

搭配 Hermes Agent 框架使用时,通过 OpenAI 兼容 API 暴露模型,支持多轮对话和工具调用。

LLM llama.cpp GGUF 模型部署