本地AI编码流水线——RTX 5090+云GPU+Qwen3.6+TurboQuant
构建在硬件上运行的完全本地AI驱动的编码环境的完整指南,以及用于重型模型和企业RAG的可选云GPU服务器。
这是什么
跨两台机器的生产就绪AI编码设置:
本地(RTX 5090,32GB)-- 更新于2026年4月
- Qwen3.6-35B-A3B (主要)-教育部(3B名活跃人员,8名路由专家+1名共享专家,共256名)。混合 门控DeltaNet+门控注意力 架构(30个线性+10个全关注层)。原生262K上下文,可扩展到1M。 ~177吨/秒 TurboQuant涡轮增压器3。原生工具调用+开发者角色支持(Codex/OpenCode)。
- Qwen3.5-35B-A3B (遗留)——MoE(3B有源),188吨/秒发电。
- 杰玛4 31B --致密(31B活性),61吨/秒发电。单次射击任务的最佳质量/推理。
云(RTX PRO 6000,96GB)
- Qwen3.5-122B-A10B --MoE(10B活性),无布UD-Q4_K_XL(72GB)+ TurboQuant涡轮增压器3 KV压缩。比35B变体更好的基准测试、工具使用和推理。Unloth的最新GGUF包括用于工具调用/编码的固定聊天模板。
- 万物皆可LLM --具有工作空间、RBAC和代理技能的RAG知识库
- Mistral OCR MCP -通过Mistral API提取PDF文本,作为AnythingLLM代理的MCP工具
- 摘录API --PDF→ OCR → LLM提取→ 干净的结构化JSON管道
工具:
- 开源代码 --使用文件编辑、bash、grep和MCP工具进行代理编码
- 克劳德代码 -Anthropic的CLI(通过Ollama API与本地模型配合使用)
- 开爪 --Telegram机器人桥到您的本地模型
- 打开WebUI --浏览器中的聊天界面
- 万物皆可LLM --企业RAG平台(云服务器)
______________________________________________________________________
快速开始
# One-command setup (WSL Kali, WSL Ubuntu, or native Linux)
bash scripts/setup.sh这将安装CUDA,构建llama.cpp(主线+TurboQuant),安装OpenCode,并生成配置文件。看 scripts/setup.sh 了解详情。
手动快速启动:
# Start the server (pick your model)
./scripts/start-server.sh qwen YOUR_MODEL_PATH/Qwen3.5-35B-A3B-UD-Q4_K_XL.gguf
./scripts/start-server.sh gemma YOUR_MODEL_PATH/gemma-4-31b-it-UD-Q4_K_XL.gguf
./scripts/start-server.sh turbo YOUR_MODEL_PATH/Qwen3.5-35B-A3B-UD-Q4_K_XL.gguf
# Start coding
cd your-project && opencode______________________________________________________________________
硬件和型号
| 组件 | 详细信息 |
|---|---|
| GPU | NVIDIA RTX 5090(32GB GDDR7,Blackwell) |
| 操作系统 | Windows 11+WSL2 Kali Linux |
| 运行时 | llama.cpp(使用CUDA在WSL上本机编译) |
模型比较
| Qwen3.5-35B-A3B | 杰玛4 31B | |
|---|---|---|
| 建筑 | 教育部(256名专家,8名活跃) | 密集(所有参数均活跃) |
| 活动参数 | ~3B 每个令牌 | 31B 每个令牌 |
| 量化 | 不穿衣服的UD-Q4_K_XL(20.7 GB) | 不穿衣服UD-Q4\_ K_XL(~18.4 GB) |
| 生成 | 188吨/秒 | 61吨/秒 |
| 快速处理 | 4291吨/秒 | 1954吨/秒 |
| KV缓存(131K) | 2.5 GB | 11.4 GB |
| 总VRAM(131K) | ~24 GB | ~29.8 GB |
| 培训背景 | 262K | 131K |
| 涡轮量子 | 是(涡轮3) | 未测试 |
| 最佳 | 快速代理编码、迭代 | 质量关键任务、推理 |
| 第一枪质量 | 很好(可能需要修复) | 很好(小行星:零错误) |
______________________________________________________________________
性能基准
速度比较(RTX 5090)
┌─────────────────────────────────────────────────────┐
│ Prompt Processing (tokens/s) │
│ │
│ Qwen3.5 TurboQuant ██████████████ 5,623 │
│ Qwen3.5 Mainline ███████████ 4,291 │
│ Gemma 4 Mainline ████████ 1,954 │
│ │
│ Token Generation (tokens/s) │
│ │
│ Qwen3.5 Mainline ██████████████████████ 188 │
│ Qwen3.5 TurboQuant ██████████████ 131 │
│ Gemma 4 Mainline ███████ 61 │
└─────────────────────────────────────────────────────┘VRAM使用情况(131K上下文)
┌──────────────────────────────────────────────────────────┐
│ VRAM Breakdown (GB) │
│ │
│ Qwen3.5 (f16 KV): │
│ ├─ Model ████████████████████░░░░░░ 20.7 GB │
│ ├─ KV Cache ██░░░░░░░░░░░░░░░░░░░░░░░ 2.5 GB │
│ ├─ Compute █░░░░░░░░░░░░░░░░░░░░░░░░░ 0.8 GB │
│ └─ Free ██████░░░░░░░░░░░░░░░░░░░░ 6.0 GB │
│ │
│ Qwen3.5 (turbo3 KV): │
│ ├─ Model ████████████████████░░░░░░ 20.7 GB │
│ ├─ KV Cache █░░░░░░░░░░░░░░░░░░░░░░░░░ 0.7 GB │
│ ├─ Compute █░░░░░░░░░░░░░░░░░░░░░░░░░ 0.8 GB │
│ └─ Free ████████░░░░░░░░░░░░░░░░░░ 8.4 GB │
│ │
│ Gemma 4 (f16 KV): │
│ ├─ Model ██████████████████░░░░░░░░ 18.4 GB │
│ ├─ KV Cache ██████████░░░░░░░░░░░░░░░░ 11.4 GB │
│ ├─ Compute █░░░░░░░░░░░░░░░░░░░░░░░░░ 0.8 GB │
│ └─ Free ██░░░░░░░░░░░░░░░░░░░░░░░░ 2.8 GB │
│ │
│ KV Cache Comparison: │
│ Qwen3.5 f16: 2.5 GB (MoE — only 1/4 layers) │
│ Qwen3.5 turbo3: 0.7 GB (3.5x compression) │
│ Gemma 4 f16: 11.4 GB (dense — all layers) │
└──────────────────────────────────────────────────────────┘TurboQuant与标准KV缓存质量
基于 TurboQuant CUDA叉子 Qwen3.5-27B的基准测试:
┌────────────────────────────────────────────────────┐
│ Perplexity (Lower = Better) │
│ │
│ q8_0 baseline ████████████████████ 5.8375 │
│ turbo3 uniform █████████████████████ 5.8323 ~ │
│ turbo3 LA-1 ████████████████████ 5.7690 ++ │
│ │
│ ~ = matches baseline │
│ ++ = BEATS baseline (-1.17%) │
│ │
│ FWHT rotation: essential (+6.8% PPL without) │
│ Norm correction: critical (+12% PPL without) │
└────────────────────────────────────────────────────┘______________________________________________________________________
建筑
┌─────────────────────────────────────────────────────────────────┐
│ WINDOWS 11 │
│ ┌─────────────────┐ ┌──────────────┐ ┌────────────────────┐ │
│ │ Desktop │ │ Open WebUI │ │ Brave Browser │ │
│ │ Shortcuts │ │ :5762 │ │ (Dashboard/Chat) │ │
│ │ Start/Stop/ │ │ Docker │ │ │ │
│ │ Update │ └──────┬───────┘ └────────────────────┘ │
│ └────────┬────────┘ │ │
│ │ host.docker.internal:10500 │
│ ▼ │ │
│ ┌───────────────────────────┴──────────────────────────────┐ │
│ │ WSL2 KALI LINUX │ │
│ │ │ │
│ │ ┌─────────────────────────────────────────────────────┐ │ │
│ │ │ llama-server (port 10500, 0.0.0.0) │ │ │
│ │ │ ├─ Model A: Qwen3.5-35B-A3B (MoE, 188 t/s) │ │ │
│ │ │ ├─ Model B: Gemma 4 31B (Dense, 61 t/s) │ │ │
│ │ │ ├─ Mode 1: f16 KV cache (mainline build) │ │ │
│ │ │ └─ Mode 2: turbo3 KV cache (TurboQuant, Qwen only)│ │ │
│ │ └──────────────────────┬──────────────────────────────┘ │ │
│ │ │ localhost:10500 │ │
│ │ ┌──────────┐ ┌───────┴────┐ ┌───────────┐ │ │
│ │ │ OpenCode │ │ Claude Code│ │ OpenClaw │ │ │
│ │ │ +Context7│ │ (claude- │ │ (Telegram │ │ │
│ │ │ +Chrome │ │ qwen) │ │ bot) │ │ │
│ │ │ DevTools│ │ │ │ │ │ │
│ │ └──────────┘ └────────────┘ └───────────┘ │ │
│ │ │ │
│ │ GPU: RTX 5090 (32GB) via CUDA passthrough │ │
│ └───────────────────────────────────────────────────────────┘ │
└─────────────────────────────────────────────────────────────────┘选型流程
What's your priority?
│
├─ Best local coding (recommended) ──────> Qwen3.6-35B-A3B + TheTom TurboQuant turbo3
│ (177 t/s, 262K ctx, native tool calls)
│
├─ Legacy fast agentic coding ────────────> Qwen3.5-35B-A3B (188 t/s)
│ └─ Save VRAM? ────────────────────────> Qwen3.5 + TurboQuant (131 t/s, 3.5x KV savings)
│
└─ Quality / Reasoning ───────────────────> Gemma 4 31B (61 t/s)
└─ 24GB GPU? ─────────────────────────> Gemma 4 at 32-64K contextQwen3.6设置(本地RTX 5090)
- 下载
unsloth/Qwen3.6-35B-A3B-GGUF→Qwen3.6-35B-A3B-UD-Q4_K_XL.gguf(21GB) - 构建TheTom的TurboQuant分叉(Gated DeltaNet arch所需):
git clone --depth 1 -b feature/turboquant-kv-cache \
https://github.com/TheTom/llama-cpp-turboquant.git ~/llama-cpp-turboquant
cd ~/llama-cpp-turboquant
cmake -B build -DGGML_CUDA=ON -DGGML_NATIVE=ON -DGGML_CUDA_FA=ON \
-DGGML_CUDA_FA_ALL_QUANTS=ON -DCMAKE_CUDA_ARCHITECTURES=120
cmake --build build -j$(nproc)- 发射(单槽,全262K上下文,涡轮3KV):
TURBO_LAYER_ADAPTIVE=2 ~/llama-cpp-turboquant/build/bin/llama-server \
-m /path/to/Qwen3.6-35B-A3B-UD-Q4_K_XL.gguf \
-ngl 99 -fa on -c 262144 -np 1 -ctk turbo3 -ctv turbo3 \
--temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.0 \
--host 0.0.0.0 --port 10500- VRAM使用量:32GB的~25GB(包括262K turbo3-KV——由于混合拱,只有10层有完整的KV)
______________________________________________________________________
GPU兼容性
| GPU | VRAM | Qwen3.5最大上下文 | Gemma 4最大上下文 | 备注 |
|---|---|---|---|---|
| RTX 5090 | 32 GB | 131K(f16)/262K(涡轮增压3) | 131K | 全性能 |
| RTX 4090 | 24 GB | ~96K(f16)/~192K(涡轮增压3) | ~32-64K | 减少Gemma 4的上下文 |
| RTX 3090 | 24 GB | ~96K(f16)/~192K(涡轮增压3) | ~32-64K | 比4090稍慢 |
| RTX 4080 Super | 16 GB | ~32K(f16) | 不推荐 | 使用较小的量化 |
| M4最大值 | 64 GB | 262K | 131K+ | 使用MLX获得最佳速度 |
对于16GB GPU,考虑使用较小的量子(Q3_K_M)或Qwen3.5-27B变体。
______________________________________________________________________
安装指南
先决条件
- Windows 11与WSL2(或本机Linux)
- 支持CUDA的NVIDIA GPU(在RTX 5090上测试)
- WSL2与Kali Linux或Ubuntu
自动设置(推荐)
git clone https://github.com/jamesarslan/local-ai-coding-setup.git
cd local-ai-coding-setup
bash scripts/setup.sh安装脚本处理一切:CUDA工具包、llama.cpp构建、Node.js、OpenCode和配置生成。
手动设置
1.安装CUDA工具包(WSL)
sudo apt install -y cmake g++ git
# Ubuntu WSL:
wget -qO - https://developer.download.nvidia.com/compute/cuda/repos/wsl-ubuntu/x86_64/3bf863cc.pub \
| sudo gpg --dearmor -o /usr/share/keyrings/cuda-archive-keyring.gpg
echo "deb [signed-by=/usr/share/keyrings/cuda-archive-keyring.gpg] https://developer.download.nvidia.com/compute/cuda/repos/wsl-ubuntu/x86_64/ /" \
| sudo tee /etc/apt/sources.list.d/cuda-wsl.list
# Kali WSL (GPG workaround — Kali lacks NVIDIA's GPG key):
echo "deb [trusted=yes] https://developer.download.nvidia.com/compute/cuda/repos/wsl-ubuntu/x86_64/ /" \
| sudo tee /etc/apt/sources.list.d/cuda-wsl.list
sudo apt update && sudo apt install -y cuda-toolkit2.构建llama.cpp
# Auto-detect your GPU architecture
CUDA_ARCH=$(nvidia-smi --query-gpu=compute_cap --format=csv,noheader | head -1 | tr -d '.')
echo "GPU architecture: sm_${CUDA_ARCH}"
# Build mainline
git clone --depth 1 https://github.com/ggml-org/llama.cpp.git ~/llama-cpp-mainline
cd ~/llama-cpp-mainline
cmake -B build -DGGML_CUDA=ON -DGGML_NATIVE=ON -DGGML_CUDA_FA=ON \
-DCMAKE_CUDA_ARCHITECTURES="$CUDA_ARCH"
cmake --build build -j$(nproc)
# Build TurboQuant fork (optional, for Qwen3.5 turbo3 mode)
# Madreag's fork: +13-69% faster at 32K vs base, SM86/89/120 optimized
git clone --depth 1 \
https://github.com/Madreag/turbo3-cuda.git ~/llama-cpp-turboquant
cd ~/llama-cpp-turboquant
cmake -B build -DGGML_CUDA=ON -DGGML_NATIVE=ON -DGGML_CUDA_FA=ON \
-DGGML_CUDA_FA_ALL_QUANTS=ON -DCMAKE_CUDA_ARCHITECTURES="$CUDA_ARCH"
cmake --build build -j$(nproc)3.下载模型
4.启动服务器
# Qwen3.5 (fast, agentic coding)
./scripts/start-server.sh qwen YOUR_MODEL_PATH/Qwen3.5-35B-A3B-UD-Q4_K_XL.gguf
# Gemma 4 (quality, reasoning)
./scripts/start-server.sh gemma YOUR_MODEL_PATH/gemma-4-31b-it-UD-Q4_K_XL.gguf
# Qwen3.5 + TurboQuant (3.5x KV compression)
./scripts/start-server.sh turbo YOUR_MODEL_PATH/Qwen3.5-35B-A3B-UD-Q4_K_XL.gguf5.配置OpenCode
复制 configs/opencode.json 到 ~/.config/opencode/opencode.json.更换 YOUR_PORT 随着 10500 (默认)。
这两种型号都是预先配置的——通过更改 "model" 字段:
"llama.cpp/qwen3.5-coding"对于速度"llama.cpp/gemma-4-31B"为了质量
6.开始编码
cd your-project && opencodeLinux安装程序(无WSL)
与上述步骤2-6相同。跳过WSL特定的CUDA仓库设置——使用您发行版的仓库。
仅Windows安装程序(无WSL)
- 下载预构建的llama.cpp --得到
llama-b{version}-bin-win-cuda-{ver}-x64.zip - 下载匹配
cudart-llama-bin-win-cuda-{ver}-x64.zip - 提取两者,复制旁边的DLL
llama-server.exe - 运行:
llama-server.exe -m model.gguf -ngl 99 -fa on -c 131072 --host 0.0.0.0 --port 10500 - 注意:TurboQuant分叉需要从源代码构建(需要Visual Studio+CUDA工具包)
Mac(苹果硅)
______________________________________________________________________
最优模型参数
Qwen3.5(编码)
从 Qwen3.5官方文档:
| 模式 | 温度 | top_p | top_k | min_p | 存在_惩罚 |
|---|---|---|---|---|---|
| 编码(思考) | 0.6 | 0.95 | 20 | 0.0 | 0.0 |
| 一般(思考) | 1.0 | 0.95 | 20 | 0.0 | 1.5 |
| 指导(无思考) | 0.7 | 0.8 | 20 | 0.0 | 1.5 |
杰玛4 31B
| 参数 | 值 | 注释 |
|---|---|---|
| 温度 | 1.0 | 训练温度=1.0(与Qwen3.5的0.6不同) |
| top_k | 64 | 高于Qwen3.5的20 |
| top_p | 0.95 | 标准 |
| min_p | 0.0 | 标准 |
关键发现: Ollama的Qwen3.5默认参数为temperature=1.0和presence_penalty=1.5--两者都不适合编码任务。仅这一点就导致了输出质量明显下降。Gemma 4在temp=1.0时运行良好,因为它是这样训练的。
______________________________________________________________________
什么是TurboQuant?
涡轮量子 (Google Research,ICLR 2026)是一种KV缓存压缩算法,实现了 3.5倍压缩,零精度损失。目前可用于 仅限Qwen3.5 (未用Gemma 4进行测试)。
它是如何工作的:
- PolarQuant --使用FWHT随机旋转数据向量,然后在极坐标系中量化。这消除了传统量化所需的每块归一化开销。
- QJL(量化Johnson Lindenstrauss) --每个残差使用1位来纠正步骤1中的错误。充当零内存开销的数学错误检查器。
- 结果:3.25位KV缓存(
turbo3)事实上 beats 8位 质量,因为旋转+校正方法比原始的逐块缩放更好地保留了向量关系。
为什么这对局部推理很重要:
Qwen3.5 without TurboQuant (f16 KV):
32GB VRAM = 20.7GB model + 2.5GB KV cache + overhead
-> 131K context max, 6.0GB free
Qwen3.5 with TurboQuant (turbo3 KV):
32GB VRAM = 20.7GB model + 0.7GB KV cache + overhead
-> 131K context with 8.4GB free
-> Or 262K context (full training length) possible
Gemma 4 without TurboQuant (f16 KV):
32GB VRAM = 18.4GB model + 11.4GB KV cache + overhead
-> 131K context, only 2.8GB free (tight!)
-> turbo3 would save ~8GB if compatible (untested)CUDA实施
我们使用 社区CUDA港口 这增加了:
- 用于turbo3 K/V操作的自定义Flash Attention内核
- 张量核心预填充路径(MMA加速)
- 层自适应模式在q8_0处保留关键层
- 已在RTX 3090和RTX 5090上测试
______________________________________________________________________
工具生态系统
OpenCode(初级-代理编码)
本地模型的最佳工具。精益工具集(读、写、编辑、bash、grep、glob)不会像Claude Code的几十个MCP工具那样使上下文膨胀。
MCP服务器:
- 背景7 --文件搜索。添加
use context7以提示查找API文档。 - Chrome工具 --浏览器验证。自动启动Chromium,检查页面,运行控制台JS,截图。
OpenCode中的模型选择: Qwen3.5和Gemma 4都已配置。改变 "model" 在opencode.json中:
"llama.cpp/qwen3.5-coding"速度(代理工作流)"llama.cpp/gemma-4-31B"质量(单镜头生成)
克劳德代码(人类API+本地模型回退)
通过以下方式与本地模型合作 claude-qwen bash函数,但发送所有连接的MCP工具模式(Notion、Slack、Atlassian等),这对本地模型造成了沉重的负担。最好与Anthropic的云API一起使用。
OpenClaw(电报机器人)
通过本地Ollama API将Telegram连接到您的本地模型。配置为 api: "openai-completions" 对于llama服务器。
打开WebUI(聊天界面)
端口5762上的Docker容器,通过以下方式连接到llama服务器 host.docker.internal:10500 (WSL)或 172.17.0.1:10500 (原生Linux)。
______________________________________________________________________
主要发现和经验教训
1.型号选择很重要:MoE与Dense
Qwen3.5(MoE,3B活性)比Gemma 4(致密,31B活性)快3倍,但Gemma 4产生了更高质量的首次射击输出。小行星测试清楚地表明了这一点:Gemma 4在第一次尝试时就产生了一个没有错误的游戏,而Qwen3.5需要一些小修复。对于多次迭代的代理编码,Qwen3.5的速度优势获胜。对于质量关键的单镜头生成,Gemma 4更好。
2.工具数量比你想象的更重要
*“从11种工具换成了5种。同样的型号,同样的硬件。响应时间从约5分钟缩短到约1分钟。”* --Reddit用户
Claude Code发送了数十个MCP工具模式。OpenCode发送~10。对于本地模型,请使用OpenCode。这同样适用于Qwen3.5和Gemma 4。
3.Qwen3.5编码的Ollama默认参数错误
Ollama搭载Qwen3.5 temperature=1.0 和 presence_penalty=1.5.编码的官方建议是 temp=0.6, presence_penalty=0.0Gemma 4在temp=1.0时正常工作——每个模型需要不同的参数。
4.不穿衣服的UD GGUF不适合Ollama
Windows上的Olama 0.18.2无法加载Uncloth的HuggingFace GGUF。llama服务器加载良好。如果使用Ollama,请坚持使用注册表模型。
5.KV缓存量化灵敏度因型号而异
标准q8_0KV缓存量化在20-40K+上下文中会降低Qwen3.5的质量。TurboQuant的方法(FWHT旋转+范数校正)没有这个问题——它实际上提高了质量。
6.密集型占用VRAM用于KV缓存
Gemma 4的11.4GB KV缓存为131K(而Qwen3.5的2.5GB)是32GB GPU的主要限制。它的SWA层还破坏了提示缓存,这会损害代理工作负载,因为系统提示在许多请求中重复出现。
7.对于llama.cpp,WSL2比Windows更好
- 原生Linux构建编译速度更快
- 直接GPU直通无缝工作
- 没有Windows PATH问题破坏bash脚本
- 与仅支持Linux版本的研究分支兼容
8.Chrome DevTools MCP需要正确的标志
--executablePath /usr/bin/chromium --chromeArg --no-sandbox 用于自动启动。这 --cdp-url 和 --browserUrl 标志用于连接到现有实例。
______________________________________________________________________
桌面快捷方式(Windows)
| 快捷方式 | 它的作用 |
|---|---|
| 启动Qwen AI服务器 | 使用Qwen3.5、f16KV缓存的WSL骆驼服务器 |
| 启动Qwen AI TurboQuant | WSL骆驼服务器,配备Qwen3.5、turbo3KV缓存 |
| 停止Qwen AI服务器 | 杀死WSL中的骆驼服务器 |
| 更新Qwen AI服务器 | 下载最新的llama.cpp Windows预构建 |
______________________________________________________________________
仓库内容
local-ai-coding-setup/
├── README.md # This file
├── scripts/
│ ├── setup.sh # One-command setup (CUDA, llama.cpp, OpenCode)
│ └── start-server.sh # Start llama-server (qwen|gemma|turbo modes)
├── configs/
│ ├── opencode.json # OpenCode config (Qwen3.5 + Gemma 4)
│ ├── openclaw.json # OpenClaw/Telegram bot config
│ ├── claude-code-bashrc.sh # Claude Code bash function
│ ├── open-webui-docker.sh # Open WebUI Docker run command
│ └── ollama-modelfile # Ollama Modelfile with correct params
└── research/
├── gemma4-findings.md # Gemma 4 31B benchmarks & analysis
├── turboquant-findings.md # TurboQuant benchmarks & analysis
├── qwen35-parameter-tuning.md # Optimal parameters for both models
├── tool-ecosystem-comparison.md # OpenCode vs Claude Code vs OpenClaw
└── test-prompts.md # Ready-to-use test prompts with results______________________________________________________________________
云服务器设置(可选——RTX PRO 6000 96GB)
对于较重的模型和企业用例,请部署在云GPU服务器上。
组件
| 服务 | 端口 | 描述 |
|---|---|---|
| llama服务器 | 8000 | 承载身份验证保护的推理端点 |
| 摘录API | 8001 | 结构化数据提取(文本或PDF→ JSON) |
| Mistral OCR MCP | 8002 | PDF→ 通过Mistral API提取markdown文本,作为AnythingLLM的MCP工具 |
| 万物皆可LLM | 3001 | RAG工作空间,内嵌LanceDB、Docker |
推荐云型号:Gemma 4 26B-A4B
- 架构: 教育部(总计26B,每个代币4B活跃,256名专家,8名路由+1名共享)
- 量化: Uncloth Q8_0(26.9GB,2026年4月用固定工具调用标记器重新上传)
- 背景: 262K本地
- VRAM: 约30.5GB,4个并行插槽,262K ctx,剩余65GB+余量
- 为什么Gemma 4在云端: 在.Qwen3.5-122B中训练的本机函数调用是一个令人印象深刻的聊天模型,但其10B活动MoE无法在AnythingLLM的代理循环中可靠地发出工具调用JSON。Gemma 4 26B-A4B的训练 `
分隔符使其成为可靠的选择@agent` 模式。
替代方案:Qwen3.5-122B-A10B用于聊天/推理
如果你想在同一硬件上使用最大的推理机:
- 量化: Uncloth UD-Q4_K_XL(72GB)--最新版本,带固定聊天模板
- VRAM: ~ 73GB型号+~ 4GB KV(涡轮3,131K ctx×2插槽)=~ 77GB的96GB
- 对于代理/工具工作负载,跳过此步骤——它在AnythingLLM的代理模式下循环或拒绝
- 巴托夫斯基Q4_K_M是 破碎的 --由于旧的聊天模板,即使是简单的提示也会产生无限的思维循环。始终使用Uncloth UD-Q4_K_XL或更高版本。
云盒子上的TurboQuant
马德雷格CUDA叉子 对于经典变压器/MoE架构:
- turbo3KV(5.12x压缩,3.125比特/值)
- TURBO_LAYER_ADAPTIVE=2(关闭涡轮机3-q8_0 PPL间隙的40%)
- SM120优化(Blackwell服务器级卡)
- 启用稀疏V跳跃(零质量成本,32K时速度提高4.6%)
# Example: Qwen3.5-122B with Madreag TurboQuant
TURBO_LAYER_ADAPTIVE=2 llama-server \
-m Qwen3.5-122B-A10B-UD-Q4_K_XL.gguf \
-ngl 99 -fa on -c 131072 -np 2 \
-ctk turbo3 -ctv turbo3 \
--temp 0.6 --top-k 20 --min-p 0.0 \
--host 0.0.0.0 --port 8000 \
--api-key $YOUR_BEARER_TOKEN对于 Qwen3.6-35B-A3B (门控DeltaNet混合)使用 汤姆的叉子 相反,这是唯一一把叉子 LLM_ARCH_QWEN3NEXT 支持SSM状态张量。
systemd+JSON参数获取
ExecStart=... --chat-template-kwargs '{"enable_thinking":false}' fails-systemd会剥离 " 在llama服务器看到这些字符之前。用shell脚本包裹:
# /home/user/start-llama.sh
#!/bin/bash
export TURBO_LAYER_ADAPTIVE=2
exec /home/user/llama-cpp-turboquant/build/bin/llama-server \
-m /path/to/model.gguf \
-ngl 99 -fa on -c 131072 -np 2 -ctk turbo3 -ctv turbo3 \
--host 0.0.0.0 --port 8000 \
--api-key $TOKEN然后 ExecStart=/home/user/start-llama.sh 在systemd单元中,shell引用保留了所有内容。
思维模式控制
保留服务器的 默认 思维模式开启(这是正确的主体编码所必需的)。仅在摘录API中禁用per-request:
{
"model": "...",
"messages": [...],
"temperature": 0,
"chat_template_kwargs": {"enable_thinking": false}
}Qwen3.5-122B在默认设置下只想着“你好”就浪费了3000多个代币——始终设置 enable_thinking: false 用于提取端点。
Mistral OCR MCP服务器
一个轻量级MCP服务器,将Mistral的OCR API公开为AnythingLLM工具:
PDF upload → Mistral OCR API → markdown text → Agent applies custom prompts在AnythingLLM中配置 anythingllm_mcp_servers.json:
{
"mcpServers": {
"mistral-ocr": {
"type": "sse",
"url": "http://host.docker.internal:8002/sse"
}
}
}看 configs/mistral-ocr-mcp.py 用于插入FastMCP服务器模板。
提取API管道
PDF → Mistral OCR (markdown text) → LLM (schema-driven extraction) → Clean JSONAPI公开的摘录 /extract 对于纯文本和 /extract-pdf 对于PDF字节。系统提示定义了目标JSON模式——交换它以匹配您的域(合同、发票、医疗表格或其他任何东西)。看 configs/extract-api.py 对于模板。
______________________________________________________________________
链接和资源
模型
| 资源 | 链接 |
|---|---|
| Qwen3.5-35B-A3B(底座) | https://huggingface.co/Qwen/Qwen3.5-35B-A3B |
| Qwen3.5-122B-A10B(底座) | https://huggingface.co/Qwen/Qwen3.5-122B-A10B |
| Qwen3.5-122B bartowski GGUF(推荐用于TurboQuant) | https://huggingface.co/bartowski/Qwen_Qwen3.5-122B-A10B-GGUF |
| Qwen3.5-35B无服GGUF定量https://huggingface.co/unsloth/Qwen3.5-35B-A3B-GGUF | |
| Gemma 4 31B IT(基础) | https://huggingface.co/google/gemma-4-31b-it |
| Gemma 4不穿衣服的GGUF定量https://huggingface.co/unsloth/gemma-4-31b-it-GGUF | |
| Qwen3.5博客文章https://qwen.ai/blog?id=qwen3.5 | |
| 取消布料(量化工具) | https://github.com/unslothai/unsloth |
推理引擎
| 资源 | 链接 |
|---|---|
| llama.cpp(主线) | https://github.com/ggml-org/llama.cpp |
| llama.cpp发布(预构建) | https://github.com/ggml-org/llama.cpp/releases |
| TurboQuant CUDA分叉(TheTom——有Qwen3NEXT用于Qwen3.6门控DeltaNet) | https://github.com/TheTom/llama-cpp-turboquant |
| TurboQuant CUDA分叉(Madreag——SM120上32K的最快解码速度) | https://github.com/Madreag/turbo3-cuda |
| TurboQuant CUDA叉子(spiritbuun,原版) | https://github.com/spiritbuun/llama-cpp-turboquant-cuda |
研究
| 资源 | 链接 |
|---|---|
| TurboQuant论文(谷歌,ICLR 2026)https://research.google/blog/turboquant-redefining-ai-efficiency-with-extreme-compression/ | |
| TurboQuant MLX实现https://github.com/Blaizzy/mlx-vlm/pull/858 | |
| QJL论文 | https://arxiv.org/abs/2402.09078 |
| PolarQuant论文(AISTATS 2026) | 在TurboQuant博客中引用 |
工具
| 工具 | 链接 | 它的作用 |
|---|---|---|
| OpenCode | https://opencode.ai / https://github.com/opencode-ai/opencode | 代理编码(建议用于本地模型) |
| 克劳德代码 | https://claude.ai/code / https://github.com/anthropics/claude-code | Anthropic的编码命令行界面 |
| OpenClaw | https://docs.ollama.com | 电报/消息机器人桥 |
| 打开WebUI | https://github.com/open-webui/open-webui | 浏览器聊天界面 |
| 上下文7 MCP | https://context7.com | 文档搜索 |
| Chrome DevTools MCP | https://github.com/anthropics/anthropic-cookbook | 浏览器自动化 |
| 奥拉玛 | https://ollama.com | 本地模型运行器(替代llama服务器) |
| 任何事情LLM | https://anythingllm.com | RAG知识库平台 |
| 错误OCR API | https://docs.mistral.ai/capabilities/document_ai | PDF文本提取 |
社区
| 资源 | 链接 |
|---|---|
| r/LocalLLaMA(Reddit) | https://reddit.com/r/LocalLLaMA |
______________________________________________________________________
许可证
麻省理工学院——随心所欲地使用。如果你以此为基础,分享你的发现!
______________________________________________________________________
作者
由以下人员建造和维护 詹姆斯·阿斯兰在RTX 5090(本地)和RTX PRO 6000 96GB(云)上进行了测试,采用Qwen3.5/3.6、Gemma 4 26B/31B和TurboQuant KV压缩。
