No Title

29 July 2026

Views: 18

V100 32GB + 32GB DDR4 RAM

llama.cpp version: b9986 (Native, without Docker)

--------------------

cmake -B build -DGGML_CUDA=ON \
-DCMAKE_INSTALL_RPATH='/opt/llama.cpp/lib' \
-DCMAKE_BUILD_WITH_INSTALL_RPATH=ON \
-DMTMD_VIDEO=OFF -DLLAMA_OPENSSL=OFF \
-DCMAKE_CUDA_ARCHITECTURES=70-real

cmake --build build --config Release

sudo cmake --install build --prefix /opt/llama.cpp

----------------------
Gemma 4 26B A4B (MoE)

llama-server \
--host 0.0.0.0 \
--port 10000 \
--model unsloth-Gemma-4-26B-A4B-it/gemma-4-26B-A4B-it-UD-Q5_K_S.gguf \
--mmproj unsloth-Gemma-4-26B-A4B-it/mmproj-F16.gguf \
--model-draft unsloth-Gemma-4-26B-A4B-it/mtp-gemma-4-26B-A4B-it-Q8_0.gguf \
--alias 'gemma4' \
--jinja \
--gpu-layers all \
--temp 1.0 \
--top-p 0.95 \
--top-k 64 \
--ctx-size 524288 \
-ctk q8_0 -ctv q8_0 \
-b 1024 -ub 1024 \
--spec-type draft-mtp \
--spec-draft-n-max 5 \
--parallel 4 \
--ctx-checkpoints 2 \
--checkpoint-min-step 32768 \
--cache-ram 22528 \
--cache-idle-slots

--------------------
Gemma 4 31B (dense)

llama-server \
--host 0.0.0.0 \
--port 10000 \
--model unsloth-Gemma-4-31B-it-qat/gemma-4-31B-it-qat-UD-Q4_K_XL.gguf \
--mmproj unsloth-Gemma-4-31B-it-qat/mmproj-F16.gguf \
--model-draft unsloth-Gemma-4-31B-it-qat/mtp-gemma-4-31B-it.gguf \
--alias 'gemma4' \
--jinja \
--gpu-layers all \
--temp 1.0 \
--top-p 0.95 \
--top-k 64 \
--ctx-size 196608 \
-ctk q8_0 -ctv q8_0 \
-b 512 -ub 512 \
--spec-type draft-mtp \
--spec-draft-n-max 3 \
--parallel 2 \
--ctx-checkpoints 4 \
--checkpoint-min-step 32768 \
--cache-ram 22528 \
--cache-idle-slots

Share