tune and run local with turboquant

This commit is contained in:
2026-06-22 10:37:43 +07:00
parent a0713b260b
commit 2b5977b605
3 changed files with 39 additions and 6 deletions
+4 -4
View File
@@ -1,10 +1,10 @@
MODEL_FILE=Qwen3.6-35B-A3B-MXFP4_MOE.gguf MODEL_FILE=Qwen3.6-35B-A3B-MTP-MXFP4_MOE.gguf
# Для -1 в .env лучше кавычки — иначе часть парсеров .env ломается на ведущем минусе. # Для -1 в .env лучше кавычки — иначе часть парсеров .env ломается на ведущем минусе.
N_GPU_LAYERS="-1" N_GPU_LAYERS="99"
# Доп. ключи docker-compose (опционально; дефолты заданы в compose) # Доп. ключи docker-compose (опционально; дефолты заданы в compose)
CTX_SIZE=65536 CTX_SIZE=175000
THREADS=8 THREADS=12
CACHE_TYPE_K=q8_0 CACHE_TYPE_K=q8_0
CACHE_TYPE_V=q8_0 CACHE_TYPE_V=q8_0
Executable
+30
View File
@@ -0,0 +1,30 @@
#!/bin/bash
set -a # Automatically export all variables defined next
source .env # Load the file
set +a # Disable automatic export
sudo ulimit -l unlimited
taskset -c 0-11 /home/bazzite/Документы/llama-cpp-turboquant/build/bin/llama-server \
-m "models/${MODEL_FILE}" \
--host 0.0.0.0 \
--port 8080 \
-ngl "${N_GPU_LAYERS}" \
--n-cpu-moe "${N_CPU_MOE}" \
--spec-type draft-mtp --spec-draft-n-max 3 \
-c "${CTX_SIZE}" \
-np 1 \
-fa on \
--cache-type-k "turbo4" \
--cache-type-v "turbo3" \
--no-mmap \
--mlock \
--ctx-checkpoints 1 \
--cache-ram -1 \
--jinja \
--reasoning on \
--reasoning-budget -1 \
-b 2048 \
-ub 2048 \
--threads "${THREADS}"
+5 -2
View File
@@ -30,7 +30,7 @@ fi
: "${CACHE_TYPE_K:=q8_0}" : "${CACHE_TYPE_K:=q8_0}"
: "${CACHE_TYPE_V:=turbo2}" : "${CACHE_TYPE_V:=turbo2}"
: "${THREADS:=8}" : "${THREADS:=8}"
: "${IMAGE:=ghcr.io/ggml-org/llama.cpp:server-cuda}" : "${IMAGE:=ghcr.io/ggml-org/llama.cpp:server-cuda13}"
: "${BIND_HOST:=0.0.0.0}" : "${BIND_HOST:=0.0.0.0}"
# Разбить по пробелам для podman (пусто = только CDI-устройство). # Разбить по пробелам для podman (пусто = только CDI-устройство).
@@ -42,6 +42,7 @@ podman run -d \
--replace \ --replace \
--restart no \ --restart no \
--shm-size 1g \ --shm-size 1g \
--cpuset-cpus="0-11" \
--ulimit memlock=-1:-1 \ --ulimit memlock=-1:-1 \
-p "${BIND_HOST}:${PORT}:8080" \ -p "${BIND_HOST}:${PORT}:8080" \
-v "${ROOT}/models:/models:ro" \ -v "${ROOT}/models:/models:ro" \
@@ -52,7 +53,9 @@ podman run -d \
-m "/models/${MODEL_FILE}" \ -m "/models/${MODEL_FILE}" \
--host 0.0.0.0 \ --host 0.0.0.0 \
--port 8080 \ --port 8080 \
-ngl "${N_GPU_LAYERS}" \
--n-cpu-moe "${N_CPU_MOE}" \ --n-cpu-moe "${N_CPU_MOE}" \
--spec-type draft-mtp --spec-draft-n-max 3 \
-c "${CTX_SIZE}" \ -c "${CTX_SIZE}" \
-np 1 \ -np 1 \
-fa on \ -fa on \
@@ -61,7 +64,7 @@ podman run -d \
--no-mmap \ --no-mmap \
--mlock \ --mlock \
--ctx-checkpoints 1 \ --ctx-checkpoints 1 \
--cache-ram 0 \ --cache-ram -1 \
--jinja \ --jinja \
--reasoning on \ --reasoning on \
--reasoning-budget -1 \ --reasoning-budget -1 \