From 7a3333b2f818cdbde438ad3afa004126951a0e48 Mon Sep 17 00:00:00 2001 From: GRayHook Date: Wed, 5 Aug 2026 18:42:39 +0700 Subject: [PATCH] bump --- .env | 6 +++--- docker-compose.yml | 6 +++++- podman-llama.sh | 5 ++++- 3 files changed, 12 insertions(+), 5 deletions(-) diff --git a/.env b/.env index 16bcfac..4f20641 100644 --- a/.env +++ b/.env @@ -1,14 +1,14 @@ -MODEL_FILE=Qwen3.6-35B-A3B-MXFP4_MOE.gguf +MODEL_FILE=Qwen3.5-9B-MTP-UD-Q4_K_XL.gguf # Для -1 в .env лучше кавычки — иначе часть парсеров .env ломается на ведущем минусе. N_GPU_LAYERS="-1" # Доп. ключи docker-compose (опционально; дефолты заданы в compose) CTX_SIZE=65536 -THREADS=8 +THREADS=1 CACHE_TYPE_K=q8_0 CACHE_TYPE_V=q8_0 # MoE (Qwen3.5-35B-A3B-Q4_K_M / MXFP4_MOE и т.д.): при OOM на GPU — CPU_MOE=1 или частично N_CPU_MOE=8 # Для dense (Qwopus 27B, Qwen 9B) держите оба 0. CPU_MOE=0 -N_CPU_MOE=29 +N_CPU_MOE=0 diff --git a/docker-compose.yml b/docker-compose.yml index 26f1ffd..218f779 100644 --- a/docker-compose.yml +++ b/docker-compose.yml @@ -18,7 +18,7 @@ version: "3.8" services: llama-server: - image: ghcr.io/ggml-org/llama.cpp:server-cuda + image: ghcr.io/ggml-org/llama.cpp:server-cuda13 container_name: llama-server ports: # Явный IPv4 на хосте (избегаем привязки только к [::] в части окружений). @@ -43,6 +43,10 @@ services: - "0.0.0.0" - "--port" - "8080" + - "--spec-type" + - "draft-mtp" + - "--spec-draft-n-max" + - "3" - "--n-cpu-moe" - "${N_CPU_MOE:-99}" - "-c" diff --git a/podman-llama.sh b/podman-llama.sh index 50da5ea..de29e54 100755 --- a/podman-llama.sh +++ b/podman-llama.sh @@ -9,6 +9,8 @@ # Переменные — как в compose / .env: PORT, MODEL_FILE, CPU_MOE, N_CPU_MOE, CTX_SIZE, # CACHE_TYPE_K, CACHE_TYPE_V, THREADS; образ: IMAGE (по умолчанию server-cuda). # Порт на хосте: только IPv4 (BIND_HOST по умолчанию 0.0.0.0), иначе Podman часто вешает [::]. +# Монтирование models: по умолчанию :ro,z (SELinux — иначе часто Permission denied в rootless). +# Свой суффикс: PODMAN_MODELS_OPTS=z или PODMAN_MODELS_OPTS=Z или пусто PODMAN_MODELS_OPTS= set -euo pipefail @@ -32,6 +34,7 @@ fi : "${THREADS:=8}" : "${IMAGE:=ghcr.io/ggml-org/llama.cpp:server-cuda}" : "${BIND_HOST:=0.0.0.0}" +: "${PODMAN_MODELS_OPTS:=z}" # Разбить по пробелам для podman (пусто = только CDI-устройство). # Пример: PODMAN_GPU_FLAGS='--gpus all' @@ -44,7 +47,7 @@ podman run -d \ --shm-size 1g \ --ulimit memlock=-1:-1 \ -p "${BIND_HOST}:${PORT}:8080" \ - -v "${ROOT}/models:/models:ro" \ + -v "${ROOT}/models:/models:ro${PODMAN_MODELS_OPTS:+,${PODMAN_MODELS_OPTS}}" \ -e NVIDIA_VISIBLE_DEVICES=all \ -e "LLAMA_ARG_CPU_MOE=${CPU_MOE}" \ "${PODMAN_GPU_FLAGS_ARR[@]}" \