bump
This commit is contained in:
@@ -1,14 +1,14 @@
|
|||||||
MODEL_FILE=Qwen3.6-35B-A3B-MXFP4_MOE.gguf
|
MODEL_FILE=Qwen3.5-9B-MTP-UD-Q4_K_XL.gguf
|
||||||
# Для -1 в .env лучше кавычки — иначе часть парсеров .env ломается на ведущем минусе.
|
# Для -1 в .env лучше кавычки — иначе часть парсеров .env ломается на ведущем минусе.
|
||||||
N_GPU_LAYERS="-1"
|
N_GPU_LAYERS="-1"
|
||||||
|
|
||||||
# Доп. ключи docker-compose (опционально; дефолты заданы в compose)
|
# Доп. ключи docker-compose (опционально; дефолты заданы в compose)
|
||||||
CTX_SIZE=65536
|
CTX_SIZE=65536
|
||||||
THREADS=8
|
THREADS=1
|
||||||
CACHE_TYPE_K=q8_0
|
CACHE_TYPE_K=q8_0
|
||||||
CACHE_TYPE_V=q8_0
|
CACHE_TYPE_V=q8_0
|
||||||
|
|
||||||
# MoE (Qwen3.5-35B-A3B-Q4_K_M / MXFP4_MOE и т.д.): при OOM на GPU — CPU_MOE=1 или частично N_CPU_MOE=8
|
# MoE (Qwen3.5-35B-A3B-Q4_K_M / MXFP4_MOE и т.д.): при OOM на GPU — CPU_MOE=1 или частично N_CPU_MOE=8
|
||||||
# Для dense (Qwopus 27B, Qwen 9B) держите оба 0.
|
# Для dense (Qwopus 27B, Qwen 9B) держите оба 0.
|
||||||
CPU_MOE=0
|
CPU_MOE=0
|
||||||
N_CPU_MOE=29
|
N_CPU_MOE=0
|
||||||
|
|||||||
+5
-1
@@ -18,7 +18,7 @@ version: "3.8"
|
|||||||
|
|
||||||
services:
|
services:
|
||||||
llama-server:
|
llama-server:
|
||||||
image: ghcr.io/ggml-org/llama.cpp:server-cuda
|
image: ghcr.io/ggml-org/llama.cpp:server-cuda13
|
||||||
container_name: llama-server
|
container_name: llama-server
|
||||||
ports:
|
ports:
|
||||||
# Явный IPv4 на хосте (избегаем привязки только к [::] в части окружений).
|
# Явный IPv4 на хосте (избегаем привязки только к [::] в части окружений).
|
||||||
@@ -43,6 +43,10 @@ services:
|
|||||||
- "0.0.0.0"
|
- "0.0.0.0"
|
||||||
- "--port"
|
- "--port"
|
||||||
- "8080"
|
- "8080"
|
||||||
|
- "--spec-type"
|
||||||
|
- "draft-mtp"
|
||||||
|
- "--spec-draft-n-max"
|
||||||
|
- "3"
|
||||||
- "--n-cpu-moe"
|
- "--n-cpu-moe"
|
||||||
- "${N_CPU_MOE:-99}"
|
- "${N_CPU_MOE:-99}"
|
||||||
- "-c"
|
- "-c"
|
||||||
|
|||||||
+4
-1
@@ -9,6 +9,8 @@
|
|||||||
# Переменные — как в compose / .env: PORT, MODEL_FILE, CPU_MOE, N_CPU_MOE, CTX_SIZE,
|
# Переменные — как в compose / .env: PORT, MODEL_FILE, CPU_MOE, N_CPU_MOE, CTX_SIZE,
|
||||||
# CACHE_TYPE_K, CACHE_TYPE_V, THREADS; образ: IMAGE (по умолчанию server-cuda).
|
# CACHE_TYPE_K, CACHE_TYPE_V, THREADS; образ: IMAGE (по умолчанию server-cuda).
|
||||||
# Порт на хосте: только IPv4 (BIND_HOST по умолчанию 0.0.0.0), иначе Podman часто вешает [::].
|
# Порт на хосте: только IPv4 (BIND_HOST по умолчанию 0.0.0.0), иначе Podman часто вешает [::].
|
||||||
|
# Монтирование models: по умолчанию :ro,z (SELinux — иначе часто Permission denied в rootless).
|
||||||
|
# Свой суффикс: PODMAN_MODELS_OPTS=z или PODMAN_MODELS_OPTS=Z или пусто PODMAN_MODELS_OPTS=
|
||||||
|
|
||||||
set -euo pipefail
|
set -euo pipefail
|
||||||
|
|
||||||
@@ -32,6 +34,7 @@ fi
|
|||||||
: "${THREADS:=8}"
|
: "${THREADS:=8}"
|
||||||
: "${IMAGE:=ghcr.io/ggml-org/llama.cpp:server-cuda}"
|
: "${IMAGE:=ghcr.io/ggml-org/llama.cpp:server-cuda}"
|
||||||
: "${BIND_HOST:=0.0.0.0}"
|
: "${BIND_HOST:=0.0.0.0}"
|
||||||
|
: "${PODMAN_MODELS_OPTS:=z}"
|
||||||
|
|
||||||
# Разбить по пробелам для podman (пусто = только CDI-устройство).
|
# Разбить по пробелам для podman (пусто = только CDI-устройство).
|
||||||
# Пример: PODMAN_GPU_FLAGS='--gpus all'
|
# Пример: PODMAN_GPU_FLAGS='--gpus all'
|
||||||
@@ -44,7 +47,7 @@ podman run -d \
|
|||||||
--shm-size 1g \
|
--shm-size 1g \
|
||||||
--ulimit memlock=-1:-1 \
|
--ulimit memlock=-1:-1 \
|
||||||
-p "${BIND_HOST}:${PORT}:8080" \
|
-p "${BIND_HOST}:${PORT}:8080" \
|
||||||
-v "${ROOT}/models:/models:ro" \
|
-v "${ROOT}/models:/models:ro${PODMAN_MODELS_OPTS:+,${PODMAN_MODELS_OPTS}}" \
|
||||||
-e NVIDIA_VISIBLE_DEVICES=all \
|
-e NVIDIA_VISIBLE_DEVICES=all \
|
||||||
-e "LLAMA_ARG_CPU_MOE=${CPU_MOE}" \
|
-e "LLAMA_ARG_CPU_MOE=${CPU_MOE}" \
|
||||||
"${PODMAN_GPU_FLAGS_ARR[@]}" \
|
"${PODMAN_GPU_FLAGS_ARR[@]}" \
|
||||||
|
|||||||
Reference in New Issue
Block a user