This commit is contained in:
2026-08-05 18:42:39 +07:00
parent a0713b260b
commit 7a3333b2f8
3 changed files with 12 additions and 5 deletions
+4 -1
View File
@@ -9,6 +9,8 @@
# Переменные — как в compose / .env: PORT, MODEL_FILE, CPU_MOE, N_CPU_MOE, CTX_SIZE,
# CACHE_TYPE_K, CACHE_TYPE_V, THREADS; образ: IMAGE (по умолчанию server-cuda).
# Порт на хосте: только IPv4 (BIND_HOST по умолчанию 0.0.0.0), иначе Podman часто вешает [::].
# Монтирование models: по умолчанию :ro,z (SELinux — иначе часто Permission denied в rootless).
# Свой суффикс: PODMAN_MODELS_OPTS=z или PODMAN_MODELS_OPTS=Z или пусто PODMAN_MODELS_OPTS=
set -euo pipefail
@@ -32,6 +34,7 @@ fi
: "${THREADS:=8}"
: "${IMAGE:=ghcr.io/ggml-org/llama.cpp:server-cuda}"
: "${BIND_HOST:=0.0.0.0}"
: "${PODMAN_MODELS_OPTS:=z}"
# Разбить по пробелам для podman (пусто = только CDI-устройство).
# Пример: PODMAN_GPU_FLAGS='--gpus all'
@@ -44,7 +47,7 @@ podman run -d \
--shm-size 1g \
--ulimit memlock=-1:-1 \
-p "${BIND_HOST}:${PORT}:8080" \
-v "${ROOT}/models:/models:ro" \
-v "${ROOT}/models:/models:ro${PODMAN_MODELS_OPTS:+,${PODMAN_MODELS_OPTS}}" \
-e NVIDIA_VISIBLE_DEVICES=all \
-e "LLAMA_ARG_CPU_MOE=${CPU_MOE}" \
"${PODMAN_GPU_FLAGS_ARR[@]}" \