Files
vllm-legacy/compose.yaml
T
2026-07-08 20:14:31 +02:00

36 lines
901 B
YAML

services:
vllm-legacy:
image: vllm/vllm-openai:v0.4.0.post1
container_name: vllm-${NAME:-legacy}
restart: unless-stopped
network_mode: host
ipc: host
shm_size: "32gb"
env_file:
- .env
volumes:
- /var/models:/models:ro
deploy:
resources:
reservations:
devices:
- driver: nvidia
count: all
capabilities: [gpu]
entrypoint: ["/bin/sh", "-c"]
command:
- >
exec python3 -m vllm.entrypoints.openai.api_server
--model ${MODEL_PATH}
--served-model-name ${SERVED_NAME}
--host 0.0.0.0 --port ${LISTEN_PORT}
--tensor-parallel-size ${TP_SIZE}
--dtype ${DTYPE}
--max-model-len ${MAX_MODEL_LEN}
--gpu-memory-utilization ${GPU_MEM_UTIL}
--max-num-seqs ${MAX_NUM_SEQS}
${VLLM_EXTRA_ARGS}
volumes:
models: