Compare commits

..

10 Commits

Author SHA1 Message Date
root cd1a32fd7c update 2026-07-08 20:22:40 +02:00
root b68bcfec14 add old compose files 2026-07-08 20:21:28 +02:00
bart f5abd26426 Update compose.yaml 2026-07-08 20:14:31 +02:00
bart 585e6b5b88 Update compose.yaml 2026-07-08 20:05:52 +02:00
bart 6f45d72dbf Update compose.yaml 2026-07-08 20:04:12 +02:00
bart 846ffb17f0 Update .env 2026-07-08 20:02:25 +02:00
bart 979bf45764 Update compose.yaml 2026-07-08 20:01:16 +02:00
bart 95e81de3cf Update compose.yaml 2026-07-08 16:45:51 +02:00
bart ad324f94ae Update .env 2026-07-08 16:42:24 +02:00
root 8ddf750b4b update 2026-07-08 16:40:51 +02:00
5 changed files with 106 additions and 14 deletions
+3 -2
View File
@@ -1,11 +1,12 @@
LISTEN_PORT=8000
#MODEL_PATH=/models/llama3-70b-quantized #MODEL_PATH=/models/llama3-70b-quantized
#SERVED_NAME=llama3-70b-gptq #SERVED_NAME=llama3-70b-gptq
MODEL_PATH=/models/deepseek-coder-33b-gptq MODEL_PATH=/models/deepseek-coder-33b-gptq
SERVED_NAME=deepseek-coder SERVED_NAME=deepseek-coder
TP_SIZE=4 TP_SIZE=4
DTYPE=float16 DTYPE=float16
MAX_MODEL_LEN=8192 MAX_MODEL_LEN=65536
GPU_MEM_UTIL=0.88 GPU_MEM_UTIL=0.60
MAX_NUM_SEQS=4 MAX_NUM_SEQS=4
VLLM_EXTRA_ARGS=--quantization gptq --disable-custom-all-reduce --enforce-eager VLLM_EXTRA_ARGS=--quantization gptq --disable-custom-all-reduce --enforce-eager
+12 -12
View File
@@ -1,14 +1,15 @@
services: services:
vllm-legacy: vllm-legacy:
image: vllm/vllm-openai:v0.4.0.post1 image: vllm/vllm-openai:v0.4.0.post1
container_name: gpu-lab-vllm-legacy container_name: vllm-${NAME:-legacy}
restart: unless-stopped
network_mode: host network_mode: host
ipc: host ipc: host
shm_size: "32gb" shm_size: "32gb"
env_file: env_file:
- .env - .env
volumes: volumes:
- models:/models:ro - /var/models:/models:ro
deploy: deploy:
resources: resources:
reservations: reservations:
@@ -20,16 +21,15 @@ services:
command: command:
- > - >
exec python3 -m vllm.entrypoints.openai.api_server exec python3 -m vllm.entrypoints.openai.api_server
--model "$$MODEL_PATH" --model ${MODEL_PATH}
--served-model-name "$$SERVED_NAME" --served-model-name ${SERVED_NAME}
--host 0.0.0.0 --port 8000 --host 0.0.0.0 --port ${LISTEN_PORT}
--tensor-parallel-size "$$TP_SIZE" --tensor-parallel-size ${TP_SIZE}
--dtype "$$DTYPE" --dtype ${DTYPE}
--max-model-len "$$MAX_MODEL_LEN" --max-model-len ${MAX_MODEL_LEN}
--gpu-memory-utilization "$$GPU_MEM_UTIL" --gpu-memory-utilization ${GPU_MEM_UTIL}
--max-num-seqs "$$MAX_NUM_SEQS" --max-num-seqs ${MAX_NUM_SEQS}
$$VLLM_EXTRA_ARGS ${VLLM_EXTRA_ARGS}
restart: "no"
volumes: volumes:
models: models:
+26
View File
@@ -0,0 +1,26 @@
name: gpu-lab-sglang
services:
sglang:
image: gpu-lab-sglang:v100-cu121
container_name: gpu-lab-sglang
network_mode: host
ipc: host
shm_size: "32gb"
env_file:
- active/current.env
environment:
- PYTHONPATH=/opt/v100-bootstrap
volumes:
- /root/models:/models:ro
- /root/model-cache:/model-cache:ro
- /root/gpu-lab/start-sglang-qwen.sh:/start-sglang-qwen.sh:ro
- /root/gpu-lab/v100-bootstrap:/opt/v100-bootstrap:ro
deploy:
resources:
reservations:
devices:
- driver: nvidia
count: all
capabilities: [gpu]
entrypoint: ["/bin/bash", "/start-sglang-qwen.sh"]
restart: "no"
+33
View File
@@ -0,0 +1,33 @@
name: gpu-lab-vllm-legacy
services:
vllm-legacy:
image: vllm/vllm-openai:v0.4.0.post1
container_name: gpu-lab-vllm-legacy
network_mode: host
ipc: host
shm_size: "32gb"
volumes:
- /root/models:/models:ro
deploy:
resources:
reservations:
devices:
- driver: nvidia
count: all
capabilities: [gpu]
entrypoint: ["/bin/sh", "-c"]
command:
- >
exec python3 -m vllm.entrypoints.openai.api_server
--model /models/llama3-70b-quantized
--served-model-name llama3-70b-gptq
--host 0.0.0.0 --port 8010
--tensor-parallel-size 4
--dtype float16
--max-model-len 8192
--gpu-memory-utilization 0.88
--max-num-seqs 4
--quantization gptq
--disable-custom-all-reduce
--enforce-eager
restart: "no"
+32
View File
@@ -0,0 +1,32 @@
name: gpu-lab-vllm-modern
services:
vllm-modern:
image: vllm/vllm-openai:v0.8.5.post1
container_name: gpu-lab-vllm-modern
network_mode: host
ipc: host
shm_size: "32gb"
volumes:
- /root/models:/models:ro
deploy:
resources:
reservations:
devices:
- driver: nvidia
count: all
capabilities: [gpu]
entrypoint: ["/bin/sh", "-c"]
command:
- >
exec python3 -m vllm.entrypoints.openai.api_server
--model /models/deepseek-coder-v2-lite
--served-model-name deepseek-coder-v2-lite
--host 0.0.0.0 --port 8010
--tensor-parallel-size 2
--dtype bfloat16
--max-model-len 8192
--gpu-memory-utilization 0.9
--max-num-seqs 4
--trust-remote-code
--enforce-eager
restart: "no"