Compare commits
10 Commits
8a8b1db65e
...
master
| Author | SHA1 | Date | |
|---|---|---|---|
| cd1a32fd7c | |||
| b68bcfec14 | |||
| f5abd26426 | |||
| 585e6b5b88 | |||
| 6f45d72dbf | |||
| 846ffb17f0 | |||
| 979bf45764 | |||
| 95e81de3cf | |||
| ad324f94ae | |||
| 8ddf750b4b |
@@ -1,11 +1,12 @@
|
|||||||
|
LISTEN_PORT=8000
|
||||||
#MODEL_PATH=/models/llama3-70b-quantized
|
#MODEL_PATH=/models/llama3-70b-quantized
|
||||||
#SERVED_NAME=llama3-70b-gptq
|
#SERVED_NAME=llama3-70b-gptq
|
||||||
MODEL_PATH=/models/deepseek-coder-33b-gptq
|
MODEL_PATH=/models/deepseek-coder-33b-gptq
|
||||||
SERVED_NAME=deepseek-coder
|
SERVED_NAME=deepseek-coder
|
||||||
TP_SIZE=4
|
TP_SIZE=4
|
||||||
DTYPE=float16
|
DTYPE=float16
|
||||||
MAX_MODEL_LEN=8192
|
MAX_MODEL_LEN=65536
|
||||||
GPU_MEM_UTIL=0.88
|
GPU_MEM_UTIL=0.60
|
||||||
MAX_NUM_SEQS=4
|
MAX_NUM_SEQS=4
|
||||||
VLLM_EXTRA_ARGS=--quantization gptq --disable-custom-all-reduce --enforce-eager
|
VLLM_EXTRA_ARGS=--quantization gptq --disable-custom-all-reduce --enforce-eager
|
||||||
|
|
||||||
|
|||||||
+12
-12
@@ -1,14 +1,15 @@
|
|||||||
services:
|
services:
|
||||||
vllm-legacy:
|
vllm-legacy:
|
||||||
image: vllm/vllm-openai:v0.4.0.post1
|
image: vllm/vllm-openai:v0.4.0.post1
|
||||||
container_name: gpu-lab-vllm-legacy
|
container_name: vllm-${NAME:-legacy}
|
||||||
|
restart: unless-stopped
|
||||||
network_mode: host
|
network_mode: host
|
||||||
ipc: host
|
ipc: host
|
||||||
shm_size: "32gb"
|
shm_size: "32gb"
|
||||||
env_file:
|
env_file:
|
||||||
- .env
|
- .env
|
||||||
volumes:
|
volumes:
|
||||||
- models:/models:ro
|
- /var/models:/models:ro
|
||||||
deploy:
|
deploy:
|
||||||
resources:
|
resources:
|
||||||
reservations:
|
reservations:
|
||||||
@@ -20,16 +21,15 @@ services:
|
|||||||
command:
|
command:
|
||||||
- >
|
- >
|
||||||
exec python3 -m vllm.entrypoints.openai.api_server
|
exec python3 -m vllm.entrypoints.openai.api_server
|
||||||
--model "$$MODEL_PATH"
|
--model ${MODEL_PATH}
|
||||||
--served-model-name "$$SERVED_NAME"
|
--served-model-name ${SERVED_NAME}
|
||||||
--host 0.0.0.0 --port 8000
|
--host 0.0.0.0 --port ${LISTEN_PORT}
|
||||||
--tensor-parallel-size "$$TP_SIZE"
|
--tensor-parallel-size ${TP_SIZE}
|
||||||
--dtype "$$DTYPE"
|
--dtype ${DTYPE}
|
||||||
--max-model-len "$$MAX_MODEL_LEN"
|
--max-model-len ${MAX_MODEL_LEN}
|
||||||
--gpu-memory-utilization "$$GPU_MEM_UTIL"
|
--gpu-memory-utilization ${GPU_MEM_UTIL}
|
||||||
--max-num-seqs "$$MAX_NUM_SEQS"
|
--max-num-seqs ${MAX_NUM_SEQS}
|
||||||
$$VLLM_EXTRA_ARGS
|
${VLLM_EXTRA_ARGS}
|
||||||
restart: "no"
|
|
||||||
|
|
||||||
volumes:
|
volumes:
|
||||||
models:
|
models:
|
||||||
|
|||||||
@@ -0,0 +1,26 @@
|
|||||||
|
name: gpu-lab-sglang
|
||||||
|
services:
|
||||||
|
sglang:
|
||||||
|
image: gpu-lab-sglang:v100-cu121
|
||||||
|
container_name: gpu-lab-sglang
|
||||||
|
network_mode: host
|
||||||
|
ipc: host
|
||||||
|
shm_size: "32gb"
|
||||||
|
env_file:
|
||||||
|
- active/current.env
|
||||||
|
environment:
|
||||||
|
- PYTHONPATH=/opt/v100-bootstrap
|
||||||
|
volumes:
|
||||||
|
- /root/models:/models:ro
|
||||||
|
- /root/model-cache:/model-cache:ro
|
||||||
|
- /root/gpu-lab/start-sglang-qwen.sh:/start-sglang-qwen.sh:ro
|
||||||
|
- /root/gpu-lab/v100-bootstrap:/opt/v100-bootstrap:ro
|
||||||
|
deploy:
|
||||||
|
resources:
|
||||||
|
reservations:
|
||||||
|
devices:
|
||||||
|
- driver: nvidia
|
||||||
|
count: all
|
||||||
|
capabilities: [gpu]
|
||||||
|
entrypoint: ["/bin/bash", "/start-sglang-qwen.sh"]
|
||||||
|
restart: "no"
|
||||||
@@ -0,0 +1,33 @@
|
|||||||
|
name: gpu-lab-vllm-legacy
|
||||||
|
services:
|
||||||
|
vllm-legacy:
|
||||||
|
image: vllm/vllm-openai:v0.4.0.post1
|
||||||
|
container_name: gpu-lab-vllm-legacy
|
||||||
|
network_mode: host
|
||||||
|
ipc: host
|
||||||
|
shm_size: "32gb"
|
||||||
|
volumes:
|
||||||
|
- /root/models:/models:ro
|
||||||
|
deploy:
|
||||||
|
resources:
|
||||||
|
reservations:
|
||||||
|
devices:
|
||||||
|
- driver: nvidia
|
||||||
|
count: all
|
||||||
|
capabilities: [gpu]
|
||||||
|
entrypoint: ["/bin/sh", "-c"]
|
||||||
|
command:
|
||||||
|
- >
|
||||||
|
exec python3 -m vllm.entrypoints.openai.api_server
|
||||||
|
--model /models/llama3-70b-quantized
|
||||||
|
--served-model-name llama3-70b-gptq
|
||||||
|
--host 0.0.0.0 --port 8010
|
||||||
|
--tensor-parallel-size 4
|
||||||
|
--dtype float16
|
||||||
|
--max-model-len 8192
|
||||||
|
--gpu-memory-utilization 0.88
|
||||||
|
--max-num-seqs 4
|
||||||
|
--quantization gptq
|
||||||
|
--disable-custom-all-reduce
|
||||||
|
--enforce-eager
|
||||||
|
restart: "no"
|
||||||
@@ -0,0 +1,32 @@
|
|||||||
|
name: gpu-lab-vllm-modern
|
||||||
|
services:
|
||||||
|
vllm-modern:
|
||||||
|
image: vllm/vllm-openai:v0.8.5.post1
|
||||||
|
container_name: gpu-lab-vllm-modern
|
||||||
|
network_mode: host
|
||||||
|
ipc: host
|
||||||
|
shm_size: "32gb"
|
||||||
|
volumes:
|
||||||
|
- /root/models:/models:ro
|
||||||
|
deploy:
|
||||||
|
resources:
|
||||||
|
reservations:
|
||||||
|
devices:
|
||||||
|
- driver: nvidia
|
||||||
|
count: all
|
||||||
|
capabilities: [gpu]
|
||||||
|
entrypoint: ["/bin/sh", "-c"]
|
||||||
|
command:
|
||||||
|
- >
|
||||||
|
exec python3 -m vllm.entrypoints.openai.api_server
|
||||||
|
--model /models/deepseek-coder-v2-lite
|
||||||
|
--served-model-name deepseek-coder-v2-lite
|
||||||
|
--host 0.0.0.0 --port 8010
|
||||||
|
--tensor-parallel-size 2
|
||||||
|
--dtype bfloat16
|
||||||
|
--max-model-len 8192
|
||||||
|
--gpu-memory-utilization 0.9
|
||||||
|
--max-num-seqs 4
|
||||||
|
--trust-remote-code
|
||||||
|
--enforce-eager
|
||||||
|
restart: "no"
|
||||||
Reference in New Issue
Block a user