Update compose.yaml
This commit is contained in:
+10
-10
@@ -2,6 +2,7 @@ services:
|
|||||||
vllm-legacy:
|
vllm-legacy:
|
||||||
image: vllm/vllm-openai:v0.4.0.post1
|
image: vllm/vllm-openai:v0.4.0.post1
|
||||||
container_name: vllm-legacy
|
container_name: vllm-legacy
|
||||||
|
restart: unless-stopped
|
||||||
network_mode: host
|
network_mode: host
|
||||||
ipc: host
|
ipc: host
|
||||||
shm_size: "32gb"
|
shm_size: "32gb"
|
||||||
@@ -20,16 +21,15 @@ services:
|
|||||||
command:
|
command:
|
||||||
- >
|
- >
|
||||||
exec python3 -m vllm.entrypoints.openai.api_server
|
exec python3 -m vllm.entrypoints.openai.api_server
|
||||||
--model "$$MODEL_PATH"
|
--model ${MODEL_PATH}
|
||||||
--served-model-name "$$SERVED_NAME"
|
--served-model-name ${SERVED_NAME}
|
||||||
--host 0.0.0.0 --port "$LISTEN_PORT"
|
--host 0.0.0.0 --port ${LISTEN_PORT}
|
||||||
--tensor-parallel-size "$$TP_SIZE"
|
--tensor-parallel-size ${TP_SIZE}
|
||||||
--dtype "$$DTYPE"
|
--dtype ${DTYPE}
|
||||||
--max-model-len "$$MAX_MODEL_LEN"
|
--max-model-len ${MAX_MODEL_LEN}
|
||||||
--gpu-memory-utilization "$$GPU_MEM_UTIL"
|
--gpu-memory-utilization ${GPU_MEM_UTIL}
|
||||||
--max-num-seqs "$$MAX_NUM_SEQS"
|
--max-num-seqs ${MAX_NUM_SEQS}
|
||||||
$$VLLM_EXTRA_ARGS
|
${VLLM_EXTRA_ARGS}
|
||||||
restart: "no"
|
|
||||||
|
|
||||||
volumes:
|
volumes:
|
||||||
models:
|
models:
|
||||||
|
|||||||
Reference in New Issue
Block a user