42 lines
1.1 KiB
YAML
42 lines
1.1 KiB
YAML
services:
|
|
vllm:
|
|
build:
|
|
context: .
|
|
dockerfile: Dockerfile
|
|
image: vllm-openai-rocm:nightly
|
|
container_name: rocm-vllm-openai
|
|
entrypoint: ["python"]
|
|
command: ["-m", "app.start_openai"]
|
|
ports:
|
|
- "8001:8001"
|
|
volumes:
|
|
- /opt/model:/opt/model:ro
|
|
- ./config.json:/workspace/config.json:ro
|
|
environment:
|
|
HF_HOME: /opt/model
|
|
# 严格离线模式,禁止任何网络下载
|
|
HF_HUB_OFFLINE: "1"
|
|
TRANSFORMERS_OFFLINE: "1"
|
|
HF_DATASETS_OFFLINE: "1"
|
|
# vLLM 相关配置
|
|
# VLLM_RPC_TIMEOUT: "300"
|
|
# VLLM_WORKER_MULTIPROC_METHOD: "spawn"
|
|
# PYTHONUNBUFFERED: "1"
|
|
# # 启用 AITER 加速(R9700 属于 gfx1201 架构)
|
|
VLLM_ROCM_USE_AITER: "1"
|
|
VLLM_ROCM_USE_AITER_MHA: "0"
|
|
# # 增强 All-Reduce 性能(双卡通信优化)
|
|
VLLM_ROCM_QUICK_REDUCE_QUANTIZATION: "INT4"
|
|
devices:
|
|
- /dev/kfd
|
|
- /dev/dri
|
|
group_add:
|
|
- video
|
|
ipc: host
|
|
shm_size: 32g
|
|
cap_add:
|
|
- SYS_PTRACE
|
|
security_opt:
|
|
- seccomp=unconfined
|
|
restart: unless-stopped
|