services: vllm: build: context: . dockerfile: Dockerfile image: rocm-vllm-inference:latest container_name: rocm-vllm-openai entrypoint: ["python"] command: ["-m", "app.start_openai"] ports: - "8001:8001" volumes: - /opt/model:/opt/model:ro - ./config.json:/workspace/config.json:ro environment: HF_HOME: /opt/model VLLM_RPC_TIMEOUT: "300" VLLM_WORKER_MULTIPROC_METHOD: "spawn" PYTHONUNBUFFERED: "1" # 启用 AITER 加速(R9700 属于 gfx1201 架构) VLLM_ROCM_USE_AITER: "1" VLLM_USE_AITER_UNIFIED_ATTENTION: "1" VLLM_ROCM_USE_AITER_MHA: "0" # 增强 All-Reduce 性能(双卡通信优化) VLLM_ROCM_QUICK_REDUCE_QUANTIZATION: "INT4" # 使用 vLLM V1 引擎(性能更好) VLLM_USE_V1: "1" devices: - /dev/kfd - /dev/dri group_add: - video ipc: host shm_size: 32g cap_add: - SYS_PTRACE security_opt: - seccomp=unconfined restart: unless-stopped