services: vllm: build: context: . dockerfile: Dockerfile image: vllm-openai-rocm:nightly container_name: rocm-vllm-openai entrypoint: ["python"] command: ["-m", "app.start_openai"] ports: - "8001:8001" volumes: - /opt/model:/opt/model:ro - ./config.json:/workspace/config.json:ro environment: HF_HOME: /opt/model # 严格离线模式,禁止任何网络下载 HF_HUB_OFFLINE: "1" TRANSFORMERS_OFFLINE: "1" HF_DATASETS_OFFLINE: "1" # vLLM 相关配置 # VLLM_RPC_TIMEOUT: "300" # VLLM_WORKER_MULTIPROC_METHOD: "spawn" # PYTHONUNBUFFERED: "1" # # 启用 AITER 加速(R9700 属于 gfx1201 架构) # 核心修复: 禁用 AITER 的 FP8 MoE 后端,回退到 Triton 内核 VLLM_ROCM_USE_AITER: "0" # 可选: 显式指定使用更稳定的 MoE 后端 VLLM_ROCM_MOE_BACKEND: "TRITON" VLLM_ROCM_USE_AITER_MHA: "1" VLLM_V1_USE_PREFILL_DECODE_ATTENTION: "0" NCCL_MIN_NCHANNELS: "112" devices: - /dev/kfd - /dev/dri group_add: - video ipc: host shm_size: 32g cap_add: - SYS_PTRACE security_opt: - seccomp=unconfined restart: unless-stopped