diff --git a/config.json b/config.json index e0906c8..e5f4ef7 100644 --- a/config.json +++ b/config.json @@ -69,11 +69,11 @@ "local_path": "Qwen3.6-27B-FP8", "dtype": "auto", "quantization": "fp8", - "ctx": "131072", + "ctx": "65536", "max_tokens": "32768", "max_num_batched_tokens": 16384, "trust_remote": true, - "enforce_eager": false, + "enforce_eager": true, "valid_tp": [ 1, 2 diff --git a/docker-compose.yml b/docker-compose.yml index 9dc3852..90cccbc 100644 --- a/docker-compose.yml +++ b/docker-compose.yml @@ -19,10 +19,12 @@ services: HF_HUB_OFFLINE: "1" TRANSFORMERS_OFFLINE: "1" HF_DATASETS_OFFLINE: "1" - VLLM_ROCM_USE_AITER: "1" # 打开总开关 + VLLM_ROCM_USE_AITER: "0" # 打开总开关 # 明确禁用不稳定的MoE后端,让其他AITER优化(如MHA)生效 VLLM_ROCM_USE_AITER_MOE: "0" VLLM_ROCM_MOE_BACKEND: "TRITON" # 强制MoE使用Triton + TORCHINDUCTOR_FX_GRAPH_CACHE: "0" # 禁用 torch.compile 缓存 + VLLM_DISABLE_COMPILE_CACHE: "1" devices: - /dev/kfd - /dev/dri