diff --git a/config.json b/config.json index ffd15ca..053325c 100644 --- a/config.json +++ b/config.json @@ -20,7 +20,7 @@ "revision": "", "models": { "default": "Qwen3.5-35B-A3B-GPTQ-Int4", - "selected": "Gemma-4-26B-A4B", + "selected": "Qwen3.5-35B-A3B-FP8", "profiles": { "GLM-4.7-Flash-AWQ": { "local_path": "GLM-4.7-Flash-AWQ", @@ -78,12 +78,13 @@ "Qwen3.5-35B-A3B-FP8": { "local_path": "Qwen3.5-35B-A3B-FP8", "dtype": "float16", - "ctx": "65536", + "ctx": "131072", + "enforce_eager": false, "trust_remote": true, "valid_tp": [1, 2], "max_num_seqs": "8", - "max_tokens": "4096", - "gpu_util": "0.92", + "max_tokens": "16384", + "gpu_util": "0.94", "tool_call_parser": "qwen3_coder", "enable_auto_tool_choice": true, "served_model_name": "Qwen3.5-35B-A3B-FP8", diff --git a/docker-compose.yml b/docker-compose.yml index b4330d5..83297ce 100644 --- a/docker-compose.yml +++ b/docker-compose.yml @@ -24,12 +24,9 @@ services: PYTHONUNBUFFERED: "1" # 启用 AITER 加速(R9700 属于 gfx1201 架构) VLLM_ROCM_USE_AITER: "1" - VLLM_USE_AITER_UNIFIED_ATTENTION: "1" VLLM_ROCM_USE_AITER_MHA: "0" # 增强 All-Reduce 性能(双卡通信优化) VLLM_ROCM_QUICK_REDUCE_QUANTIZATION: "INT4" - # 使用 vLLM V1 引擎(性能更好) - VLLM_USE_V1: "1" devices: - /dev/kfd - /dev/dri