From 719c593c822c318ef39e46f4fd6a9aa0a0d2075d Mon Sep 17 00:00:00 2001 From: chenjw28 <792430652@qq.com> Date: Thu, 23 Apr 2026 15:42:35 +0800 Subject: [PATCH] x --- config.json | 28 ++++++++++++++++++++++++++-- docker-compose.yml | 16 ++++------------ 2 files changed, 30 insertions(+), 14 deletions(-) diff --git a/config.json b/config.json index 9d0d8ab..6717a6a 100644 --- a/config.json +++ b/config.json @@ -27,7 +27,8 @@ "dtype": "float16", "quantization": "fp8", "ctx": "262144", - "max_tokens": "32768", + "max_tokens": "65536", + "max_num_batched_tokens": 16384, "trust_remote": true, "enforce_eager": false, "valid_tp": [ @@ -54,7 +55,7 @@ 2 ], "max_num_seqs": 32, - "gpu_util": "0.92", + "gpu_util": "0.96", "kv_cache_dtype": "fp8", "enable_prefix_caching": true, "tool_call_parser": "qwen3_coder", @@ -64,6 +65,29 @@ "served_model_name": "Qwen3.6-27B", "hf_model_id": "Qwen/Qwen3.6-27B" }, + "Qwen3.6-27B-FP8": { + "local_path": "Qwen3.6-27B-FP8", + "dtype": "auto", + "ctx": "262144", + "max_tokens": "65536", + "max_num_batched_tokens": 16384, + "trust_remote": true, + "enforce_eager": false, + "valid_tp": [ + 1, + 2 + ], + "max_num_seqs": 32, + "gpu_util": "0.92", + "kv_cache_dtype": "fp8", + "enable_prefix_caching": true, + "tool_call_parser": "qwen3_coder", + "reasoning_parser": "qwen3", + "enable_auto_tool_choice": true, + "language_model_only": true, + "served_model_name": "Qwen3.6-27B-FP8", + "hf_model_id": "Qwen/Qwen3.6-27B-FP8" + }, "Qwen3.5-35B-A3B-FP8": { "local_path": "Qwen3.5-35B-A3B-FP8", "dtype": "float16", diff --git a/docker-compose.yml b/docker-compose.yml index 0168cc8..9dc3852 100644 --- a/docker-compose.yml +++ b/docker-compose.yml @@ -19,18 +19,10 @@ services: HF_HUB_OFFLINE: "1" TRANSFORMERS_OFFLINE: "1" HF_DATASETS_OFFLINE: "1" - # vLLM 相关配置 - # VLLM_RPC_TIMEOUT: "300" - # VLLM_WORKER_MULTIPROC_METHOD: "spawn" - # PYTHONUNBUFFERED: "1" - # # 启用 AITER 加速(R9700 属于 gfx1201 架构) - # 核心修复: 禁用 AITER 的 FP8 MoE 后端,回退到 Triton 内核 - VLLM_ROCM_USE_AITER: "0" - # 可选: 显式指定使用更稳定的 MoE 后端 - VLLM_ROCM_MOE_BACKEND: "TRITON" - VLLM_ROCM_USE_AITER_MHA: "1" - VLLM_V1_USE_PREFILL_DECODE_ATTENTION: "0" - NCCL_MIN_NCHANNELS: "112" + VLLM_ROCM_USE_AITER: "1" # 打开总开关 + # 明确禁用不稳定的MoE后端,让其他AITER优化(如MHA)生效 + VLLM_ROCM_USE_AITER_MOE: "0" + VLLM_ROCM_MOE_BACKEND: "TRITON" # 强制MoE使用Triton devices: - /dev/kfd - /dev/dri