This commit is contained in:
2026-04-23 15:42:35 +08:00
parent b534ceac58
commit 719c593c82
2 changed files with 30 additions and 14 deletions
+26 -2
View File
@@ -27,7 +27,8 @@
"dtype": "float16",
"quantization": "fp8",
"ctx": "262144",
"max_tokens": "32768",
"max_tokens": "65536",
"max_num_batched_tokens": 16384,
"trust_remote": true,
"enforce_eager": false,
"valid_tp": [
@@ -54,7 +55,7 @@
2
],
"max_num_seqs": 32,
"gpu_util": "0.92",
"gpu_util": "0.96",
"kv_cache_dtype": "fp8",
"enable_prefix_caching": true,
"tool_call_parser": "qwen3_coder",
@@ -64,6 +65,29 @@
"served_model_name": "Qwen3.6-27B",
"hf_model_id": "Qwen/Qwen3.6-27B"
},
"Qwen3.6-27B-FP8": {
"local_path": "Qwen3.6-27B-FP8",
"dtype": "auto",
"ctx": "262144",
"max_tokens": "65536",
"max_num_batched_tokens": 16384,
"trust_remote": true,
"enforce_eager": false,
"valid_tp": [
1,
2
],
"max_num_seqs": 32,
"gpu_util": "0.92",
"kv_cache_dtype": "fp8",
"enable_prefix_caching": true,
"tool_call_parser": "qwen3_coder",
"reasoning_parser": "qwen3",
"enable_auto_tool_choice": true,
"language_model_only": true,
"served_model_name": "Qwen3.6-27B-FP8",
"hf_model_id": "Qwen/Qwen3.6-27B-FP8"
},
"Qwen3.5-35B-A3B-FP8": {
"local_path": "Qwen3.5-35B-A3B-FP8",
"dtype": "float16",
+4 -12
View File
@@ -19,18 +19,10 @@ services:
HF_HUB_OFFLINE: "1"
TRANSFORMERS_OFFLINE: "1"
HF_DATASETS_OFFLINE: "1"
# vLLM 相关配置
# VLLM_RPC_TIMEOUT: "300"
# VLLM_WORKER_MULTIPROC_METHOD: "spawn"
# PYTHONUNBUFFERED: "1"
# # 启用 AITER 加速(R9700 属于 gfx1201 架构)
# 核心修复: 禁用 AITER 的 FP8 MoE 后端,回退到 Triton 内核
VLLM_ROCM_USE_AITER: "0"
# 可选: 显式指定使用更稳定的 MoE 后端
VLLM_ROCM_MOE_BACKEND: "TRITON"
VLLM_ROCM_USE_AITER_MHA: "1"
VLLM_V1_USE_PREFILL_DECODE_ATTENTION: "0"
NCCL_MIN_NCHANNELS: "112"
VLLM_ROCM_USE_AITER: "1" # 打开总开关
# 明确禁用不稳定的MoE后端,让其他AITER优化(如MHA)生效
VLLM_ROCM_USE_AITER_MOE: "0"
VLLM_ROCM_MOE_BACKEND: "TRITON" # 强制MoE使用Triton
devices:
- /dev/kfd
- /dev/dri