Files
amd-r9700-vllm-toolboxes/config.json
T
2026-03-29 00:29:54 +08:00

117 lines
3.3 KiB
JSON

{
"default_model": "Qwen3-Next-80B-A3B-Instruct-AWQ-4bit",
"models": {
"Meta-Llama-3.1-8B-Instruct": {
"ctx": "65536",
"trust_remote": false,
"valid_tp": [1, 2],
"max_num_seqs": "64",
"max_tokens": "32768",
"gpu_util": "0.98",
"hf_model_id": "meta-llama/Meta-Llama-3.1-8B-Instruct"
},
"gpt-oss-20b": {
"ctx": "32768",
"trust_remote": true,
"valid_tp": [1, 2],
"max_num_seqs": "64",
"max_tokens": "8192",
"gpu_util": "0.98",
"hf_model_id": "openai/gpt-oss-20b"
},
"Qwen3-14B-FP8-dynamic": {
"ctx": "32768",
"trust_remote": true,
"valid_tp": [1],
"max_num_seqs": "64",
"max_tokens": "32768",
"gpu_util": "0.98",
"hf_model_id": "RedHatAI/Qwen3-14B-FP8-dynamic"
},
"Qwen3-Coder-30B-A3B-Instruct-GPTQ-4bit": {
"ctx": "131072", // 128K
"trust_remote": true,
"valid_tp": [1, 2],
"max_num_seqs": "32", // 适当减少以节省显存
"max_tokens": "65536",
"gpu_util": "0.95", // 适当降低以预留更多显存
"hf_model_id": "cpatonn/Qwen3-Coder-30B-A3B-Instruct-GPTQ-4bit"
},
"Qwen3-Next-80B-A3B-Instruct-AWQ-4bit": {
"ctx": "24576",
"trust_remote": true,
"valid_tp": [2],
"max_num_seqs": "32",
"max_tokens": "16384",
"gpu_util": "0.98",
"enforce_eager": false,
"env": {"VLLM_USE_TRITON_AWQ": "1"},
"tool_call_parser": "qwen3_xml",
"hf_model_id": "cpatonn/Qwen3-Next-80B-A3B-Instruct-AWQ-4bit"
},
"gemma-3-27b-it-FP8-dynamic": {
"ctx": "29000",
"trust_remote": true,
"valid_tp": [2],
"max_num_seqs": "32",
"max_tokens": "29000",
"gpu_util": "0.94",
"hf_model_id": "RedHatAI/gemma-3-27b-it-FP8-dynamic"
},
"gemma-3-12b-it-FP8-dynamic": {
"ctx": "9900",
"trust_remote": true,
"valid_tp": [1, 2],
"max_num_seqs": "64",
"max_tokens": "9900",
"gpu_util": "0.98",
"hf_model_id": "RedHatAI/gemma-3-12b-it-FP8-dynamic"
},
"DeepSeek-R1-Distill-Qwen-14B": {
"ctx": "32768",
"trust_remote": true,
"valid_tp": [1],
"max_num_seqs": "64",
"max_tokens": "32768",
"gpu_util": "0.98",
"hf_model_id": "deepseek-ai/DeepSeek-R1-Distill-Qwen-14B"
},
"DeepSeek-R1-Distill-Qwen-32B-AWQ": {
"ctx": "24576",
"trust_remote": true,
"valid_tp": [1, 2],
"max_num_seqs": "64",
"max_tokens": "32768",
"gpu_util": "0.98",
"hf_model_id": "deepseek-ai/DeepSeek-R1-Distill-Qwen-32B-AWQ"
},
"GLM-4.7-Flash-AWQ": {
"ctx": "32768",
"trust_remote": true,
"valid_tp": [1, 2],
"max_num_seqs": "64",
"max_tokens": "32768",
"gpu_util": "0.98",
"hf_model_id": "THUDM/GLM-4.7-Flash-AWQ"
},
"Qwen3.5-35B-A3B-GPTQ-Int4": {
"ctx": "32768",
"trust_remote": true,
"valid_tp": [1, 2],
"max_num_seqs": "64",
"max_tokens": "32768",
"gpu_util": "0.98",
"hf_model_id": "Qwen/Qwen3.5-35B-A3B-GPTQ-Int4"
},
"Qwen3-Omni-30B-A3B-Instruct-AWQ-4bit": {
"ctx": "24576",
"trust_remote": true,
"valid_tp": [1, 2],
"max_num_seqs": "64",
"max_tokens": "32768",
"gpu_util": "0.98",
"hf_model_id": "Qwen/Qwen3-Omni-30B-A3B-Instruct-AWQ-4bit"
}
}
}