Files
amd-r9700-vllm-toolboxes/benchmarks/benchmark_results_nvidia-3090/RedHatAI_Llama-3.1-8B-Instruct-FP8-block_tp1_server.log
T

96 lines
9.6 KiB
Plaintext
Raw Normal View History

2026-03-26 20:50:00 +08:00
WARNING 12-10 09:53:36 [argparse_utils.py:195] With `vllm serve`, you should provide the model as a positional argument or in a config file instead of via the `--model` option. The `--model` option will be removed in v0.13.
(APIServer pid=4288) INFO 12-10 09:53:36 [api_server.py:1772] vLLM API server version 0.12.0
(APIServer pid=4288) INFO 12-10 09:53:36 [utils.py:253] non-default args: {'model_tag': 'RedHatAI/Llama-3.1-8B-Instruct-FP8-block', 'host': '127.0.0.1', 'model': 'RedHatAI/Llama-3.1-8B-Instruct-FP8-block', 'trust_remote_code': True, 'max_model_len': 65536, 'gpu_memory_utilization': 0.95, 'max_num_seqs': 64}
(APIServer pid=4288) The argument `trust_remote_code` is to be used with Auto classes. It has no effect here and is ignored.
(APIServer pid=4288) INFO 12-10 09:53:47 [model.py:637] Resolved architecture: LlamaForCausalLM
(APIServer pid=4288) INFO 12-10 09:53:47 [model.py:1750] Using max model len 65536
(APIServer pid=4288) INFO 12-10 09:53:47 [scheduler.py:228] Chunked prefill is enabled with max_num_batched_tokens=2048.
(APIServer pid=4288) Traceback (most recent call last):
(APIServer pid=4288) File "/venv/main/lib/python3.12/site-packages/huggingface_hub/utils/_http.py", line 409, in hf_raise_for_status
(APIServer pid=4288) response.raise_for_status()
(APIServer pid=4288) File "/venv/main/lib/python3.12/site-packages/requests/models.py", line 1026, in raise_for_status
(APIServer pid=4288) raise HTTPError(http_error_msg, response=self)
(APIServer pid=4288) requests.exceptions.HTTPError: 503 Server Error: Service Temporarily Unavailable for url: https://huggingface.co/api/models/RedHatAI/Llama-3.1-8B-Instruct-FP8-block
(APIServer pid=4288)
(APIServer pid=4288) The above exception was the direct cause of the following exception:
(APIServer pid=4288)
(APIServer pid=4288) Traceback (most recent call last):
(APIServer pid=4288) File "/venv/main/bin/vllm", line 7, in <module>
(APIServer pid=4288) sys.exit(main())
(APIServer pid=4288) ^^^^^^
(APIServer pid=4288) File "/venv/main/lib/python3.12/site-packages/vllm/entrypoints/cli/main.py", line 73, in main
(APIServer pid=4288) args.dispatch_function(args)
(APIServer pid=4288) File "/venv/main/lib/python3.12/site-packages/vllm/entrypoints/cli/serve.py", line 60, in cmd
(APIServer pid=4288) uvloop.run(run_server(args))
(APIServer pid=4288) File "/venv/main/lib/python3.12/site-packages/uvloop/__init__.py", line 96, in run
(APIServer pid=4288) return __asyncio.run(
(APIServer pid=4288) ^^^^^^^^^^^^^^
(APIServer pid=4288) File "/venv/main/lib/python3.12/asyncio/runners.py", line 195, in run
(APIServer pid=4288) return runner.run(main)
(APIServer pid=4288) ^^^^^^^^^^^^^^^^
(APIServer pid=4288) File "/venv/main/lib/python3.12/asyncio/runners.py", line 118, in run
(APIServer pid=4288) return self._loop.run_until_complete(task)
(APIServer pid=4288) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
(APIServer pid=4288) File "uvloop/loop.pyx", line 1518, in uvloop.loop.Loop.run_until_complete
(APIServer pid=4288) File "/venv/main/lib/python3.12/site-packages/uvloop/__init__.py", line 48, in wrapper
(APIServer pid=4288) return await main
(APIServer pid=4288) ^^^^^^^^^^
(APIServer pid=4288) File "/venv/main/lib/python3.12/site-packages/vllm/entrypoints/openai/api_server.py", line 1819, in run_server
(APIServer pid=4288) await run_server_worker(listen_address, sock, args, **uvicorn_kwargs)
(APIServer pid=4288) File "/venv/main/lib/python3.12/site-packages/vllm/entrypoints/openai/api_server.py", line 1838, in run_server_worker
(APIServer pid=4288) async with build_async_engine_client(
(APIServer pid=4288) ^^^^^^^^^^^^^^^^^^^^^^^^^^
(APIServer pid=4288) File "/venv/main/lib/python3.12/contextlib.py", line 210, in __aenter__
(APIServer pid=4288) return await anext(self.gen)
(APIServer pid=4288) ^^^^^^^^^^^^^^^^^^^^^
(APIServer pid=4288) File "/venv/main/lib/python3.12/site-packages/vllm/entrypoints/openai/api_server.py", line 183, in build_async_engine_client
(APIServer pid=4288) async with build_async_engine_client_from_engine_args(
(APIServer pid=4288) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
(APIServer pid=4288) File "/venv/main/lib/python3.12/contextlib.py", line 210, in __aenter__
(APIServer pid=4288) return await anext(self.gen)
(APIServer pid=4288) ^^^^^^^^^^^^^^^^^^^^^
(APIServer pid=4288) File "/venv/main/lib/python3.12/site-packages/vllm/entrypoints/openai/api_server.py", line 224, in build_async_engine_client_from_engine_args
(APIServer pid=4288) async_llm = AsyncLLM.from_vllm_config(
(APIServer pid=4288) ^^^^^^^^^^^^^^^^^^^^^^^^^^
(APIServer pid=4288) File "/venv/main/lib/python3.12/site-packages/vllm/v1/engine/async_llm.py", line 223, in from_vllm_config
(APIServer pid=4288) return cls(
(APIServer pid=4288) ^^^^
(APIServer pid=4288) File "/venv/main/lib/python3.12/site-packages/vllm/v1/engine/async_llm.py", line 114, in __init__
(APIServer pid=4288) tokenizer = init_tokenizer_from_config(self.model_config)
(APIServer pid=4288) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
(APIServer pid=4288) File "/venv/main/lib/python3.12/site-packages/vllm/tokenizers/registry.py", line 227, in init_tokenizer_from_config
(APIServer pid=4288) return get_tokenizer(
(APIServer pid=4288) ^^^^^^^^^^^^^^
(APIServer pid=4288) File "/venv/main/lib/python3.12/site-packages/vllm/tokenizers/registry.py", line 191, in get_tokenizer
(APIServer pid=4288) tokenizer = TokenizerRegistry.get_tokenizer(
(APIServer pid=4288) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
(APIServer pid=4288) File "/venv/main/lib/python3.12/site-packages/vllm/tokenizers/registry.py", line 86, in get_tokenizer
(APIServer pid=4288) return item.from_pretrained(*args, **kwargs)
(APIServer pid=4288) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
(APIServer pid=4288) File "/venv/main/lib/python3.12/site-packages/vllm/tokenizers/hf.py", line 84, in from_pretrained
(APIServer pid=4288) tokenizer = AutoTokenizer.from_pretrained(
(APIServer pid=4288) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
(APIServer pid=4288) File "/venv/main/lib/python3.12/site-packages/transformers/models/auto/tokenization_auto.py", line 1156, in from_pretrained
(APIServer pid=4288) return tokenizer_class.from_pretrained(pretrained_model_name_or_path, *inputs, **kwargs)
(APIServer pid=4288) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
(APIServer pid=4288) File "/venv/main/lib/python3.12/site-packages/transformers/tokenization_utils_base.py", line 2113, in from_pretrained
(APIServer pid=4288) return cls._from_pretrained(
(APIServer pid=4288) ^^^^^^^^^^^^^^^^^^^^^
(APIServer pid=4288) File "/venv/main/lib/python3.12/site-packages/transformers/tokenization_utils_base.py", line 2395, in _from_pretrained
(APIServer pid=4288) tokenizer = cls._patch_mistral_regex(
(APIServer pid=4288) ^^^^^^^^^^^^^^^^^^^^^^^^^
(APIServer pid=4288) File "/venv/main/lib/python3.12/site-packages/transformers/tokenization_utils_base.py", line 2438, in _patch_mistral_regex
(APIServer pid=4288) if _is_local or is_base_mistral(pretrained_model_name_or_path):
(APIServer pid=4288) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
(APIServer pid=4288) File "/venv/main/lib/python3.12/site-packages/transformers/tokenization_utils_base.py", line 2432, in is_base_mistral
(APIServer pid=4288) model = model_info(model_id)
(APIServer pid=4288) ^^^^^^^^^^^^^^^^^^^^
(APIServer pid=4288) File "/venv/main/lib/python3.12/site-packages/huggingface_hub/utils/_validators.py", line 114, in _inner_fn
(APIServer pid=4288) return fn(*args, **kwargs)
(APIServer pid=4288) ^^^^^^^^^^^^^^^^^^^
(APIServer pid=4288) File "/venv/main/lib/python3.12/site-packages/huggingface_hub/hf_api.py", line 2638, in model_info
(APIServer pid=4288) hf_raise_for_status(r)
(APIServer pid=4288) File "/venv/main/lib/python3.12/site-packages/huggingface_hub/utils/_http.py", line 482, in hf_raise_for_status
(APIServer pid=4288) raise _format(HfHubHTTPError, str(e), response) from e
(APIServer pid=4288) huggingface_hub.errors.HfHubHTTPError: 503 Server Error: Service Temporarily Unavailable for url: https://huggingface.co/api/models/RedHatAI/Llama-3.1-8B-Instruct-FP8-block