This commit is contained in:
2026-03-30 03:29:24 +08:00
parent 10925e742b
commit 1a61a7bb17
5 changed files with 15 additions and 4 deletions
+2
View File
@@ -17,6 +17,7 @@ class Settings(BaseModel):
port: int = 8000
openai_host: str = "0.0.0.0"
openai_port: int = 8001
vllm_openai_internal_url: str = "http://127.0.0.1:8001/v1"
public_model_name: str = "Qwen_local_model"
reasoning_enabled: bool = False
model_root: str = "/opt/model"
@@ -46,6 +47,7 @@ def get_settings() -> Settings:
port=runtime["port"],
openai_host=runtime["openai_host"],
openai_port=runtime["openai_port"],
vllm_openai_internal_url=runtime["vllm_openai_internal_url"],
public_model_name=runtime["public_model_name"],
reasoning_enabled=runtime["reasoning_enabled"],
model_root=runtime["model_root"],
+2
View File
@@ -25,6 +25,8 @@ class InferenceEngine:
}
if req.stop:
payload["stop"] = req.stop
if req.enable_thinking is not None:
payload["chat_template_kwargs"] = {"enable_thinking": req.enable_thinking}
response = self.client.post(
f"{self.settings.vllm_openai_internal_url}/chat/completions",
headers=headers,
+6 -1
View File
@@ -63,11 +63,16 @@ def resolve_runtime_settings(content: dict[str, Any]) -> dict[str, Any]:
api_service = dict(services.get("api", {}))
openai_service = dict(services.get("openai", {}))
models = dict(content.get("models", {}))
openai_port = _to_int(openai_service.get("port"), 8001)
internal_url = _to_str(content.get("vllm_openai_internal_url"))
if not internal_url:
internal_url = f"http://127.0.0.1:{openai_port}/v1"
return {
"host": str(api_service.get("host", "0.0.0.0")),
"port": _to_int(api_service.get("port"), 8000),
"openai_host": str(openai_service.get("host", "0.0.0.0")),
"openai_port": _to_int(openai_service.get("port"), 8001),
"openai_port": openai_port,
"vllm_openai_internal_url": internal_url.rstrip("/"),
"public_model_name": _to_str(content.get("public_model_name"), "Qwen_local_model"),
"api_key": str(content.get("api_key", "")).strip() or None,
"reasoning_enabled": _to_bool(content.get("reasoning_enabled"), False),
+1
View File
@@ -10,6 +10,7 @@ class GenerateRequest(BaseModel):
top_p: float = Field(default=0.95, gt=0.0, le=1.0)
repetition_penalty: float = Field(default=1.0, ge=0.5, le=2.0)
stop: Optional[List[str]] = None
enable_thinking: Optional[bool] = None
class GenerateResponse(BaseModel):