Engine phục vụ LLM/VLM tốc độ cao với RadixAttention — thông lượng lớn cho model ngôn ngữ & đa phương thức.
SGLang là framework phục vụ model nhanh, nổi bật với kỹ thuật RadixAttention giúp tái dùng bộ nhớ đệm hiệu quả giữa các yêu cầu có phần chung. Nó phục vụ cả model ngôn ngữ và model đa phương thức (ảnh/âm thanh) với API kiểu OpenAI. Được dùng ở quy mô sản xuất cho tải lớn.
Tải & chạy các mô hình LLM ngay trên máy bạn — trái tim cấp trí tuệ cho cả nhà máy.
Các bước cơ bản để bắt đầu.
Cài `pip install "sglang[all]"` (máy có GPU)Chạy `python -m sglang.launch_server --model-path <model>`Gọi qua endpoint OpenAI ở cổng serverTải & chạy LLM (Llama, Mistral, Qwen…) cục bộ chỉ bằng một lệnh; có API tương thích OpenAI.
Chạy LLM cực nhẹ trên CPU/GPU thường, kể cả máy yếu; nền tảng cho hầu hết công cụ chạy AI cục bộ.