Máy chủ suy luận LLM tốc độ cao, thông lượng lớn — phục vụ model ở quy mô sản xuất.
vLLM là engine phục vụ mô hình được thiết kế cho thông lượng cực cao nhờ kỹ thuật PagedAttention quản lý bộ nhớ thông minh. Nó xử lý nhiều yêu cầu song song mượt mà và cung cấp API tương thích OpenAI. Đây là lựa chọn khi bạn cần phục vụ AI cho nhiều người dùng cùng lúc mà vẫn nhanh.
Tải & chạy các mô hình LLM ngay trên máy bạn — trái tim cấp trí tuệ cho cả nhà máy.
Các bước cơ bản để bắt đầu.
Cài `pip install vllm` (máy có GPU CUDA)Chạy `vllm serve <tên-model>` để bật serverGọi qua endpoint OpenAI `http://localhost:8000/v1`Tải & chạy LLM (Llama, Mistral, Qwen…) cục bộ chỉ bằng một lệnh; có API tương thích OpenAI.
Chạy LLM cực nhẹ trên CPU/GPU thường, kể cả máy yếu; nền tảng cho hầu hết công cụ chạy AI cục bộ.