Máy chủ suy luận LLM cấp sản xuất của Hugging Face — tối ưu tốc độ, chịu tải, dễ triển khai.
Text Generation Inference (TGI) là bộ phục vụ model được Hugging Face tối ưu cho môi trường production: batching liên tục, tensor parallelism, lượng tử hoá và streaming token. Nó cung cấp API ổn định và container dựng sẵn để triển khai nhanh. Đây là 'động cơ' phía sau nhiều dịch vụ suy luận của HF.
Tải & chạy các mô hình LLM ngay trên máy bạn — trái tim cấp trí tuệ cho cả nhà máy.
Các bước cơ bản để bắt đầu.
Chạy Docker image `ghcr.io/huggingface/text-generation-inference`Truyền `--model-id <tên-model>` khi khởi chạyGọi endpoint `/generate` hoặc API kiểu OpenAITải & chạy LLM (Llama, Mistral, Qwen…) cục bộ chỉ bằng một lệnh; có API tương thích OpenAI.
Chạy LLM cực nhẹ trên CPU/GPU thường, kể cả máy yếu; nền tảng cho hầu hết công cụ chạy AI cục bộ.