Thư viện fine-tune tiết kiệm tham số (LoRA, QLoRA…) của Hugging Face — tinh chỉnh model lớn trên GPU nhỏ.
PEFT (Parameter-Efficient Fine-Tuning) cho phép tinh chỉnh model lớn mà chỉ huấn luyện một phần nhỏ tham số (qua LoRA, QLoRA, prefix-tuning…), nhờ đó tiết kiệm bộ nhớ và chi phí rất nhiều. Nó tích hợp mượt với thư viện Transformers nên dễ áp dụng. Đây là cách phổ biến nhất để fine-tune model trên phần cứng phổ thông.
Tải & chạy các mô hình LLM ngay trên máy bạn — trái tim cấp trí tuệ cho cả nhà máy.
Các bước cơ bản để bắt đầu.
Cài `pip install peft transformers accelerate`Bọc model bằng `get_peft_model(model, LoraConfig(...))`Huấn luyện như bình thường rồi lưu adapterTải & chạy LLM (Llama, Mistral, Qwen…) cục bộ chỉ bằng một lệnh; có API tương thích OpenAI.
Chạy LLM cực nhẹ trên CPU/GPU thường, kể cả máy yếu; nền tảng cho hầu hết công cụ chạy AI cục bộ.