Chạy LLM cực nhẹ trên CPU/GPU thường, kể cả máy yếu; nền tảng cho hầu hết công cụ chạy AI cục bộ.
llama.cpp là engine chạy mô hình ngôn ngữ được tối ưu C/C++ để nhẹ và nhanh nhất có thể. Nó cho phép chạy các model lớn trên máy tính thường, thậm chí CPU, nhờ kỹ thuật lượng tử hoá (quantization) định dạng GGUF. Đây là 'động cơ' nằm dưới Ollama, LM Studio và rất nhiều công cụ AI cục bộ khác.
Tải & chạy các mô hình LLM ngay trên máy bạn — trái tim cấp trí tuệ cho cả nhà máy.
Các bước cơ bản để bắt đầu.
Clone repo và build bằng `cmake -B build && cmake --build build`Tải model .gguf (ví dụ từ Hugging Face)Chạy `./llama-cli -m model.gguf -p "Xin chào"`Hoặc bật server: `./llama-server -m model.gguf`Tải & chạy LLM (Llama, Mistral, Qwen…) cục bộ chỉ bằng một lệnh; có API tương thích OpenAI.
Ứng dụng desktop chạy chatbot AI hoàn toàn offline, riêng tư, không cần internet hay GPU khủng.
Thư viện gọi nhiều mô hình AI qua các nguồn khác nhau; dùng để thử nghiệm, học tập.