Engine xử lý dữ liệu lớn phân tán hàng đầu: tính toán song song trên cụm, hỗ trợ SQL, ML & streaming.
Apache Spark là engine xử lý dữ liệu lớn chạy phân tán trên nhiều máy, nhanh nhờ tính toán trong bộ nhớ. Nó xử lý được batch lẫn streaming, kèm module SQL, machine learning (MLlib) và đồ thị. Với API cho Python (PySpark), Scala, SQL, Spark là lựa chọn kinh điển khi dữ liệu vượt quá khả năng một máy.
Cơ sở dữ liệu, xử lý & trực quan hoá dữ liệu — biến số liệu thô thành quyết định.
Các bước cơ bản để bắt đầu.
Cài `pip install pyspark` để thử cục bộTạo `SparkSession` trong PythonChạy cụm thật bằng Spark trên YARN/Kubernetes khi cầnKho dữ liệu in-memory siêu nhanh: cache, hàng đợi, session, pub/sub — tăng tốc mọi ứng dụng.
Nền tảng BI mã nguồn mở: tạo biểu đồ & dashboard tương tác từ mọi database SQL, không cần code.