Định dạng dữ liệu cột trong bộ nhớ chuẩn chung — nền tảng tốc độ cho pandas, Polars, DuckDB, Spark.
Apache Arrow định nghĩa một định dạng dữ liệu cột (columnar) trong bộ nhớ dùng chung giữa nhiều công cụ, giúp truyền dữ liệu giữa các hệ thống mà không phải sao chép/chuyển đổi tốn kém. Nhờ Arrow, các thư viện như Polars, DuckDB, pandas, Spark trao đổi dữ liệu cực nhanh. Nó còn kèm định dạng file Parquet/Feather và engine tính toán.
Cơ sở dữ liệu, xử lý & trực quan hoá dữ liệu — biến số liệu thô thành quyết định.
Các bước cơ bản để bắt đầu.
Cài `pip install pyarrow`Đọc/ghi Parquet: `pyarrow.parquet.write_table(...)`Dùng gián tiếp qua Polars/DuckDB/pandasKho dữ liệu in-memory siêu nhanh: cache, hàng đợi, session, pub/sub — tăng tốc mọi ứng dụng.
Nền tảng BI mã nguồn mở: tạo biểu đồ & dashboard tương tác từ mọi database SQL, không cần code.