Model nền thị giác tự giám sát của Meta — trích đặc trưng ảnh mạnh cho tìm kiếm, phân loại, phân đoạn.
DINOv2 là họ model nền (foundation) cho thị giác, huấn luyện tự giám sát không cần nhãn, cho ra biểu diễn đặc trưng ảnh rất mạnh. Những đặc trưng này dùng được ngay cho phân loại, phân đoạn, ước lượng chiều sâu, tìm ảnh tương tự mà ít/không cần fine-tune. Là 'bộ trích đặc trưng' đa dụng cho ảnh.
Tạo, chỉnh, phục hồi & tách vật thể trong ảnh — cả phòng thiết kế trong một máy.
Các bước cơ bản để bắt đầu.
Clone repo hoặc nạp qua `torch.hub`Tải backbone DINOv2 phù hợpTrích embedding ảnh rồi dùng cho tác vụ hạ nguồnGiao diện web đầy đủ nhất để tạo ảnh bằng Stable Diffusion: txt2img, img2img, inpaint, LoRA.
Thư viện thị giác máy tính số 1 — xử lý ảnh/video, phát hiện vật thể, nền tảng cho mọi tool hình ảnh.