Model nối ảnh với chữ của OpenAI — nền tảng để tìm ảnh bằng mô tả, phân loại zero-shot, hướng dẫn tạo ảnh.
CLIP học cách đặt ảnh và văn bản vào cùng một không gian, nhờ đó so khớp 'ảnh này hợp với mô tả nào' mà không cần huấn luyện riêng cho từng lớp. Nó là nền tảng cho tìm ảnh bằng chữ, phân loại zero-shot và điều hướng nhiều model tạo ảnh. Là một trong các model đa phương thức ảnh hưởng nhất.
Tạo, chỉnh, phục hồi & tách vật thể trong ảnh — cả phòng thiết kế trong một máy.
Các bước cơ bản để bắt đầu.
Cài `pip install git+https://github.com/openai/CLIP.git`Nạp model `clip.load('ViT-B/32')`Encode ảnh & chữ rồi so khớp bằng cosine similarityGiao diện web đầy đủ nhất để tạo ảnh bằng Stable Diffusion: txt2img, img2img, inpaint, LoRA.
Thư viện thị giác máy tính số 1 — xử lý ảnh/video, phát hiện vật thể, nền tảng cho mọi tool hình ảnh.