Nhân bản giọng chất lượng cao chỉ từ 1 phút dữ liệu, hỗ trợ cross-lingual, giao diện huấn luyện trọn gói.
GPT-SoVITS cho phép tạo và nhân bản giọng rất giống chỉ từ vài giây tới một phút mẫu (zero/few-shot). Nó hỗ trợ đọc xuyên ngôn ngữ và kèm giao diện trọn gói từ xử lý dữ liệu, huấn luyện đến suy luận. Là một trong các công cụ voice-clone mã nguồn mở mạnh và phổ biến nhất.
Chuyển giọng thành chữ, chữ thành giọng, nhân bản voice & tách nhạc.
Các bước cơ bản để bắt đầu.
Tải bản đóng gói hoặc clone repo, cài phụ thuộcMở WebUI, nạp mẫu giọng & xử lý dữ liệuHuấn luyện (nếu cần) rồi sinh audio từ văn bảnNhận dạng & chuyển giọng nói thành văn bản đa ngôn ngữ, độ chính xác cao; làm phụ đề, biên bản họp.
Nhân bản giọng từ vài giây mẫu rồi đọc văn bản bất kỳ gần như tức thì — dự án voice-clone kinh điển.