TTS & nhân bản giọng đa ngôn ngữ chất lượng cao, clone giọng chỉ từ vài giây mẫu.
Fish Speech là hệ text-to-speech đa ngôn ngữ mạnh, hỗ trợ nhân bản giọng (voice cloning) từ một đoạn mẫu ngắn. Nó cho chất lượng giọng tự nhiên, độ trễ thấp và có cả bản phục vụ (serving) để triển khai. Hợp để tạo giọng thương hiệu nhất quán trên nhiều ngôn ngữ.
Chuyển giọng thành chữ, chữ thành giọng, nhân bản voice & tách nhạc.
Các bước cơ bản để bắt đầu.
Clone repo, cài phụ thuộc theo READMETải checkpoint model được cung cấpChạy webui/ API, nạp mẫu giọng rồi sinh audioNhận dạng & chuyển giọng nói thành văn bản đa ngôn ngữ, độ chính xác cao; làm phụ đề, biên bản họp.
Nhân bản giọng từ vài giây mẫu rồi đọc văn bản bất kỳ gần như tức thì — dự án voice-clone kinh điển.
Nhân bản giọng chất lượng cao chỉ từ 1 phút dữ liệu, hỗ trợ cross-lingual, giao diện huấn luyện trọn gói.