Nhận dạng giọng nói Whisper nhanh hơn, có dấu thời gian chuẩn từng từ và phân biệt người nói.
WhisperX nâng cấp Whisper với tốc độ nhanh hơn nhiều lần, căn dấu thời gian chính xác đến từng từ và phân biệt ai đang nói (speaker diarization). Nhờ đó transcript không chỉ đúng chữ mà còn đúng mốc giờ và đúng người. Rất hợp để làm phụ đề và bóc băng chuyên nghiệp.
Chuyển giọng thành chữ, chữ thành giọng, nhân bản voice & tách nhạc.
Các bước cơ bản để bắt đầu.
Cài `pip install whisperx`Chạy `whisperx audio.mp3 --diarize` (cần token HF cho diarization)Lấy file transcript/SRT ở thư mục đầu raNhận dạng & chuyển giọng nói thành văn bản đa ngôn ngữ, độ chính xác cao; làm phụ đề, biên bản họp.
Nhân bản giọng từ vài giây mẫu rồi đọc văn bản bất kỳ gần như tức thì — dự án voice-clone kinh điển.
Nhân bản giọng chất lượng cao chỉ từ 1 phút dữ liệu, hỗ trợ cross-lingual, giao diện huấn luyện trọn gói.