State-of-the-art text-to-speech cho 600+ ngôn ngữ — Voice Clone (nhân bản giọng từ audio tham chiếu)
và Voice Design (thiết kế giọng theo thuộc tính). Model OmniVoice
của Xiaomi Next-gen Kaldi, GPU qua Hugging Face ZeroGPU.
Chưa chọn — khuyến nghị 3–10 giây giọng mẫu
Recommended: 3–10 seconds audio.
Kết hợp design attribute cùng giọng clone (bản Space mới hỗ trợ).