#audio
2 items
Repo
huggingface/transformers
Use and train state-of-the-art pretrained models for text, vision, audio, video and multimodal tasks, for both inference and training.
Repo
OpenBMB/VoxCPM
Generate multilingual speech in 30 languages, design new voices from text descriptions, and clone voices from short reference clips.