Transcription
Whisper
The transcription default, in four builds: WhisperX, Faster-Whisper, MLX Whisper and PyTorch Whisper.
- OpenAIBy
- 90+Languages
Can do
- Word timestampsYes. YesTiming for each word, good enough to dub against.
- Speaker labelsNo. NoSays who is speaking.
- Live dictationNo. NoStreams text as you speak.
Languages
Runs on
WhisperX
CTranslate2CUDACPUfaster-whisper plus wav2vec2 forced alignment, for word timing good enough to dub.
Engine docFaster-Whisper
CTranslate2CUDACPUWhisper on CTranslate2 without forced alignment.
Engine docMLX Whisper
MLXApple SiliconCPURuns on the Apple Silicon GPU.
Engine docPyTorch Whisper
PyTorchCUDAApple SiliconCPUThe Whisper build that actually uses AMD ROCm, and the rescue when CTranslate2 fails.
Engine doc
Hardware
| Engine | CUDA | ROCm | Intel Arc | Apple Silicon | Vulkan | NPU | CPU |
|---|---|---|---|---|---|---|---|
| WhisperX | Supported | Not supported | Not supported | Not supported | Not supported | Not supported | Supported |
| Faster-Whisper | Supported | Not supported | Not supported | Not supported | Not supported | Not supported | Supported |
| MLX Whisper | Not supported | Not supported | Not supported | Supported | Not supported | Not supported | Supported |
| PyTorch Whisper | Supported | Not supported | Not supported | Supported | Not supported | Not supported | Supported |
Supported Needs a build Experimental
Licence
- Terms
- Not stated in the app's docs. Check the model card before commercial use.
VoiceStudio is AGPL-3.0 and doesn't relicense model weights. Licence guide
Related
From the VoiceStudio app at 0834c8b. 27 models listed.