Bark preview
bark

Bark

Text-to-audio generation with voice presets

39.1k|stable
from bark import generate_audio, preload_models preload_models() audio = generate_audio("Hello, I'm Bark") # Save or play audio_array
Multilingual speech generation — Generate realistic speech in multiple languages with automatic language detection.
100+ voice presets — Select from speaker presets across supported languages to control tone and accent.
Audio synthesis beyond speech — Generate music, sound effects, and nonverbal communications like laughter.
Long-form generation — Create audio longer than 13 seconds using segmentation techniques.
Bark is a transformer-based text-to-audio model that generates realistic multilingual speech plus music and sound effects. It includes 100+ voice presets and works with GPU/CPU acceleration. MIT-licensed for commercial use.
Python 3.9+. GPU with 4GB+ VRAM recommended, CPU inference supported with speed tradeoffs.
Source on GitHub
pavilion