A 7 billion parameter text-to-speech model for high-quality expressive voice generation.
No lifecycle dates recorded.