@GoogleDeepMind

Выпуск

2 твитов

Google DeepMind представила новые модели преобразования текста в речь Gemini 3.8 Flash TTS и Flash-Lite TTS для создания и масштабного использования настраиваемых голосов. Пользователи могут построчно управлять темпом, эмоциями, смехом и паузами, а сгенерированное аудио маркируется SynthID. Доступ к моделям открыт через Gemini API в Google AI Studio.

Темы: синтез речи · настройка голоса · Gemini API · SynthID

Ключевые твиты