← назад

axiaisacat — 01-06-2026

1 твитов за сутки. Автор описывает переход от традиционного процесса записи голоса к генерации звука через текстовые промпты с помощью новой модели.

VoxCPM2 — модель для синтеза речи, позволяющая задавать характеристики голоса (возраст, темп, эмоции) одним предложением без необходимости референсных аудиофайлов; также поддерживает клонирование по короткому фрагменту, работает на 30 языках, выдает звук в 48kHz и распространяется под Apache лицензией с открытым исходным кодом VoxCPM2.

Источники