axiaisacat — 01-06-2026
1 твитов за сутки. Автор описывает переход от традиционного процесса записи голоса к генерации звука через текстовые промпты с помощью новой модели.
VoxCPM2 — модель для синтеза речи, позволяющая задавать характеристики голоса (возраст, темп, эмоции) одним предложением без необходимости референсных аудиофайлов; также поддерживает клонирование по короткому фрагменту, работает на 30 языках, выдает звук в 48kHz и распространяется под Apache лицензией с открытым исходным кодом VoxCPM2.