Tencent выпустила универсальную модель для работы с речью на 1,5 млрд параметров
Tencent и Шанхайский университет запустили AuK — открытую базовую модель для генерации и редактирования речи с 1,5 млрд параметров. Модель поддерживает пять типов задач: синтез речи с клонированием голоса, редактирование содержания, управление акустикой, работу с паралингвистикой и очистку аудио. На входе модель принимает текстовый запрос и опциональное исходное аудио, на выходе выдаёт готовый звук.
Пока поддерживаются только китайский и английский языки. По тестам Tencent, AuK лидирует на бенчмарке Seed-TTS-Eval по разборчивости речи.
Источник: Machinelearning
Что мы знаем о компании
Tencent
Новости этого рынка выходят у нас в телеграме первыми — @wikipulse.