АНАЛИЗ РЕЧЕВОГО ПАТТЕРНА КОМИКА КАК ОСНОВА ПРОГНОЗНОЙ МОДЕЛИ ДЛЯ СИНТЕЗА РЕПЛИК В ЗАДАЧАХ ПОСТОБРАБОТКИ КОМЕДИЙНЫХ ВЫСТУПЛЕНИЙ
Главная статья
Аннотация
В статье рассматривается задача синтеза речи, имитирующей уникальный речевой паттерн комика, с целью повышения эффективности постобработки стендап-выступлений. Предложен пайплайн, включающий сегментацию аудио, извлечение акустических признаков и голосовых эмбеддингов, а также обучение прогнозной модели на архитектуре прямого прогнозирования длительностей без механизма внимания. Эксперимент проведён на 60 минутах аудиоматериала (около 900 реплик). Показано, что предложенная система способна генерировать разборчивую речь с узнаваемым тембром, однако качество синтеза ограничено «сглаживанием» просодических контуров и монотонностью интонации. Сделан вывод о принципиальной работоспособности подхода и необходимости усложнения модели для передачи полного речевого паттерна артиста комедийного жанра.
Подробнее

Это произведение доступно по лицензии Creative Commons «Attribution-NonCommercial-ShareAlike» («Атрибуция — Некоммерческое использование — На тех же условиях») 4.0 Всемирная.
Неисключительные права на статью передаются журналу в полном соответствии с Лицензией Creative Commons By-NC-SA 4.0 (Международная)