Синтез речи — что это такое и как работает
Люди ежедневно используют самых разных виртуальных ассистентов. Из-за их популярности синтез речи давно относится к технологиям, постоянно привлекающим интерес разработчиков. Однако, применять архитектуры нейросетей и известные методы недостаточно. В нашей статье кратко расскажем, как работает технология, где используется и какие особенности характерны для нее.
Сферы применения синтеза речи
Рассмотрим часто встречающиеся варианты использования синтеза речи.
- Мобильные приложения. Голосовой помощник может зачитывать статьи, обзоры, пуш-уведомления, сообщения и помогать с навигацией.
- Колл-центры. В лидирующих компаниях уже 2–3 года ответы на звонки клиентов роботизированы. Умные голосовые помощники детально разбираются в вопросе и, соответственно, быстрее удовлетворяют потребности звонящего. Для бизнеса это выгодное решение из-за адекватной стоимости: не нужно держать в штате или на фрилансе операторов.
- Гаджеты. Все знакомы с Siri, Google Assistant и Alexa. Вы им — команду, а они вам — ответ. Поддерживают множество функций. Иногда пытаются шутить и подкалывать, получается неплохо.
Принцип работы синтеза речи
Выражать эмоции по-разному и использовать отличающиеся интонации нам позволяют голосовые связки. Нейросеть должна уметь имитировать их. Для этого в SberDevices решили использовать вокодер — синтезатор речи с богатым спектром. Но зачитывать буквы мало. Устройству нужно было научиться правильно расставлять паузы и ударения на значимые слова. С помощью языковой модели BERT архитектуре пришлось освоить контекст и смысл слов. Такой комплекс мер по улучшению продукта позволяет выпускать обученных на высоком уровне и приятных на слух голосовых ассистентов.
Особенности обучения и применения синтеза речи
- Для обучения устройства еще нужны студийные записи дикторов.
- Над голосом виртуального ассистента работает большая команда специалистов: войс-коучи, разметчики, дата-сайентисты, разработчики, аналитики.
- Невозможно угодить всем пользователям: одни хотят естественный по звучанию синтез, а другие — похожий на робота, чтобы отличать машину от человека.
Технологии развиваются каждый день. В ближайшем будущем появятся не только встроенные синтезаторы речи, но и отдельные приложения, через которые пользователь за пару часов или даже минут услышит свой голос в машинном исполнении.
Смотрите также: Топ 100 лучших постов.
А вы знали, что у нас есть Telegram?
Подписывайтесь, если вы ценитель красивых фото и интересных историй!
22 эпичных фейла с гаджетами и прочей электроникой
40 невероятно драматичных котиков, у которых почему-то еще нет "Оскара"
Её первое фото купили за миллионы. В 20 лет она пришла на кастинг — и никто не знал, чья о ...
Главный гаджет СССР: Что еще умела "Электроника ИМ-02", кроме как ловить волком яйца
Ацтекский "свисток смерти" - жуткое изобретение исчезнувшей цивилизации
Любовь до гроба: трагическая история арабской принцессы, которую казнили из-за любви
Любовь втроем: 7 фильмов о нестандартных отношениях
Раз и на всю жизнь! 22 фото вещей, которые прошли испытание временем
История Марты Мейсон — женщины, которая прожила 60 лет в капсуле
Куба в 1990-е годы на снимках Триа Джован
