Разработчики: | |
Дата последнего релиза: | декабрь 2017 г |
Отрасли: | Интернет-сервисы |
Технологии: | Речевые технологии |
2017: Разработка алгоритма Tacotron 2
В конце декабря 2017 года компания Google анонсировала систему синтеза речи, которая способна преобразовывать текст в речь, максимально приближенную к человеческой. Алгоритм получил название Tacotron 2.
Система способна читать любые предложения, игнорировать грамматические ошибки и менять тональность речи. Алгоритм говорит пока только на английском
Отмечается, что Tacotron 2 использует контекст, чтобы произносить абсолютно одинаковые слова. Он также реагирует на пунктуационные правила в тексте, а также может подчеркивать конкретные слова. Технология способна различить разные формы глагола или определить, выполняет ли слово роль глагола или существительного.
Google давно занимается технологиями синтеза речи при помощи искусственного интеллекта. В 2016 году компания представила синтезатор, звучащий близко к человеческой речи. Он использует ИИ-систему WaveNet, которая обучается соответствию текста определенным формам колебаний волны и затем на основании этой базы знаний формирует из текстовых отрывков отдельные звуковые волны.
Tacotron 2 подключили к нейросети WaveNet, которая создает необходимые звуки на основе данных из другой системы глубинного обучения, которая преобразовывает текст в спектрограмму (изображает аудиочастоты в зависимости от времени).TAdviser выпустил новую Карту «Цифровизация ритейла»: 280 разработчиков и поставщиков услуг
В Google отмечают, что в целом Tacotron 2 работает отлично, но все-таки испытывает сложности с произношением некоторых сложных слов, а также иногда случайным образом выдает странные шумы. Кроме того, система не способна работать в реальном времени, и авторам пока не удается взять движок под контроль, то есть задать ему нужную интонацию, например, счастливый или грустный голос.
Как полагают разработчики Tacotron 2, алгоритм может быть использован для улучшения работы голосовых помощников, которые получают все более широкое распространение.[1]
Примечания
Подрядчики-лидеры по количеству проектов
Группа компаний ЦРТ (Центр речевых технологий) (45)
МТС Exolve (Межрегиональный ТранзитТелеком, МТТ) (29)
Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (27)
SteadyControl (18)
Naumen (Наумен консалтинг) (15)
Другие (196)
Группа компаний ЦРТ (Центр речевых технологий) (5)
Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (4)
SteadyControl (4)
3iTech (ранее 3i Technologies) (2)
Naumen (Наумен консалтинг) (2)
Другие (17)
МТС Exolve (Межрегиональный ТранзитТелеком, МТТ) (12)
Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (7)
Naumen (Наумен консалтинг) (3)
Voice Systems Robotics (VSR, VS Robotics) (3)
SteadyControl (2)
Другие (14)
Распределение вендоров по количеству проектов внедрений (систем, проектов) с учётом партнёров
Группа компаний ЦРТ (Центр речевых технологий) (18, 47)
МТС Exolve (Межрегиональный ТранзитТелеком, МТТ) (4, 30)
Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (12, 29)
SteadyControl HoReCa (1, 23)
SteadyControl (1, 23)
Другие (381, 217)
Группа компаний ЦРТ (Центр речевых технологий) (2, 5)
Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (1, 5)
SteadyControl (1, 4)
SteadyControl HoReCa (1, 4)
SberDevices (СалютДевайсы, ранее СберДевайсы) (2, 2)
Другие (9, 13)
МТС Exolve (Межрегиональный ТранзитТелеком, МТТ) (2, 12)
Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (2, 7)
Naumen (Наумен консалтинг) (1, 3)
SteadyControl (1, 3)
SteadyControl HoReCa (1, 3)
Другие (12, 16)
МТС Exolve (Межрегиональный ТранзитТелеком, МТТ) (1, 9)
Группа компаний ЦРТ (Центр речевых технологий) (4, 7)
Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (2, 7)
SteadyControl (1, 7)
SteadyControl HoReCa (1, 7)
Другие (18, 30)
Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (2, 7)
Сбербанк (3, 5)
SteadyControl HoReCa (1, 5)
SteadyControl (1, 5)
СалютДевайсы (ранее SberDevices) (2, 4)
Другие (25, 39)
Распределение систем по количеству проектов, не включая партнерские решения
МТТ VoiceBox - 24
SteadyControl Система контроля и управления персоналом - 23
BSS Digital2Speech - 21
Voice2Med Система распознавания речи в медицине - 14
Naumen Erudite - 13
Другие 205
BSS Digital2Speech - 5
SteadyControl Система контроля и управления персоналом - 4
Voice2Med Система распознавания речи в медицине - 4
МТТ VoiceBox - 2
Neuro.net Голосовой робот - 2
Другие 11
МТТ VoiceBox - 11
BSS Digital2Speech - 6
SteadyControl Система контроля и управления персоналом - 3
Naumen Erudite - 3
VS Robotics: VS Робот-оператор - 3
Другие 14