издание о рекламе, маркетинге и коммуникацияхсверено редакцией в архиве 6147 материаловуказатель архива

Теперь можно голосом: ОК запустили сервис распознавания аудиосообщений

В социальной сети Одноклассники появилась функция перевода аудиосообщений в текст. Сервис распознавания аудио автоматически конвертирует голосовое сообщение в текст, позволяя без прослушивания понять, о чем говорит собеседник. Сервис работает на базе искусственного интеллекта и реализован на основе технологии, разработанной ВКонтакте. Запуск стал очередным важным шагом в интеграции ОК и экосистемы VK.

Новый сервис сделает общение в ОК более комфортным в ситуациях, когда прослушать голосовое сообщение невозможно: в общественном транспорте, во время совещания с коллегами или во время просмотра фильма. Технология распознает как полученные, так и отправленные голосовые сообщения на русском языке длительностью до 60 минут. Благодаря этому текст аудиосообщений индексируется поиском по сообщениям, что позволяет легко найти в чате любую информацию, даже отправленную голосом. При ответе на распознанное голосовое сообщение в чате будет отображаться текст исходного сообщения, а не аудио, что поможет ориентироваться в переписке с собеседником. Для распознанных сообщений в списке чатов также отображается текст, а не значок аудиосообщения.

Конвертация голосовых сообщений в текст в ОК полностью автоматизирована: пользователь сразу получает расшифровку без дополнительных действий. ОК также добавили возможность скопировать текст распознанного аудиосообщения. Функцию можно использовать для работы с текстами, которые наговорит собеседник, или конвертации собственных голосовых заметок в текст для дальнейшей работы с ним.

Технология распознавания речи ВКонтакте основана на трех нейросетях: одна отвечает за распознавание, вторая находит подходящие слова, а третья расставляет знаки препинания и заглавные буквы. Для обучения нейросетей используются аудио, которые специально для этой задачи записывают участники программы VK Testers, и база субтитров из фильмов. На конвертацию аудио в текст уходит всего около секунды. Нейросеть распознает русскоязычную речь, при этом в расшифровке учитываются разговорные слова, заимствованная лексика, а также сложные условия записи – например, низкое качество звука или нечеткая речь собеседника. 

Распознавание аудиосообщений автоматически включено у всех пользователей последних версий мобильных приложениях ОК на Android и iOS, а также в десктопной версии соцсети. Отключить новую функцию можно в настройках профиля, в разделе «Сообщения».

ОК постоянно запускают новые форматы для общения и обмена личным контентом. Ранее ОК дали возможность создавать собственные стикеры и мемы с помощью специального конструктора, что поможет пользователям подбирать актуальные для беседы или ситуации изображения даже без навыков владения фоторедакторами.
Реклама

Похожие материалы

Илья Лагутенко стал новым голосом Яндекс.Карт

Лидер группы «Мумий Тролль» Илья Лагутенко озвучил автомобильные маршруты в Яндекс.Картах. Музыкант обыгрывает типичные ситуации на дороге — чаще всего известными цитатами из своих песен.

Олень «Боржоми» заговорил человеческим голосом

Это произошло благодаря технологии дополненной реальности, которую ТМ «Боржоми» презентует в своем новом праздничном приложении “AR Borjomi” для записи уникальных видео-поздравлений. Благодаря ему главный герой с упаковки оживает и разговаривает со зрителем!

В Москве размещена самая большая в мире рекламная поверхность с возможностью распознавания с помощью Shazam

Видеоролик бренда Samsung на видеофасаде здания Гидропроекта (Волоколамское ш., 2,) в Москве стал самым большим в мире изображением, которое можно распознать с помощью мобильного приложения Shazam.

Василий Уткин стал голосом Яндекс.Навигатора

Известный спортивный комментатор, теле- и радиоведущий Василий Уткин стал голосом обновленной версии Яндекс.Навигатора. Она была запущена интернет-компанией в преддверии летних Олимпийских игр 2016 года, которые стартуют в Рио-де-Жанейро уже завтра, 5 августа.

Megogo внедряет технологию распознавания образов в видео

Megogo внедряет технологию распознавания образов в потоковом видео, основанную на компьютерном зрении и нейронных сетях.

В Apple TV появится управление голосом

В новейшем обновлении для tvOS появится управление голосом, сообщает internetua.com со ссылкой на The Verge.

Выпуск ведёт редакция издания. Материал архива мы сверяем с самой публикацией: заголовок, дату и подпись берём из неё, своих чисел не добавляем. Поля, которого в источнике нет, нет и на странице.

Редакционная политика Раскрытие и реклама