Логотип
Баннер в шапке 1
Баннер в шапке 2

Microsoft VALL-E

Продукт
Разработчики: Microsoft
Дата премьеры системы: январь 2023 г.
Отрасли: Информационные технологии
Технологии: Речевые технологии

2023: Анонс нейросети

5 января 2023 года корпорация Microsoft представила новую модель искусственного интеллекта (ИИ), способную преобразовывать текст в речь, точно имитируя голос того или иного человека. Проект получил название VALL-E.

Microsoft называет предложенное решение «языковой моделью нейронного кодека». Этот ИИ способен воссоздавать голос человека на основе образца речи продолжительностью всего три секунды. Причём имитируется не только голос, но и эмоциональная окраска.

Microsoft представила открытую нейросеть, которая может имитировать голос человека

Нейросеть VALL-E основана на технологии EnCodec, которую Meta (признана экстремистской организацией; деятельность на территории Российской Федерации запрещена) представила в октябре 2022 года. В отличие от других методов преобразования текста в речь, которые обычно манипулируют звуковыми волнами, VALL-E анализирует речь человека, разбивая эту информацию на отдельные компоненты (так называемые «токены»). Затем нейросеть использует обучающие алгоритмы, чтобы на основе имеющихся знаний синтезировать любые фразы. Для обучения применялась библиотека Meta LibriLight, которая содержит около 60 000 часов англоязычной речи от более чем 7000 человек (в основном из общедоступных аудиокниг LibriVox).

Отмечается, что VALL-E отлично справляется с воссозданием звуковой среды оригинальной записи. Если голос звучит так, будто человек разговаривает по телефону, то точно так же будут звучать синтезированные фразы. Кроме того, нейросеть хорошо имитирует акценты — по крайней мере, американский, британский и несколько европейских.Как формировался Рунет и развивалась его инфраструктура. Спецпроект TAdviser к 30-летию российского сегмента всемирной сети 3.9 т

VALL-E может использоваться, например, для имитации голоса актёров или создания голосовых чат-ботов. С другой стороны, такая нейросеть может оказаться мощным инструментов в руках злоумышленников. Мошенники, например, смогут позвонить по телефону родственникам человека, имитируя его речь после трёхсекундной записи разговора. Кроме того, могут создаваться фейковые заявления с голосами политиков и пр. [1]

Примечания



СМ. ТАКЖЕ (2)


Подрядчики-лидеры по количеству проектов

За всю историю
2021 год
2022 год
2023 год
Текущий год

  Группа компаний ЦРТ (Центр речевых технологий) (44)
  МТС Exolve (Межрегиональный ТранзитТелеком, МТТ) (27)
  Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (25)
  Naumen (Наумен консалтинг) (14)
  Яндекс (Yandex) (10)
  Другие (150)

  Группа компаний ЦРТ (Центр речевых технологий) (5)
  Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (4)
  Voice Systems Robotics (VSR, VS Robotics) (2)
  МТС Exolve (Межрегиональный ТранзитТелеком, МТТ) (2)
  3iTech (ранее 3i Technologies) (2)
  Другие (15)

  МТС Exolve (Межрегиональный ТранзитТелеком, МТТ) (12)
  Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (7)
  Voice Systems Robotics (VSR, VS Robotics) (3)
  Naumen (Наумен консалтинг) (3)
  Мегапьютер Интелидженс (Megaputer Intelligence) (2)
  Другие (11)

  МТС Exolve (Межрегиональный ТранзитТелеком, МТТ) (9)
  Группа компаний ЦРТ (Центр речевых технологий) (8)
  Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (6)
  Naumen (Наумен консалтинг) (4)
  Unlimited Production (Анлимитед Продакшен, eXpress) (4)
  Другие (18)

  Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (3)
  Яндекс (Yandex) (2)
  SberDevices (СалютДевайсы, ранее СберДевайсы) (2)
  БФТ-Холдинг, БФТ (ранее Бюджетные и Финансовые Технологии) (1)
  Группа компаний ЦРТ (Центр речевых технологий) (1)
  Другие (8)

Распределение вендоров по количеству проектов внедрений (систем, проектов) с учётом партнёров

За всю историю
2021 год
2022 год
2023 год
Текущий год

  Группа компаний ЦРТ (Центр речевых технологий) (17, 46)
  МТС Exolve (Межрегиональный ТранзитТелеком, МТТ) (3, 28)
  Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (11, 27)
  Яндекс (Yandex) (9, 16)
  Avaya (4, 13)
  Другие (301, 147)

  Группа компаний ЦРТ (Центр речевых технологий) (2, 5)
  Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (1, 5)
  SberDevices (СалютДевайсы, ранее СберДевайсы) (2, 2)
  Neuro.net (Нейро) (1, 2)
  3iTech (ранее 3i Technologies) (1, 2)
  Другие (7, 9)

  МТС Exolve (Межрегиональный ТранзитТелеком, МТТ) (2, 12)
  Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (2, 7)
  Voice Systems Robotics (VSR, VS Robotics) (1, 3)
  Naumen (Наумен консалтинг) (1, 3)
  Voximplant (Фастком) (2, 2)
  Другие (9, 11)

  МТС Exolve (Межрегиональный ТранзитТелеком, МТТ) (1, 9)
  Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (2, 8)
  Группа компаний ЦРТ (Центр речевых технологий) (4, 7)
  Unlimited Production (Анлимитед Продакшен, eXpress) (1, 6)
  Naumen (Наумен консалтинг) (2, 4)
  Другие (12, 13)

  Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (2, 4)
  Яндекс (Yandex) (1, 3)
  SberDevices (СалютДевайсы, ранее СберДевайсы) (2, 2)
  Ростелеком (1, 2)
  Naumen (Наумен консалтинг) (1, 1)
  Другие (6, 6)

Распределение систем по количеству проектов, не включая партнерские решения

За всю историю
2021 год
2022 год
2023 год
Текущий год

  МТТ VoiceBox - 24
  BSS Digital2Speech - 20
  Voice2Med Система распознавания речи в медицине - 14
  Naumen Erudite - 12
  SmartLogger II - 12
  Другие 163

  BSS Digital2Speech - 5
  Voice2Med Система распознавания речи в медицине - 4
  3i TouchPoint Analytics - 2
  Naumen Erudite - 2
  МТТ VoiceBox - 2
  Другие 9

  МТТ VoiceBox - 11
  BSS Digital2Speech - 6
  VS Robotics: VS Робот-оператор - 3
  Naumen Erudite - 3
  PolyAnalyst Платформа визуальной разработки сценариев анализа данных и текстов - 2
  Другие 12

  МТТ VoiceBox - 9
  BSS Digital2Speech - 7
  EXpress Защищенный корпоративный мессенджер - 6
  SmartLogger II - 4
  Naumen Erudite - 3
  Другие 17

  YandexGPT (YaLM 2.0) - 3
  BSS Digital2Speech - 2
  BSS: Виртуальный голосовой ассистент - 2
  VS Robotics Речевая аналитика - 1
  Napoleon IT отзывы - 1
  Другие 7