HeyGen Labs - как нейросеть переводит видео
Нейросеть HeyGen распознает речь в ролике и переводит ее на другой язык. Инструмент копирует тембр голоса спикера, и подстраивает движение губ под сгенерированную аудиодорожку.
Во время перевода HeyGen адаптирует речь, используя фразы носителей языка. Благодаря этому перевод получается живым. А языков для перевода уже более 10: английский, испанский, французский, итальянский, немецкий, польский, японский, хинди, турецкий, корейский и португальский.
В бесплатном тарифе доступен перевод одного минутного ролика или двух 30-секундных. Сейчас на платформе много желающих, поэтому на перевод одного ролика может уйти больше суток.
Как сгенерировать перевод видео
- Удобнее сразу перейти по ссылке на сайт с бета-функцией перевода видео. Зарегистрируйтесь по электронной почте или войдите через гугл-аккаунт.
- Перетащите или загрузите видео продолжительностью от 30 до 59 секунд в поле «Drop to Upload». Другие требования к ролику: размер до 500 Мб, формат MP4, QTFF или WEBM.
- Выберите язык, на который перевести ролик, во вкладке «Choose a target language». Оригинальный ролик при этом может быть и на русском языке.
- Дождитесь обработки. Из-за большого спроса вы можете попасть в виртуальную очередь. Если проценты прогресса обработки не двигаются, обновите страницу.
- Скачайте результат. Оповещение о готовности придет вам на почту, с которой связан аккаунт. Будьте готовы к тому, что ждать видео придется до нескольких часов.
Какое видео выбрать
После регистрации HeyGen дает бесплатно только один токен, то есть можно перевести одно видео, а далее - только платно. Так что стоит внимательно отнестись к выбору видео. Вот что стоит учитывать:
• В идеале стоит использовать видео без шума или музыки на фоне. Либо же музыка не должна быть выраженной.
• Лучше, если на видео говорит только один человек. Если загрузить диалог, нейросеть объединит голоса и заставит обоих собеседников говорить «усредненным» голосом.
• Проверьте, чтобы в кадре не было, например, портретов. ИИ-липсинк вставляется на то, что система распознает как лица, то есть картина может заговорить.
• Говорящий должен смотреть прямо в камеру, иначе генерация мимики собьется.
• Руки, микрофоны или другие предметы не должны закрывать лицо говорящего — по тем же причинам.
• Спикер должен говорить на одном языке. Если он вставляет в речь на одном языке слова из другого, то генерация тоже собьется.
Источники:
HeyGen: что за нейросеть и как ей пользоваться для перевода видео (tinkoff.ru)
