InfiniTalkПопробовать

Говорящий аватар: как сделать цифрового ведущего

Говорящий аватар — это видео, в котором человек с фотографии произносит заданный текст: губы двигаются синхронно со звуком, голова слегка поворачивается, лицо живёт. Технология давно вышла из разряда трюка и используется там, где нужно записывать много однотипных роликов. Разбираем, как это устроено, что нужно подготовить и в каких местах результат чаще всего разваливается.

Из чего собирается говорящий аватар

На вход подаются две вещи: изображение человека и звуковая дорожка с речью. Модель восстанавливает по снимку объёмную геометрию лица, раскладывает звук на фонемы и для каждого момента времени рисует кадр с соответствующим положением рта.

Помимо артикуляции модель добавляет то, что делает картинку живой: моргание, микродвижения головы, изменение направления взгляда. Без этого лицо выглядит маской — губы шевелятся, а человек мёртвый. Именно качество этих мелочей отличает убедительный аватар от отталкивающего.

Голос можно взять готовый, записав его самому, или синтезировать из текста. Второй путь удобнее, когда роликов много и текст меняется: перезаписывать ничего не нужно, достаточно поменять строчку.

Что подготовить

Нейтральное выражение лица на исходном снимке работает лучше широкой улыбки: с открытым в улыбке ртом модели сложнее строить артикуляцию, и в движении зубы начинают плыть.

  • Портрет анфас, лицо занимает не меньше трети кадра, глаза открыты.
  • Ровный свет: резкая тень поперёк лица ломает восстановление геометрии.
  • Разрешение от 512 пикселей по короткой стороне, лучше больше.
  • Речь без фонового шума и музыки. Посторонние звуки модель пытается артикулировать.
  • Текст, разбитый на фрагменты по 10–20 секунд, если ролик длинный.

Пошагово

  1. 1Загрузите портрет в кабинет.
  2. 2Подготовьте речь: запишите голос или наберите текст для озвучки.
  3. 3Соберите первый фрагмент на 10–15 секунд — это проверочный прогон.
  4. 4Просмотрите результат покадрово в двух-трёх местах: губы должны совпадать с гласными.
  5. 5Если всё сходится, генерируйте остальные фрагменты и склейте их.
  6. 6При рассинхроне уменьшите длину фрагмента или почистите звук.

Где аватар выглядит уместно

Лучше всего технология показывает себя там, где видео однотипное и его много: обучающие модули, инструкции для сотрудников, приветственные ролики, локализация одного и того же материала на разные языки. Записывать сорок вариантов одного обращения перед камерой дорого, сгенерировать — нет.

Хуже — там, где зритель ждёт живого человека и эмоции: продающие видео первого касания, обращения руководителя, всё, что строится на доверии. Аватар почти всегда считывается как неживой, и вместо доверия получается обратный эффект.

Почему аватар выглядит неестественно

Порядок разбора всегда один: сначала проверяем звук, потом длину фрагмента, и только потом исходное фото. Большинство проблем живёт в первых двух пунктах.

  • Мёртвые глаза: модель не добавила моргание или взгляд статичен.
  • Голова неподвижна, работают только губы — эффект говорящей маски.
  • Артикуляция опаздывает: обычно виноват шум или музыка в дорожке.
  • Зубы и язык плывут при широком открытии рта — частая беда исходников с улыбкой.
  • Слишком длинный фрагмент: к концу накапливается рассинхрон и искажения.

Правовая сторона

Изображение человека охраняется законом. Создавать говорящее видео с чужим лицом без согласия нельзя — и это касается не только публичных людей, но и коллег, знакомых, родственников.

Отдельно про раскрытие: если аватар используется в коммуникации с клиентами, честнее обозначить, что перед зрителем сгенерированный персонаж. Обнаруженная постфактум подмена бьёт по доверию сильнее, чем сам факт использования технологии.

Частые вопросы

Нужна ли видеозапись человека?
Нет, достаточно одной фотографии. Видео на входе требуется другим технологиям — например, переозвучке готового ролика.
На каких языках работает артикуляция?
Русский и английский отрабатываются уверенно. На редких языках качество ниже: артикуляция строится по звукам, и непривычные фонемы даются хуже.
Какой длины ролик можно сделать?
Технически любой, но надёжнее собирать из фрагментов по 10–20 секунд — так меньше накапливается рассинхрон.
Можно ли использовать свой голос?
Да. Запишите дорожку на любой микрофон в тихом помещении и подайте её вместе с фотографией.

Попробуйте прямо сейчас — без VPN, оплата картой РФ

Открыть InfiniTalk