🎬 Видео и голос3 мин

Как озвучить AI-модель и сделать липсинк: клонирование голоса

Клонирование голоса через FishAudio, говорящее видео из одного фото с InfiniteTalk, озвучка на 50 языках и продажа голосовых сообщений.

Коротко

Голос персонажа клонируют по образцу в 10–30 секунд через FishAudio или ElevenLabs, после чего им можно озвучить любой текст на десятках языков. Липсинк из одного портрета и аудио делает InfiniteTalk. Голосовые сообщения — один из самых маржинальных товаров: себестоимость центы, цена $3–15.

Зачем персонажу голос

Голос — самый недооценённый актив AI-модели: говорящие видео конвертят в подписку лучше любых фото, а голосовые сообщения в переписке продаются как отдельный PPV-товар с себестоимостью в центы. Плюс мультиязычность: один персонаж озвучивается на десятках языков — выходишь на латам/азиатские рынки без пересоздания контента.

Стек голоса

  • FishAudio (S2/S2-Pro) — фаворит приваток: zero-shot клонирование голоса по референсу 10–30 секунд, озвучка текста на десятках языков, есть готовые ComfyUI-ноды — встраивается прямо во флоу, в том числе мультиспикерные.
  • ElevenLabs — западный стандарт: стабильное качество, эмоции, но дороже и строже модерация.
  • Правило ниши: голос генерируется один раз как «эталон» и дальше клонируется — у персонажа всегда один и тот же голос, как и лицо.

Липсинк: InfiniteTalk и родня

InfiniteTalk (на базе Wan 2.1 / MultiTalk) — главный открытый липсинк-инструмент: подаёшь портрет персонажа + аудиодорожку, получаешь говорящее видео с точной артикуляцией и сохранением identity. Режимы:

  • Image-to-video: говорящая голова из одного фото — формат «кружочков» и сторис-обращений.
  • Video-to-video: липсинк поверх готового ролика — совмещается с аниматорами (персонаж танцует И говорит).

Комбо-флоу из приваток («LTX FishAudio Voice» и аналоги) делают всё одним проходом: клонируют голос → озвучивают текст на нужном языке → анимируют изображение по промпту → накладывают липсинк. Это флоу-комбайны: начинай с дефолтных настроек и разбирай по узлам (совет из чатов — «скорми флоу иишке, чтобы объяснила», работает: LLM хорошо расшифровывают JSON воркфлоу).

LTX-2: звук нативно

LTX-2 генерирует видео вместе со звуком одним проходом — речь, эмбиент, музыка. Для быстрых лайфстайл-роликов это экономит отдельный этап озвучки; для точного голоса персонажа поверх всё равно используется клон (FishAudio/ElevenLabs) + липсинк.

Пайплайн «голосовое для фана»

  1. Текст сообщения (LLM в характере персонажа — та же механика, что в нашей Студии).
  2. FishAudio: озвучка клоном голоса персонажа.
  3. Отправка как voice в Fanvue DM / Telegram — вручную или ботом.

Себестоимость: центы. Цена продажи: $3–15 за голосовое. Это одна из лучших маржинальностей во всей нише.

Ограничения и этика

  • Клонируй только синтетический голос своего персонажа. Клонирование голосов реальных людей без согласия — deepfake-статьи и баны платформ.
  • Помни про обязательную маркировку AI-контента (см. «Правила и риски») — говорящие видео попадают под неё в первую очередь.

Дальше: «Тренды ниши 2026» — что меняется прямо сейчас.

Непонятные термины — в словаре ниши.

Читайте также

Попробуйте бесплатно, прямо сейчас

Соберите персонажа за минуту и напишите ему — это та самая механика переписки, на которой держится доход в нише. Без регистрации карты и оплаты.

Собрать персонажа
✈️ Telegram-канал AI-OFM

Новинки Студии, разборы персонажей и практические гайды

Показываем, как сделать диалог живее, создать устойчивый образ и развивать AI-проект. Оставь Telegram — пришлём ссылку на канал.

Дальше — быстрее с курсом

Всё из этой статьи мы делаем руками на практике: воркфлоу, шаблоны, разборы.

Смотреть программу