Что такое «аниматоры»
В сленге ниши аниматор — флоу, который оживляет статичного персонажа: берёт твоё фото (с лицом из твоей LoRA) и видео-референс движения, и на выходе даёт ролик, где ТВОЙ персонаж повторяет движение из референса — позу, тело, мимику. Это главный прорыв видео-контента 2025–2026: больше не нужно «выпрашивать» движение у text-to-video промптом — ты его буквально переносишь.
Wan 2.2 Animate — рабочая лошадка
Открытая модель Alibaba, нативно поддержана в ComfyUI. Два режима:
- Motion transfer: персонаж с твоего фото повторяет движения актёра из референс-видео, включая мимику.
- Character replacement: в готовом видео исходный человек заменяется на твоего персонажа.
Как устроен флоу под капотом: видео-референс разбирается на компоненты → SAM2-сегментация отделяет человека от фона (ты помечаешь его точками) → DWPose/ViTPose извлекают скелет и ключевые точки лица покадрово → генерация ведётся по этим скелетам с identity твоего персонажа. Версия V2 даёт заметно более стабильную временную согласованность (меньше «плывущего» лица между кадрами).
Танцы из фото
Классический формат Reels ниши: тренд-танец, исполненный твоим персонажем. Пайплайн: одно фото персонажа + видео танца с TikTok → аниматор-флоу → 5–15 сек ролика. Именно такие флоу («Animator»-серии в приватках, китайские сборки с RunningHub) собирают максимум запусков: формат конвейерный, тренды меняются еженедельно, а себестоимость ролика — центы аренды GPU.
LTX-2 и LTX-2.3 — звук сразу вместе с видео
LTX-2 — открытая аудиовизуальная модель: генерирует видео и звук одним проходом (движение, речь, эмбиент). Поддержана в ComfyUI с первого дня. Ключевые флоу:
- Pose-to-video — генерация по скелету позы.
- V2V IC-LoRA (motion track): из референс-видео извлекается OpenPose-скелет движения, и это движение накладывается на твоё портретное фото. Аналог Wan-аниматоров, но на другой базе — когда Wan «не берёт» референс, пробуют LTX, и наоборот.
- V2V со звуком — редактирование готового видео промптом с сохранением звуковой дорожки.
- Продвинутые сборки используют двойной контроль позы (два референса одновременно — тело + камера/лицо) для сложных движений.
Длинные ролики: Wan LongVideo
Базовые video-модели дают 5 секунд. Надстройки типа LongVideo генерируют по картинке и промпту существенно более длинные ролики (чейнинг сегментов с сохранением identity). Зачем: сторис-влоги, «день из жизни», лайв-луки — форматы, где 5 секунд мало. Осторожно: чем длиннее генерация, тем заметнее накопление артефактов — проверяй лицо на каждом сегменте.
VRAM и экономика
- Wan 2.2 Animate 14B и LTX-2.3 комфортно живут на 24–48 ГБ VRAM (RTX 4090/5090, A40) — это арендные флоу, локальная 3060 не вывезет.
- Ролик-перенос 10 сек ≈ минуты генерации на 5090 ≈ единицы центов. Конвейер из 10 Reels в день — около доллара GPU-времени.
Чек-лист качества анимации
- Лицо после переноса == лицо LoRA? (прогоняй face detailer при необходимости)
- Руки и пальцы в движении — главный источник артефактов, отбраковывай безжалостно.
- Референс с чистым фоном и одним человеком переносится в разы лучше.
- Финал: цветокор под стиль ленты + трендовый звук (или нативный звук LTX).
Озвучка и липсинк — следующая статья: «Голос персонажа и липсинк».