Мультстудия в браузере: как создать мультик с помощью нейросети
В первой сцене у героя синяя куртка и круглые очки. Во второй — зелёная кофта и уже совершенно другое лицо. Просто видеомодель не помнит, кого рисовала в прошлом кадре, и уговорами в запросе это не лечится. Но как тогда нарисовать нормальный мультик с помощью нейросети?
Ранние нейросети для создания видео выдавали пару секунд дёрганого ролика с трёхрукими людьми и ужасными фонами. Сейчас китайский видеогенератор Kling собирает связный кусок до 15 секунд со звуком, а бесплатный Kandinsky от Сбера — сцену до 10 секунд, причём из России и без иностранной карты. А вот кнопки «сделай мультик» при этом так и не появилось. Разбираем по шагам, как создать мультик с помощью нейросети: чем лечится непостоянство героя, какой запрос понимает видеомодель и что из сервисов реально открывается в России.
Содержание:
- Что нейросеть делает сама, а что придётся доделывать
- Шаг 1. Сценарий: скучный этап, который задаёт качество
- Шаг 2. Персонаж и стиль: почему герой «плывёт»
- Шаг 3. Оживление кадра: промпт, генерация, рендеринг
- Шаг 4. Голос, музыка и сборка
- Нейросеть для создания мультиков: что доступно из России
- Что в итоге: короткая шпаргалка
Что нейросеть делает сама, а что придётся доделывать
Мультик с помощью ИИ собирается не одним запросом, а конвейером. Текстовая модель пишет сценарий, генератор картинок рисует героя, видеомодель оживляет каждый кадр по отдельности, а вы склеиваете куски в редакторе. Длинный связный сюжет нейросети не даётся: она держит в голове одну сцену, а не всю историю. Мы собрали вот такой мультик, и сейчас объясним, как именно это делается.
Главное ограничение здесь — длина. Одна генерация даёт секунды материала, так что набирать материал приходится кусками по 4–5 секунд, и каждый следующий может увести результат в сторону. Поэтому пятиминутный мультфильм с помощью ИИ — это полсотни коротких сцен, собранных вместе. Первый ролик на 30–40 секунд — это 6–8 сцен и примерно вечер работы с учётом отбраковки.
Шаг 1. Сценарий: скучный этап, который задаёт качество
Соблазн открыть видеогенератор и написать «весёлый мультик про ёжика» большой — пусть там само что-то делается. На самом деле, у вас получится набор красивых, вот только адекватно не связанных кадров.
Дело в том, что сценарий пишет не видеомодель, а текстовая нейросеть — и здесь русскоговорящим проще всего: GigaChat и Алиса работают из России напрямую и без иностранной карты. Чтобы всё получилось, ИИ нужно попросить:
- Неправильно: придумай готовую историю
- Правильно: разбей историю на сцены по 5–8 секунд, для каждой опиши одним абзацем, кто в кадре и что делает
Не бойтесь общаться с нейросетью, вносить корректировки и заставлять ИИ переделывать треш. В результате у вас получится качественная основа.
О самих формулировках у нас есть разбор промтов для нейросети — приёмы оттуда работают и для видео.
Шаг 2. Персонаж и стиль: почему герой «плывёт»
История с синей курткой и зелёной кофтой называется непостоянством персонажа, и это главная боль в ИИ-видео — так её даже описывают в руководстве Kling.
Всё дело в памяти: её у генерации нет. Каждый запуск начинается с нуля — из описания «мальчик в очках» модель каждый раз собирает нового мальчика, а всё, чего вы не уточнили, додумывает сама. Разваливается такой подход не сразу, и в этом подвох: первые две сцены могут быть очень похожи, но чем больше сцен, тем выше шанс поймать инородный вариант. К четвёртой сцене герой поменяется, как Джеймс Бонд между фильмами.
Одним текстом это не правится — нужна картинка-якорь, с которой будет работать описание:
- Сначала нарисуйте героя в генераторе изображений и сохраните удачный вариант. Из доступных в России подойдут Kandinsky (бесплатно, в браузере и в телеграм-боте), Шедеврум (приложение с готовыми рисованными стилями) или Алиса.
- Сделайте «лист персонажа» — того же героя анфас, в профиль и со спины, без предметов в руках: они помогают реализовать сходство при смене ракурса.
- Загружайте эти картинки в видеосервис как референс — Kling принимает до четырёх изображений с разных ракурсов. В Kandinsky и Шедевруме такого режима нет, там якорем служит стартовый кадр.
- Опишите внешность пятью-семью признаками и вставляйте описание дословно в каждый запрос. Например: «мальчик 8 лет, худой, круглое лицо, рыжие вихры, синяя вязаная куртка, красный шарф, круглые очки». Текст сам по себе внешний вид героя не удержит, но хотя бы подстрахует референс.
Считается, что мультяшную картинку нейросеть рисует легче, чем фотореалистичную, и отчасти это правда. Но универсальные модели упорно тянут картинку обратно в фотореализм — они на нём и учились, и это уже другой эффект — дрейф стиля. У моделей с профильным рисованным режимом годных кадров выходит заметно больше. Словом, нейросеть для создания мультфильмов должна быть заточена под рисованное, иначе будете постоянно удерживать картинку от сползания в реализм. Помогает и формула стиля, записанная словами — «плоская 2D-анимация, толстый контур, пастельные цвета» — и вставленная в каждый запрос дословно.
Шаг 3. Оживление кадра: промпт, генерация, рендеринг
Главное правило: не просите модель придумать сцену с нуля. Сначала картинка, потом движение. В режиме image-to-video («картинка в видео») готовый кадр служит точкой опоры, и модель достраивает движение от нарисованного. В режиме text-to-video («текст в видео», без опорной картинки) она сочиняет и композицию, и внешность, и свет — результат будет непредсказуемый.
Если герой рождается из реального фото, поможет гайд по изменению фото нейросетью.
Поэтому промпт (текстовый запрос к нейросети) для оживления описывает не сцену, а движение. Сцена уже в картинке, повторять её словами бессмысленно — Runway, один из первых видеогенераторов, на гайдах которого учились почти все, советует делать запрос простым и говорить только о том, что должно двигаться. Kandinsky и Шедеврум понимают русский, а зарубежные сервисы лучше реагируют на английский, так что короткие технические формулировки лучше писать на нём: «The subject walks along the path, slow camera push-in» — «герой идёт по тропинке, медленный наезд камеры».
Отрицания при этом не работают: фраза «камера не двигается» скорее заставит её ехать, писать надо утвердительно — «камера зафиксирована». И стараемся описывать одно действие на сцену: набор «идёт, оборачивается, пугается и убегает» превратится в глючную кашу.
Делаете героя из настоящего фото — помните две вещи. Публиковать ролик с узнаваемым лицом можно только с согласия человека, а за ребёнка его даёт родитель. И загруженный снимок по условиям большинства сервисов остаётся у них, так что детские фото и фото друзей лучше не отправлять вовсе.
Заложите время на брак: до монтажа доживает малая часть генераций — отсюда правило генерировать с запасом. Но и уцелевший ролик идёт в дело не целиком: из пятнадцати секунд обычно годятся четыре-семь коротких фрагментов, в сумме секунд пять. Рендеринг (просчёт готового ролика) занимает минуты, а на бесплатных тарифах ещё и очередь — так что запускайте генерацию пачками.
Шаг 4. Голос, музыка и сборка
Звук — чуть ли не больше половины всех впечатлений: кривоватая картинка с внятной озвучкой смотрится нормально, а вылизанная анимация в тишине выглядит недоделанной.
С озвучкой из России сложнее всего. Голоса сервиса синтеза речи ElevenLabs считаются эталонными, но оплатить подписку российской картой не выйдет, а Сбер прекратил продажу пакетов своего синтезатора SaluteSpeech для физлиц. Остаются три пути:
- Первый — встроенная озвучка видеосервиса, но тут засада: Kling говорит по-английски, по-китайски, по-японски, по-корейски и по-испански, а русской речи там пока нет. Годится для музыки без слов или сцен на английском.
- Второй — бесплатные веб-синтезаторы из нашей подборки нейросетей для озвучки текста.
- Третий — собственный голос и микрофон телефона: для домашнего мультика это даже интереснее любого синтеза.
Музыку проще сгенерировать отдельно — тем же способом, что и песню с помощью нейросети. Собирать всё вместе удобнее на компьютере, но склеить сцены можно и мобильным редактором — варианты есть в подборке бесплатных программ для монтажа. Титры делайте там же: просить надписи у видеомодели бесполезно, получатся инопланетные глифы.
Отдельная задача — спрятать стыки, чтобы полсотни кусков не выглядели рваной нарезкой. Тут работают три приёма: непрерывные музыка и голос поверх всех сцен, склейка на движении, а не на статичном кадре, и чередование общего и крупного плана.
Нейросеть для создания мультиков: что доступно из России
Половина известных сервисов из России просто не открывается. Видеогенератор Google Veo закрыт для российских запросов. Набор ИИ-инструментов Adobe Firefly в России не продавался вообще: Adobe ушла с рынка в 2022 году, ещё до запуска сервиса. А нашумевшее приложение Sora от OpenAI закрыли весной 2026-го. У остальных зарубежных сервисов сайт открывается, но всё упирается в оплату: карты российских банков они не принимают.
Что до рабочих вариантов, то вот они:
| Kandinsky (Сбер) | Шедеврум (Яндекс) | Kling AI (Kuaishou) | |
| Длина ролика | до 10 секунд | короткие ролики | 3–15 секунд, продление по 4–5 |
| Звук и липсинк | нет | нет | есть, но без русского |
| Готовые рисованные стили | не заявлены | есть | аниме, 3D, мультипликация |
| Оживление своей картинки | есть | есть | есть |
| Референсы персонажа | нет | нет | до 4 изображений |
| Цена | бесплатно | Про — 100 ₽/мес сверх Яндекс Плюса | бесплатные кредиты, дальше подписка |
| Доступ из России | напрямую, включая телеграм-бот | напрямую, оплата российской картой | сайт открывается, оплатить российской картой нельзя |
Kandinsky — самый простой вариант: открываете, пишете запрос, получаете видео. Для серьёзного ролика мало, для первого опыта достаточно: звука нет, движения проще, чем у Kling. Сбер заявляет, что модель дообучали на русском культурном коде — героях наших сказок, национальной архитектуре, деталях быта; на запросах вроде избушки на курьих ножках это должно давать более узнаваемый результат, чем у зарубежных моделей. Народные сюжеты вроде Бабы-яги и богатыря в общественном достоянии, а вот узнаваемых героев конкретных студий для публикации генерировать не стоит.
Шедеврум — разобраться можно без подготовки: стили уже готовые, от акварели до 3D, выбираете из списка. Про важное: по условиям сервиса результат разрешено использовать в личных некоммерческих целях, а любое коммерческое требует предварительного согласования с Яндексом через форму обратной связи. Подписка Про снимает водяной знак, но согласования не заменяет.
Kling — самый сильный из тех, что открываются из России напрямую: держит персонажа по нескольким референсам, генерирует звук вместе с картинкой. Из минусов — бесплатные кредиты (внутренние баллы на генерации) кончаются быстро, а дальше упираетесь в оплату иностранной картой.
Для мультика ребёнку не гоняйтесь за самой мощной моделью. Возьмите один стиль попроще, короткие сцены и свой голос — связка Kandinsky и бесплатный редактор обойдётся в ноль рублей, а дети посмотрят такое с большим удовольствием, чем вылизанный ролик из платного сервиса. Более широкий список — в обзоре нейросетей для генерации видео.
Что в итоге: короткая шпаргалка
Как создать ИИ мультик и не потратить на это все выходные:
- Сценарий — в GigaChat или Алисе, сразу разбитый на сцены по 5–8 секунд.
- Герой — одна удачная картинка плюс лист персонажа в трёх ракурсах, он же якорь для всех сцен.
- Сцены — режимом «картинка в видео», в запросе только движение, одно действие на сцену.
- Звук и монтаж — отдельно, в обычном редакторе, стыки прятать музыкой и склейкой на движении.
Больше всего времени вам сэкономят два совета: держать сцену в пределах 5–8 секунд и не менять сервис на середине проекта — у каждой модели свой почерк, и сцены из разных сервисов не склеиваются в один стиль.
Про маркировкуМультик помечать не нужно: YouTube требует отметку «изменённый или синтетический контент» только для реалистичного видео, которое можно принять за настоящую съёмку, и полностью анимированные ролики выведены из-под этого правила. Отметка понадобится, если вставите реалистичный кадр с настоящим человеком или узнаваемым местом. Рядовой автор в России маркировать ИИ-контент тоже не обязан: закон № 243-ФЗ даёт право пометить ролик, а обеспечить такую возможность обязывает крупные площадки.
В общем, нейросеть здесь — исполнитель без памяти и без чувства истории. За единство героя, ритм и смысл отвечаете вы: и на монтаже, и в каждом запросе. Она нарисует, что попросили, но не знает, что история должна быть смешной.
Читайте нас в социальных сетях