Узнайте, как идеально генерировать любые видео с помощью нейросетей за 15 минут, от выбора сети до сложных сцен и оптимизации затрат.
Ask about this video. Answers come from its transcript only — with the timestamp, so you can check them.
Generated from the transcript and can be wrong — check the timestamp.
Key Takeaways
- Правильный выбор нейросети влияет на качество, стоимость и стабильность генерации видео.
- Предварительная генерация и доработка картинки значительно повышают прогнозируемость результата.
- Стиль, камера и свет — ключевые элементы для создания профессионального видеоконтента.
- Оптимизация затрат возможна через выбор тарифов и отключение ненужных функций, например звука.
- Использование первого и последнего кадра позволяет создавать плавные трансформации и бесшовные видео.
What the video covers
- Обзор трёх популярных нейросетей для видеогенерации: Грок, Клинк 3.0 и Sedens 2.0 с их преимуществами и ограничениями.
- Рекомендации по созданию качественных видео через предварительную генерацию и доработку картинки с помощью ChatGPT.
- Важность выбора стиля видео для создания нужной атмосферы и визуального мира сцены.
- Тонкости работы с камерой: ракурсы, оптика и движение для кинематографического эффекта.
- Роль света, цвета и фактуры в повышении качества и реалистичности видео.
- Использование функции первого и последнего кадра для создания бесшовных трансформаций и таймлапсов.
- Управление скоростью и временем для создания эффектов замедления, ускорения и заморозки движения.
- Приём копирования движения для ускорения процесса генерации сложных сцен.
- Советы по экономии на генерации видео, включая отключение звука и выбор выгодных тарифов.
- Практические примеры и демонстрации работы с каждой нейросетью для разных задач и уровней сложности.
Full Transcript — Download SRT & Markdown
Speaker A
Если ваши генерации похожи на это, то у меня для вас хорошие новости. Сегодня вы научитесь генерировать любые видео идеально, насколько это в принципе возможно. Сейчас мы пройдём с вами восемь уровней от самых важных правил до суперсложных сцен. И всё это за 15 минут. Поехали. Сперва необходимо выбрать правильную нейросеть для генерации, чтобы избежать сразу двух ошибок. Это зря потраченные деньги и ужасное качество. Чтобы понять, кто сейчас в топе, есть сайт с рейтингом нейросетей, название которого я вряд ли произнесу правильно, но работает он просто. Люди сравнивают результаты разных нейросетей, голосуют за лучший, и из этого складывается рейтинг. По общей статистике сверху Sedens. Игрок. Но если смотреть на связку цена, качество и стабильность, я выделю три лучших варианта. Грок самый дешёвый, качество среднее. Подписка за 30 долларов в месяц даёт сгенерировать около 15 видео в день по 10 секунд. За месяц это 450 видео в качестве 720 пикселей. Подходит для простых генераций. Сложные сцены не вывозит. Часто приходится генерировать повторно. Подписку покупаем на сайте gr.com. CLK 3.0 — лучший баланс цены и качества. Подписка за 25 долларов даёт 3 000 кредитов. Хватит, чтобы сгенерировать 65 видео по 5 секунд в качестве 720 пикселей, а также генерирует 180 пикселей и даже 4К, но количество генерации будет меньше. Подходит как для простых, так и для сложных сцен. Генерирует стабильнее, чем Грок. Покупаем на сайте clink.ai. Позже я покажу, как генерировать в два-три раза дешевле. И финальный Sedens 2.0. Самый качественный по генерации, но самый дорогой. За 20 долларов даёт 75 кредитов. Их хватит на 20 генераций по 5 секунд в качестве 720 пикселей. Максимальное разрешение тоже 4К, но он сожрёт всю подписку за две генерации. Однако подходит даже для самых сложных сцен. Генерировать повторно почти не требуется. Подписка оформляется на разных платформах с разными ценами. Я использовал invvideo. Он наиболее выгодный. Теперь мы изучим самые важные правила генерации, а также отработаем каждую нейросеть, чтобы вы наглядно увидели разницу между ними. Уровень первый. Текст в видео и картинка в видео. Самый простой способ сгенерировать видео — это просто написать промт. Например, корабль плывёт по грозовым облакам вместо моря. Отправляем в нейросеть и получаем результат. Но тут большая проблема. Если вам не понравится освещение, ракурс или любая деталь, видео придётся генерировать заново. А видеогенерация, как мы поняли, удовольствие дорогое. Поэтому сначала генерируем не видео, а картинку. Для этого советую чат GPT. Описываю сцену. Старинный деревянный корабль с белыми парусами плывёт по грозовым облакам вместо воды. Вид сбоку, тёмное небо, молнии. Получаю картинку. Если что-то не нравится, я спокойно меняю в ней что угодно. Например, я попрошу чат сделать мне закат на этой картинке и через минуту получаю результат, который меня полностью устраивает. Захожу в клинк, раздел Generate, модель 3.0. Загружаю картинку и добавляю промт для движения. Отключаю мультишот, чтобы видео было с одного ракурса, а не с разных. Ставлю 1080 пикселей, 7 секунд и генерирую. Результат уже куда более прогнозируемый. Запомните, результат видеогенерации наполовину зависит от вашей картинки, поэтому дорабатывайте её до идеала. Сразу покажу, как генерировать в клинге с максимальной выгодой. Если звук внутри видео не нужен, отключите его вот этой кнопкой, и генерация подешевеет сразу на 35%. Если за месяц вы генерируете много видео, тогда рекомендую выбирать тариф Ультра. На стандарт вы платите 1 доллар 30 центов за 100 кредитов, а на ультра 60 центов за те же 100 кредитов. Это вдвое выгоднее. Идём дальше. Уровень второй. Стиль. Стиль создаёт визуальный мир сцены. Один и тот же промт можно превратить в реалистичный фильм, мультик, минималистичную анимацию или 3D-игру, просто добавив описание стиля. Поэтому стиль выбираем под задачу, а не наугад. Для примера возьмём одну сцену и применим три стиля. Сцена. Воин в тяжёлых доспехах стоит на краю скалы спиной к нам. Внизу огромное поле битвы, драматичное небо. И к каждой картинке добавляем свой стиль: фотореализм, стикмен на белом фоне и 3D игровой. Загружаем каждую картинку в грок и добавляем движение. Камера медленно приближается сзади. Плащ и трава колышутся на ветру. 720 пикселей, 10 секунд. Смотрим. Грок тут подходит неплохо. Сцена простая, один персонаж, понятное движение камеры. Кстати, дальше я не буду каждый раз зачитывать промты, иначе ролик затянется на час. Я выведу их на экран, чтобы вы могли поставить на паузу и изучить. А также оставлю файл со всеми промтами в своём Telegram-канале. Ссылка будет в описании. Уровень третий. Камера. Камера превращает обычную генерацию в кадр из фильма. Работаем по трём вещам: ракурс, оптика и движение камер. Начнём с ракурса. Девушка с собакой под торнадо. Вид снизу. Я использовал грок, хотя сомневался, что он справится, но получилось очень хорошо. Второй пример. От первого лица верхом на лошади по Лондону XIX века. Тут я использовал клинк в 4К. Много деталей и людей. Нужна максимальная реалистичность. Далее разберём оптику. Первый пример макросъёмка. На кончике пальца крошечный пингвин с зонтиком под дождём. Делаю в клинк 1080 пикселей. Макросъёмка требует чистой детализации, где капли и размытия фона должны выглядеть аккуратно. Второй пример — рыбий глаз. В дверном глазке стоит зебра в капюшоне. Взял клинк, так как грок хуже справляется с эффектом рыбьего глаза. И последнее. Движение камеры. Популярный пример: тряска камеры или съёмка с рук. На картинке ночной лес и фонарик в руке. Использую клинк в 1080 пикселей, так как сцена непростая, очень темно и сложное движение камеры. Второй пример — вращение камеры. Девушка спокойно сидит посреди горячей комнаты. Камера облетает её на 360°. Здесь справится грок. Стиль мультяшный, движение камеры понятное, персонаж почти статичен. Уровень четвёртый. Свет, цвет и фактура. Свет, цвет и фактура отвечают за ощущение качества. Сцена может быть технически верной, но выглядит дёшево, а правильный свет, цветовой стиль и материалы сразу делают её дороже. Первый пример — реклама духов Визави. Флакон из янтарного стекла у окна. Сквозь него бьёт тёплый луч солнца. По стеклу стекают капли. Берём клинг в 4К. В рекламе детализация очень важна, и клинг справляется с этим великолепно. Второй пример — затонувший мегаполис, где лучи солнца пробиваются сквозь толщу воды. Здесь возьмём грок. Движение минимально, один персонаж, 3D-стиль. И с такой атмосферой он справляется хорошо. Уровень пятый. Первый и последний кадр. Этот режим нужен, когда вы хотите показать конкретную трансформацию или создавать бесшовные видео. У грок такой функции нет, поэтому работаем в клинк, задаём первый кадр и последний, а переход между ними нейросеть строит сама. Пример: трансформация семечка в цветок. Первый кадр — семечко в земле крупным планом. Последний кадр на том же месте распустившийся цветок. Клинк создаст красивое таймлапс видео, идеально повторив наш первый и последний кадр. Чтобы делать бесшовные видео, вам нужно использовать предыдущий последний кадр в качестве первого. Добавляем картинку распустившегося цветка в клинк как первый кадр и возьмём картинку с девочкой как второй кадр. Генерируем и просто склеиваем оба видео на монтаже. Вот результат. Уровень шестой. Скорость и время. Скорость и время управляют ощущением сцены. Можно замедлить момент, ускорить процесс или вовсе заморозить время. Первый пример — слоу-мошн. Машина входит в занос на грязной трассе. Камера у самой земли, грязь летит в объектив. Для генерации взял грок. Не с первой попытки, но он справился. Второй пример — застывшее время. Вся сцена будто на паузе, как в фильме Люди Икс, где ртуть спасает мутантов от взрыва. Используем клинк в 4К, так как физика сложная и часть объектов заморожена, а персонаж двигается и взаимодействует с объектами. Уровень седьмой. Копируем движение. Этот приём нуж
Speaker A
минут. Поехали. Сперва необходимо выбрать правильную нейросеть для генерации, чтобы избежать сразу двух ошибок. Это зря потраченные деньги и ужасное качество. Чтобы понять, кто сейчас в топе, есть сайт с рейтингом нейросетей, название которого я вряд ли произнесу правильно, но работает он
Speaker A
просто. Люди сравнивают результаты разных нейросетей, голосуют за лучший, и из этого складывается рейтинг. По общей статистике сверху Sedens [музыка] игрок.
Speaker A
Но если смотреть на связку цена, качество и стабильность, я выделю три лучших варианта. Грок самый дешёвый, качество среднее. Подписка за 30 долларов в месяц даёт сгенерировать около 15 видео в день по 10 секунд. За месяц это 450 [музыка]
Speaker A
видео в качестве 720 пикселей. Подходит для простых генераций. Сложные сцены не вывозит. Часто приходится генерировать повторно. [музыка] Подписку покупаем на сайте gr.com. CLK 3.0- лучший баланс [музыка] цены и качества. Подписка за 25 долларов даёт 3.000 кредитов. хватит, чтобы
Speaker A
сгенерировать 65 видео по 5 секунд в качестве 720 пикселей, а также генерирует 180 пикселей [музыка] и даже 4К, но количество генерации будет меньше. Подходит как для простых, так и для сложных сцен. Генерирует стабильнее, [музыка] чем Грок. Покупаем на сайте
Speaker A
clink.ai. Позже я покажу, как генерировать в два-три раза дешевле. И финальный Sedens 2.0. Самый качественный по генерации, но самый дорогой. За 20 долларов даёт [музыка] 75 кредитов. Их хватит на 20 генераций по 5 секунд в качестве 720 пикселей. Максимальное разрешение тоже
Speaker A
4К, но он сожрёт всю подписку за две генерации. Однако подходит даже для самых сложных сцен. Генерировать повторно почти не требуется. Подписка оформляется на разных платформах с разными ценами. Я использовал invvideo.
Speaker A
Он наиболее выгодный. Теперь мы изучим самые важные правила генерации, а также отработаем каждую нейросеть, чтобы вы наглядно увидели разницу [музыка] между ними. Уровень первый. Текст в видео и картинка в видео. Самый простой способ сгенерировать видео - это просто
Speaker A
написать промт. Например, корабль плывёт по грозовым облакам вместо моря. Отправляем в нейросеть и получаем результат. Но тут большая проблема. Если вам не понравится освещение, ракурс или любая деталь, видео придётся генерировать заново. А видеогенерация, как мы поняли, удовольствие дорогое.
Speaker A
Поэтому сначала генерируем не видео, а картинку. Для этого советую чат GPT. Описываю сцену. Старинный деревянный корабль с белыми парусами плывёт по грозовым облакам вместо воды. Вид сбоку тёмное небо молнии. Получаю картинку.
Speaker A
Если что-то не нравится, я спокойно меняю в ней что угодно. Например, я попрошу чат сделать мне [музыка] закат на этой картинке и через минуту получаю результат, который меня полностью устраивает. Захожу в клинк, раздел Generate, модель 3.0. Загружаю картинку
Speaker A
и добавляю промт [музыка] для движения. Отключаю мультишот, чтобы видео было с одного ракурса, а не с разных. Ставлю 1080 пикселей, 7 секунд и генерирую.
Speaker A
Результат уже куда более прогнозируемый. Запомните, результат видеогенерации наполовину зависит от вашей картинки, поэтому дорабатывайте её до идеала.
Speaker A
Сразу покажу, как генерировать в клинге с максимальной выгодой. Если звук внутри видео не нужен, отключите его вот этой кнопкой, и генерация подешевеет сразу на 35%. [музыка] Если за месяц вы генерируете много видео, тогда рекомендую выбирать тариф Ультра. На
Speaker A
стандарт вы платите 1 доллар 30 центов за 100 кредитов, а на ультра [музыка] 60 центов за те же 100 кредитов. Это вдвое выгоднее. Идём дальше. [музыка] Уровень второй. Стиль. Стиль создаёт визуальный мир сцены. Один и тот же промт можно превратить в реалистичный
Speaker A
фильм, мультик, минималистичную анимацию или 3D-игру, просто добавив описание стиля. [музыка] Поэтому стиль выбираем под задачу, а не на угад. Для примера возьмём одну сцену и применим три стиля.
Speaker A
Сцена. Воин в тяжёлых доспехах стоит на краю скалы спиной к нам. Внизу огромное поле битвы, драматичное небо. И к каждой картинке добавляем свой стиль: фотореализм, стикмен на белом фоне и 3D игровой. Загружаем каждую картинку в грок и добавляем движение. Камера
Speaker A
медленно приближается сзади. Плащ и трава колышутся на ветру. 720 пикселей, 10 секунд. Смотрим. Грок тут подходит неплохо. Сцена простая, один персонаж, понятное движение камеры. Кстати, дальше я не буду каждый раз зачитывать промты, иначе ролик затянется на час. Я выведу
Speaker A
их на экран, чтобы вы могли поставить на паузу и изучить. А также оставлю файл со всеми промтами в своём Telegram-канале.
Speaker A
Ссылка будет в описании. Уровень третий. Камера. Камера превращает обычную генерацию в кадр из фильма. Работаем по трём вещам: ракурс, оптика и движение камер. Начнём с ракурса. Девушка с собакой под торнадо. Вид снизу. Я использовал грок, хотя сомневался, что
Speaker A
он справится, но получилось очень хорошо. Второй пример. От первого лица верхом на лошади по Лондону XIX века.
Speaker A
Тут я использовал клинк в 4К. Много деталей и людей. Нужна максимальная реалистичность. Далее разберём оптику.
Speaker A
Первый пример макросъёмка. На кончике пальца крошечный пингвин с зонтиком под дождём. Делаю в клинк 1080 пикселей.
Speaker A
Макросъёмка требует чистой детализации, где капли и размытия фона должны выглядеть аккуратно. Второй пример - рыбий глаз. В дверном глазке стоит зебра в капюшоне. Взял клинк, так как грок хуже справляется с эффектом рыбьего глаза.
Speaker A
И последнее. Движение камеры. Популярный пример: тряска камеры или съёмка с рук. На картинке ночной лес и фонарик в руке.
Speaker A
Использую клинк в 1080 пикселей, так как сцена непростая, очень темно и сложное движение камеры. Второй пример - вращение камеры. Девушка спокойно сидит посреди горячей комнаты. Камера облетает её на 360°.
Speaker A
Здесь справится грок. Стиль мультяшный, движение камеры понятное, персонаж почти статичен. Уровень четвёртый. Свет, цвет и фактура. Свет, цвет и фактура отвечают за ощущение качества. Сцена может быть технически верной, но выглядит дёшево, а правильный [музыка] свет, цветовой стиль и материалы сразу делают её дороже.
Speaker A
Первый реклама духов Визави. Флакон из янтарного стекла у окна. Сквозь него бьёт тёплый луч солнца. По стеклу стекают капли. Берём клинг [музыка] в 4К. В рекламе детализация очень важна, и клинг справляется с этим великолепно.
Speaker A
Второй пример затонувший мегаполис, где лучи солнца пробиваются сквозь толщу воды. Здесь возьмём грок. Движение минимальны, один персонаж, 3D-стиль. И с такой атмосферой он справляется хорошо.
Speaker A
Уровень пятый. Первый и последний кадр. Этот режим нужен, когда вы хотите показать конкретную трансформацию или создавать бесшовные видео. Угрок такой функции нет, поэтому работаем в клинк, задаём первый кадр и последний, а переход между ними нейросеть строит сама. Пример: трансформация семечка в
Speaker A
цветок. Первый кадр - семечко в земле крупным планом. Последний кадр на том же месте распустившийся цветок. Клинк создаст красивое таймelaps видео, идеально повторив наш первый и последний кадр. Чтобы делать бесшовные видео, вам нужно использовать предыдущий последний кадр в качестве первого. Добавляем
Speaker A
картинку распустившегося цветка в клинк как первый кадр и возьмём картинку с девочкой как второй кадр. Генерируем и просто склеиваем оба видео на монтаже.
Speaker A
Вот результат. Уровень шестой. Скорость и время. Скорость время управляют ощущением сцены. Можно замедлить момент, ускорить процесс или вовсе заморозить время.
Speaker A
Первый пример слоу-моралли. Машина входит в занос на грязной трассе. Камера у самой земли, грязь летит в объектив. Для генерации взял грок. Не с первой попытки, но он справился. Второй пример - застывшее время. Вся сцена будто на паузе, как в фильме Люди X, где
Speaker A
ртуть спасает мутантов от взрыва. Используем клинк в 4К, так как физика сложная и часть объектов заморожена, а персонаж двигается и взаимодействует с объектами. Уровень седьмой. Копируем движение. Этот приём нужен, когда персонаж должен повторить определённое [музыка] движение, например, танец,
Speaker A
походку, жест или боевое действие. Работает [музыка] очень просто. В клинк открываем раздел Motion Control.
Speaker A
Выбираем один из шаблонов или добавляем своё видео, например, с популярным танцем. Рядом добавляем своего персонажа. Я взял хомяка. Генерируем и смотрим на результат.
Speaker A
[музыка] Отлично, мы прошли семь базовых уровней и уже можем создавать впечатляющие кадры. Однако то, что я покажу вам на восьмом уровне, полностью перевернёт ваше представление о видеогенерации и её возможностях. Но сперва ответим на главный вопрос: а как заработать на
Speaker A
полученных знаниях? Одно из самых прибыльных и перспективных направлений - это YouTube. Например, наш канал Roomis Reactions [музыка] вышел на монетизацию за 2 недели и в первый же месяц принёс 20.000 долларов. Весь процесс я показал в этом ролике, как мы создали канал,
Speaker A
[музыка] генерировали контент и вышли на результат. А если вы также хотите научиться создавать качественный контент [музыка] с нейросетями, работать удалённо и получать стабильный доход, приходите на обучение VisзаV Academy. С моим личным наставничеством вы пройдёте все этапы от создания канала и выбора
Speaker A
ниши до вашего первого дохода. Более того, я даю гарантию выхода на монетизацию, но места с личным наставничеством ограничены. Записаться на обучение можно по ссылке в описании.
Speaker A
А мы продолжаем. Уровень восьмой. Sedens и сториборд. Сейчас я покажу вам, как генерируются самые сложные и эффектные сцены. До сих пор фаворитом в наших генерациях был клинк. Однако сиден задаёт совершенно новую планку, и мы наглядно увидим эту разницу. Сперва я
Speaker A
покажу результат, а затем инструкцию. И первый пример. Джокер в больнице. was that I needed to be fixed.
Speaker A
But the dark cure me doctor. The dark just me how to разницу. Клинк выдаёт неплохую картинку, но SedНС выжимает максимум эмоций и харизмы. Как это повторить?
Speaker A
Сгенерировать такую сцену несложно. Сперва создаём картинку Исходник в chatчат GPT в максимальном реализме. Промп у вас на экране, но вы можете описывать всё своими словами. Шаг второй. Видео. [музыка] Заходим в сервис invvideo.
Speaker A
Выбираем модель Sedens 2.0. Загружаем нашу картинку с джокером. Добавляем промпт, где мы описываем действия на русском языке, а речь джокера на английском. Разрешение 720 либо 1080 пикселей. 15 [музыка] секунд продолжительность. Отправляем на генерацию и получаем наш результат.
Speaker A
Теперь задача посложнее. Сражение героя с зомби. Смотрим результат в Sens. [крик] [стон] Результат просто великолепный. А теперь посмотрим, как с этим справится Клинк.
Speaker A
[крик] Картинка рассыпается. Сложные многокадровые сцены Клинк пока не вывозит. Чтобы получить такой результат в Senss, нам нужен сториборд. Что такое сториборд? Это раскадровка всего видео.
Speaker A
Вспомните пятый уровень. Там мы задавали только первый и последний кадр. А всё остальное между ними нейросеть придумывала сама.
Speaker A
Сториборд убирает эту лотерею. Мы заранее показываем для нейроти каждый ключевой кадр и получаем ровно то видео, которое задумали. В этом весь секрет идеальной генерации. Создать сториборд довольно просто. Открываем чат GPT и просим написать два промта. Первый для детальной внешности главного героя.
Speaker A
Второй сториборд на 12 тире15 кадров. Описывайте в промте всё своими словами. Какого хотите персонажа и что должно происходить на видео? Ориентир такой: один кадр сториборда - это 13 секунды видео. Для пятнадцатисекундного ролика это от пяти до 15 кадров. Чем больше
Speaker A
кадров, тем точнее контроль над видео. Мои промты я оставил в файле в Телеграме. Можете начать с них. Когда промты готовы, открываем Nvido, раздел генерации картинок и модель GPT Image 2.
Speaker A
Персонажа генерируем в 2К, а сторибор в 4К, чтобы все мелкие детали сцены были чёткими. Сам CH GPT такое разрешение не выдаст, поэтому работаем именно здесь.
Speaker A
Если какой-то кадр не нравится, точечно редактируем его отдельным ромтом и доводим до идеала. У меня получился вот такой персонаж. Моё лицо и мультяшный стиль. И вот такой сториборд. Ракурс камеры постоянно меняется, но стиль и лицо сохраняются в каждом кадре.
Speaker A
Финальный шаг. Там же в Invidio открываем видеогенератор Sedens. Режим Reference. Длительность 15 секунд. Качество 1080 пикселей. Загружаем обе картинки героя и сториборд. Вставляем мой шаблонный промт для анимации. И важный нюанс, чтобы нейросеть поняла, где референс героя, а где раскадровка,
Speaker A
обращаемся к картинкам в промте через значок собачки. Отправляем на генерацию. И последнее. Видео не всегда получается идеальным с первой попытки. Простые сцены вроде джокера обычно выходят сразу, а сложный экшен вроде зомби может потребовать несколько генераций. Это нормально. Количество попыток зависит от
Speaker A
сложности вашей задумки. А на этом всё, друзья. В описании под роликом ссылочка на мой Telegram со всеми промтами, а также на моё обучение по заработку на YouTube с помощью нейросетей.
Speaker A
Подписывайтесь, чтобы не пропустить новые видео. До скорого. M.
Topics:видеогенерациянейросетиискусственный интеллектгенерация видеостиль видеокамера и ракурссвет и цветтаймлапсэкономия на генерациичат GPT











