Почему AI-видео нарушает физику и как исправить движение

Разбираем, почему нейросеть искажает движение, и даём практический тест для TryVeo: падения, жидкости, автомобилей, рук, людей и камеры без лишней магии.

Published

Updated

Topic: Реализм, физика и управление движением в AI-видео

Кинематографичная сцена с падающим металлическим предметом и человеком, наблюдающим за движением в естественном свете

Кинематографичный кадр не всегда означает правдоподобное движение. Нейросеть может красиво построить свет, цвет и глубину резкости, но при этом нарушить инерцию, контакт предметов или последовательность причины и следствия. Именно поэтому ролик иногда выглядит «дорого» на первом кадре и распадается, как только объект начинает двигаться.

Для автора важен не вопрос «какая модель понимает физику лучше всех», а более прикладной: как заранее обнаружить риск в конкретной сцене и снизить его. Ниже — рабочий подход для TryVeo: разделить визуальную выразительность и физическую согласованность, проверять движение короткими тестами и не заставлять один клип решать сразу несколько сложных задач. Для знакомства с базовыми принципами можно использовать полное руководство по генерации AI-видео, но физические ошибки требуют отдельной диагностики.

Кинематографичность не равна физической правдоподобности

Визуальная «кинематографичность» складывается из композиции, контраста, движения камеры, света и ритма монтажа. Физическая правдоподобность — из другой группы признаков: объект сохраняет форму, масса влияет на ускорение, поверхность удерживает контакт, жидкость подчиняется ёмкости, а человек не меняет длину шага без причины. Эти качества могут существовать независимо. Статичный рекламный кадр способен выглядеть убедительно, тогда как его продолжение покажет лишний палец, скользящую чашку или автомобиль, который меняет траекторию без поворота колёс.

Показателен результат исследования T2VPhysBench на arXiv. Авторы проверяли текст-видео-системы по двенадцати физическим законам и сообщают, что все исследованные модели получили средние показатели ниже 0,60 в каждой категории. Важен и второй вывод: подробное описание физических законов в подсказке само по себе не устранило нарушения. Значит, длинный промпт с терминами вроде «реалистичная гравитация» не заменяет ясную постановку, короткий тест и отбор результата.

Пять тестовых сцен для TryVeo

Полезнее начинать не с готового рекламного ролика, а с набора маленьких испытаний. Каждый тест отвечает на один вопрос: сохраняется ли контакт, форма, траектория или масштаб? Сгенерируйте короткий вариант с нейтральной камерой, а уже потом добавляйте стиль. Так легче понять, что именно сломалось: действие или его визуальная подача.

Матрица проверки движения

Практическая схема постановки сцен; она не является отдельным измерением качества моделей.

СценаЧто проверятьКогда упроститьСледующий шаг
Падение предметаЕдиная траектория, ускорение, контакт с поверхностью, отсутствие скачка масштабаЕсли предмет вращается, отскакивает и сталкивается с другими объектами одновременноОставить один предмет и один контакт; затем продолжить сцену
Наливание жидкостиСвязь струи с ёмкостью, уровень жидкости, направление потока, сохранение формы стаканаЕсли в кадре есть прозрачная посуда, брызги, лёд и резкое движение камерыСначала снять спокойное наливание крупным планом
Движение автомобиляПоложение колёс, контакт шин с дорогой, поворот кузова и согласованность фонаЕсли автомобиль одновременно дрифтует, тормозит и объезжает препятствиеРазделить старт, поворот и остановку на клипы
Руки и предметКоличество пальцев, точки захвата, давление, перекрытия и непрерывность объектаЕсли руки передают предмет, закрывают его и взаимодействуют с мелкими деталямиИспользовать крупный, простой объект и один жест
Проход человека мимо камерыДлина шага, контакт стопы с землёй, масштаб тела, параллакс фонаЕсли человек быстро меняет направление или проходит через толпуЗафиксировать камеру и оставить один проход
Сложное движение камерыСтабильность геометрии, относительные скорости объектов, сохранение горизонтаЕсли есть орбитальный облёт, приближение, поворот и перекрытияНачать с одного плавного движения и продолжить удачный клип

Sources: arXiv

В сцене с падением сначала проверьте гравитацию и финальный контакт. Предмет должен двигаться по одной понятной траектории, а не исчезать перед поверхностью или менять вес в последний момент. Если нужен отскок, задайте его отдельным действием. Для рекламного кадра часто лучше показать падение до касания, а сам удар вынести в следующий клип: зритель достроит событие, а модель не будет обязана достоверно просчитать лишнюю фазу.

Жидкость особенно чувствительна к форме сосуда и точке входа. Начните с непрозрачной или простой прозрачной ёмкости, одного источника потока и неподвижной камеры. Проверяйте, остаётся ли струя соединённой с бутылкой, поднимается ли уровень внутри стакана и не превращается ли жидкость в твёрдую ленту. Брызги, лёд и отражения лучше добавлять после того, как базовое наливание уже выглядит непрерывным.

Автомобиль проверяют по связке «колёса — кузов — дорога». При повороте направление колёс, наклон кузова и движение фона должны сообщать одну и ту же историю. Для проходящего человека главный тест — стопа и поверхность: если шаг скользит, тело внезапно вытягивается или перспектива меняется без движения камеры, эффект присутствия исчезает. Руки требуют ещё более строгого контроля: попросите модель выполнить один захват без передачи предмета и не перегружайте кадр мелкими деталями.

Как формулировать сцену и промпт

Промпт для движения удобнее строить слоями. Сначала назовите субъект и его положение, затем одно действие, поверхность или объект взаимодействия, движение камеры и визуальный стиль. Важен порядок событий: «рука берёт чашку с края стола, поднимает её и останавливается» понятнее, чем набор разрозненных пожеланий «реалистичная рука, динамика, кинематографично, физика». Не обещайте модели сразу целую сцену из нескольких причинно связанных действий.

  1. Опишите неподвижное начальное состояние: кто или что находится в кадре, где стоит объект и какая поверхность его поддерживает.
  2. Назовите одно видимое действие и его направление: падает вниз, скользит вправо, поворачивает налево, входит в стакан.
  3. Укажите ограничение, которое можно проверить: объект сохраняет форму, рука не закрывает предмет полностью, камера движется плавно.
  4. Сначала задайте нейтральный или медленный темп, затем увеличивайте сложность в отдельной генерации.
  5. Проверьте первые и последние кадры, а также середину клипа: физическая ошибка часто появляется не в эффектном начале, а во время перехода.
  6. Сохраните удачный результат как основу для продолжения, вместо того чтобы заново описывать всю сцену с нуля.

Полезно избегать отрицательных требований, которые не связаны с действием. Длинный список «не искажать, не ломать, не менять, не добавлять» может превратить задачу в набор конфликтующих ограничений. Лучше заменить его наблюдаемым описанием: «левая рука удерживает ручку чашки, пальцы остаются за ручкой, чашка сохраняет цилиндрическую форму». Такой текст не гарантирует идеальный результат, но делает ошибку диагностируемой.

Когда разбивать сцену и использовать референс

Разбивайте действие на клипы, если в нём есть смена причины: предмет сначала падает, затем сталкивается с поверхностью, затем отскакивает; автомобиль сначала разгоняется, потом поворачивает и тормозит. На каждом этапе меняется набор проверок. Короткие фрагменты также дают больше контроля над монтажом: неудачный контакт можно заменить, не пересобирая весь ролик.

Референсный кадр особенно полезен, когда важны геометрия, положение предмета, костюм, направление взгляда или стартовая композиция. Для последовательности кадров можно использовать подход image-to-video: инструмент анимации изображения в видео помогает начинать движение с зафиксированной визуальной основы. Референс не решает физическую задачу автоматически, но уменьшает число переменных: модели не нужно одновременно придумывать объект, освещение и его траекторию.

Продолжение сцены подходит, когда первый клип уже убедителен и нужно сохранить его персонажа, среду или направление движения. На практике это надёжнее, чем пытаться повторить идентичный объект в новом независимом запросе. При этом переход следует проверять отдельно: продолжение может сохранить общий вид, но изменить вес предмета, положение рук или скорость камеры. Если стык заметен, используйте монтажный план, перекрытие объектом или новый крупный план, а не бесконечное усложнение промпта.

Рабочий процесс: от физического теста к готовому ролику

Google DeepMind описывает Veo 3.1 как модель с улучшенной реалистичностью и соответствием реальной физике, а также показывает внутренние сравнения возможностей генерации и продолжения сцен. Это полезный ориентир, но не универсальное доказательство для любого сюжета: независимая проверка T2VPhysBench напоминает, что среда, действие и тип физического закона имеют значение. Поэтому модель следует оценивать на собственных сценах, а не только по демонстрационным кадрам.

В TryVeo удобно выстроить проверку в четыре прохода. Первый — статичный референс: убедитесь, что объект, человек и пространство выглядят правильно. Второй — одно действие с простой камерой. Третий — усложнение только одного параметра, например скорости или крупности плана. Четвёртый — монтаж: соедините удачные клипы и проверьте стыки. Если ошибка появилась после добавления облёта камеры, не переписывайте всё описание падения — вернитесь к стабильной версии и тестируйте движение камеры отдельно.

Итоговый критерий прост: зритель должен без объяснений понимать, что двигалось, почему оно двигалось и с чем соприкоснулось. AI-видео нарушает физику не потому, что ему всегда не хватает красивых слов, а потому, что одна генерация пытается согласовать слишком много переменных. Тестовая матрица, поэтапный промпт, референсные кадры и продолжение удачных сцен превращают это ограничение в управляемый производственный процесс.

Sources

  1. T2VPhysBench: A First‑Principles Benchmark for Physical Consistency in Text‑to‑Video Generation, arXiv — Benchmark проверяет двенадцать физических законов; все исследованные модели показали средний результат ниже 0,60 в каждой категории, а специальные физические подсказки не устранили нарушения.
  2. Veo 3.1 — Google DeepMind, Google DeepMind — Google описывает Veo как модель с улучшенной реалистичностью и соответствием реальной физике, а также публикует результаты внутренних сравнений возможностей генерации и продолжения сцен.