Genie family
Введение
Сейчас набирают популярность генеративные видеомодели. В зависимости от цели они могут ставить разные акценты во время обучения. В этом обзоре мы разберём world-модели: модели-симуляции реального мира, модели с акцентом на геометричность и физичность, используемые для автономного транспорта и robotics.
Начнём мы, конечно, с основ — рассмотрим семейство world-моделей Genie от Deepmind. Сначала они не стремились к симуляции реального мира, а пытались генерировать игровой процесс. Но с каждым новым семейством — больше двигались в сторону соблюдения законов физики и геометричности генерируемого мира.
Этот пост — первый пост в трилогии разбора world-моделей. Давайте же и начнём его 🙂
Genie-1
Краткая характеристика
Genie-1 — первая генеративная интерактивная среда, представленная DeepMind в феврале 2024 года (p.s. даты важны в нашем повествовании 🙂). Эта модель способна не просто генерировать изображения или видео, а создавать полноценные виртуальные миры из одного промпта (изображения), где вы можете задавать определённый ряд действий.
Например:



Важный момент — модель обучена полностью в неконтролируемом режиме на более, чем 200 000 часов видео из интернет-игр, без аннотаций действий или текстовых описаний. Модель самостоятельно выделяет скрытое пространство действий, учится понимать динамику окружения и содержит 11 миллиардов параметров.
Давайте рассмотрим её подробнее:
Основные компоненты

Spatiotemporal Video Tokenizer
Цель токенизатора — принять сырое видео и сжать его в дискретные токены для снижения размерности.
Важный момент — сжимается только пространственная размерность. То есть входные T фреймов \(x(1:T)\) кодируются в z(1:T), а затем восстанавливаются обратно.

В качестве модели используется стандартный VQ-VAE со Spatial-Temporal блоками. Такой тип блоков кодирует видео не как ряд независимых изображений, а как видеопоток.
💡VQ-VAE
VQ-VAE (Vector Quantized Variational Autoencoder) — автокодировщик, который сжимает данные (например, изображение) не в непрерывный вектор, как обычный VAE, а в набор дискретных кодов из заранее заданного словаря (codebook). Это похоже на то, как текст представляется токенами, только здесь токенизируется изображение.
Энкодер сначала выдаёт обычный непрерывный вектор (как и в любом автокодировщике). Затем он квантуется: для него ищется ближайший по расстоянию вектор в codebook — и дальше декодер работает уже с этим «ближайшим соседом», а не с исходным непрерывным выходом энкодера.

Чтобы изучить подробнее его работу, можно посмотреть мою лекцию 😊
VQ-VAE со Spatial-Temporal блоками

Если мы хотим учитывать взаимодействие между кадрами, самое простое решение здесь — посмотреть attention кадров по отношению ко всем. Но видео из T фреймов размером H×W токенов — это T·H·W токенов в сумме. При 16 фреймах и сетке 16×16 токенов — это уже ~65K токенов, что является вычислительно сложной задачей.
ST-блок решает это разделением внимания по осям:
Spatial attention — берём один временной шаг t и смотрим, как каждый пространственный токен соотносится со всеми остальными в том же фрейме. Модель учится понимать, что находится рядом в пространстве.
Temporal attention — берём один пиксель (i, j) и смотрим, как он связан с тем же пикселем в предыдущих фреймах. Тут используется causal-внимание — модель не может заглядывать в будущее. Она учится понимать, как это место изменялось во времени.
Latent action model (LAM)
Как уже было сказано выше, в генерируемой среде можно выполнять различные действия. Для получения контроля над действиями (actions) мы будем добавлять дополнительный conditioning (обусловленность) каждого следующего кадра на действие, сделанное в предыдущем. Обучение с учителем здесь будет дорогим (сложная разметка данных), поэтому авторы предлагают обучить LAM без учителя, на имеющихся видео.

Для этого мы обучаем небольшую VQ-VAE модель, которая имеет кодбук из маленького набора возможных латентных действий (например, 8 штук).
Энкодер LAM принимает фреймы \(x_1…x_{t+1}\) и выдаёт
Авторы Genie показывают — значения латентных действий остаются относительно консистентными даже на разных промптах и сгенерированных мирах. То есть один и тот же код (например, действие №3) часто вызывает похожий эффект в разных, визуально непохожих окружениях.
Конкретные действия
У кодов нет «названий» — это безымянные дискретные индексы (0, 1, 2, …, 7). Модель ничего не подписывает; что именно делает каждый код — зависит от данных, на которых обучалась модель (в основном это 2D-платформеры), и выясняется уже эмпирически, через наблюдение за результатами. При этом маленький размер кодбука (всего 8 действий) выбран специально — авторы хотели, чтобы пространство оставалось компактным и легко интерпретируемым.
Dynamic model
Динамическая модель обучается авторегрессионно (кросс-энтропийный лосс): на каждом шаге
Дополнительно во время обучения часть входных токенов маскируется.

Как теперь работает инференс:
- Сначала мы подаём на вход первое изображение —
\(x_1\) . Оно будет описывать наш мир, где происходят действия. Изображение проходит через токенизатор-энкодер для получения латента \(z_1\). - Юзер задаёт action \(a_1\) из нашего словаря, выбирая определённое значение от 0 до размера словаря.
- Модель получает на вход \(z_1\) и \(a_1\) и предсказывает следующий кадр \(z_2\). Затем авторегрессионно генерируются кадры, где каждый раз юзер подаёт новое действие.

Результаты и ограничения
Различные игровые среды




На вход можно подавать скетч-картинку:




И даже использовать real-world картинки:




Genie-2
Итак, проходит меньше года и…. в декабре 2024 Deepmind презентует новую модель — Genie-2. В отличие от предыдущей версии, информации в разы меньше. Ни технического репорта, ни статьи, просто блог-пост. И нет информации ни о размерах модели, ни о данных, на которых это всё обучалось, никаких деталей, как именно оно обучалось. А вот то, чем с нами поделились — давайте обсудим 🙂
Краткая характеристика
Важный момент — здесь перешли на диффузионный генератор. Вся модель представляет собой авторегрессионную латентную диффузию (два подхода в одном!). Что это значит?
Авторегрессия работает на уровне времени: модель получает латентные представления предыдущих кадров и последнее действие пользователя, предсказывает следующий кадр.
Диффузия работает внутри этого предсказания: сам кадр не генерируется за один проход — он итеративно восстанавливается из шума, а conditioning-сигналом служит тот самый контекст из прошлых кадров и действий. То есть авторегрессия задаёт структуру времени, диффузия отвечает за качество каждого отдельного момента.
Для улучшения управляемости используется classifier-free guidance (CFG): модель обучается как с conditioning на действие, так и без него, а во время инференса предсказания взвешиваются так, чтобы усилить влияние конкретного действия на генерацию. Это стандартный приём из диффузионных моделей для изображений, но здесь он применяется к динамике мира — CFG фактически регулирует, насколько точно мир реагирует на то, что делает игрок.
💡CFG (Classifier-Free Guidance) — техника, которая усиливает влияние условия на генерацию в диффузионных моделях.
Модель учится работать в двух режимах — условном (например, с промптом или действием) и безусловном (без него). Во время обучения условие случайным образом заменяют на пустое с некоторой вероятностью — одна и та же сеть учится предсказывать и с условием, и без.
На инференсе на каждом шаге диффузии модель делает два forward pass’а: один — с условием, второй — без. И результат комбинируется по формуле:
результат = безусловный + scale × (условный − безусловный)
Чем выше scale (guidance scale), тем сильнее генерация соответствует к условию, но может теряться разнообразие.

Genie-2 разворачивает всё окружение из единственного входного изображения, сгенерированного через Imagen 3 по текстовому описанию или обычной фотографии пользователя. 3D-сцены на входе нет — вся геометрия выводится из одного кадра, а затем поддерживается по мере того, как игрок движется по миру.
Что умеет Genie-2
Разница между способностями Genie-1 и Genie-2 велика (а между ними меньше года!). Genie-1 ограничен двумерными окружениями — простыми 2D-платформерными сценами, а персонажи часто выглядели размыто (было маленькое разрешение и низкий fps), а играбельность длилась около двух секунд. Genie-2 работает с полноценными трёхмерными мирами и генерирует их консистентно на значительно более длительные периоды.


Обратите внимание на 3D-консистентность:

Корректно генерирует физические свойства: дым и моделирование воды.


Генерация видео может быть достаточно долгой.
И мы можем делать контроль текстом:


Таким образом, мы видим заметный шаг по сравнению c Genie-1 с учётом непродолжительного промежутка между ними. Но и это не всё — давайте посмотрим на следующую модель из этого семейства 🙂
Genie-3
Чем лучше модель, тем меньше мы про неё знаем от Deepmind 🙂 Поэтому в этом пагарафе мы поговорим о том, что она умеет.
Genie-3 строится на двух предшественниках одновременно: на Genie-2, который умел генерировать новые окружения для агентов, и Veo 3 — видеогенеративной модели с пониманием физики.
💡Veo

Промпт
- Prompt: The scene opens with a top-down or wide-angle shot showcasing a vast, perfectly flat, neutral-colored surface – perhaps the polished concrete floor of an enormous, empty aircraft hangar, or a giant, minimalist tabletop stretching beyond the frame, under bright, even, shadowless studio lighting. This surface is meticulously covered with thousands upon thousands of small, identical, brightly colored paper squares, arranged in a simple, orderly grid. Each square is a single, vibrant, uncreased sheet – a sea of reds, blues, yellows, greens, oranges, creating a stunning, static mosaic of pure potential. The atmosphere is one of quiet anticipation, a sense of immense latent energy waiting to be unleashed. There is no visible mechanism, no hint of how these papers might be manipulated. Within an 8-second sequence, initiated by an unseen cue – perhaps a subtle, almost inaudible, low-frequency hum that ripples almost invisibly across the surface, or a sudden, soft flash of diffused light – all the thousands of paper squares simultaneously, and with breathtaking precision, leap a few inches into the air as if startled into life. Then, in a mesmerizing, perfectly synchronized, and incredibly high-speed aerial ballet, they begin to fold themselves in mid-air. With impossible, almost magical celerity and accuracy, unseen forces guide each individual square through a complex series of sharp creases, neat tucks, and intricate folds. The swarm of fluttering, self-constructing papers is a blur of color and motion, a chaotic yet utterly controlled explosion of activity. Within a mere five to six seconds, this frenetic process of airborne origami completes. Each of the thousands of squares has transformed into an identical, perfectly formed, complex origami figure – perhaps graceful cranes with outstretched wings, delicate multi-petaled lotus flowers, or miniature, intricately detailed dragons. In the final two to three seconds of the sequence, these newly formed origami figures, still hovering in mid-air, then smoothly and rapidly arrange themselves, like a flock of perfectly trained birds or a sophisticated, self-organizing swarm of nanobots, into a stunning, larger, three-dimensional collective pattern or a recognizable mosaic image – perhaps a giant, hovering sphere composed of countless tiny birds, or a complex, flowing wave of flowers, or even a pixel-perfect, three-dimensional representation of a face or symbol. This collective sculpture holds its form for a beat before the individual origami figures begin to gently, gracefully, and silently settle back down onto the surface, now arranged in their magnificent new configuration. This entire rapid, impossible, and beautiful transformation – from simple squares to a synchronized swarm of self-folding forms creating a complex collective artwork – is the core, eye-popping, and meticulously detailed VFX spectacle of the 8-second sequence. The visual is one of magical precision, emergent complexity, and the beauty of mass synchronized action
Veo 3 (и её обновлённая версия Veo 3.1) — модель генерации видео от Deepmind, которая вышла в мае 2025 года. Главное нововведение здесь — нативная генерация аудио (диалоги, звуковые эффекты, ambient noise и музыка), синхронизированная с визуалом.
Что же она умеет?
- Разрешение и длительность: до 4K, 24 fps, клипы по 4–8 секунд (с возможностью расширения). Поддержка разных соотношений разрешений landscape (16:9) и portrait (9:16).
- Входы: текст, изображение, видео (для Veo 3.1). Можно использовать reference images (до 3 штук) для контроля персонажей / объектов, расширять существующие клипы, генерировать переходы между первым и последним кадром.
- Физика и реализм: значительно улучшена симуляция физики, освещение, отражения, движение камеры, consistency персонажей и окружения.
- Аудио: генерирует речь с липсинком, звуковые эффекты, фоновые шумы и музыку автоматически (!).
Деталей мы не знаем (тех репорт на 7 страниц?), но понимаем, что это латентная диффузионная модель на основе DiT (там ещё много слов про safety, но без подробностей про данные и обучение).

Зато мы можем посмотреть на красивые результаты 🙂
В то время, как Veo3 создаёт высококачественные cinematic видео, Genie-3 генерирует интерактивные 3D-подобные миры для исследования и взаимодействия. И использует понимание физики из Veo, но создаёт не просто видео, а симулируемую среду.
Давайте подробнее посмотрим на её способности.
Что умеет Veo3
Long horizon memory
Genie-3 расширяет long horizon memory до нескольких минут, поддерживая визуальную консистентность на более длинных промежутках взаимодействия. По сравнению с Genie-2, где окружение держалось 10–60 секунд, это большой шаг. При этом Genie-3 генерирует с 24 fps и 720р разрешением.
Физичность мира становится лучше, можно сравнить качество симуляции воды для Genie-2 и Genie-3.


При этом качественно работает память — мы не забываем места, где были, и видео получается достаточно консистентным.

Управление
Одна из самых приятных фичей — управляемость.
Появилась новая возможность — promptable world events — способность менять уже сгенерированный мир через отдельный промпт. То есть не только задавать сцену на старте, но и вмешиваться в неё 🙂









Заключение
Итак, сегодня мы познакомились с world-моделями. У Deepmind нет подробностей о том, как собирать их задумки, зато можно посмотреть на качественные результаты генерации и поиграться самим!
В следующем обзоре поговорим про семейство моделей Cosmos от Nvidia — и вот там окунёмся во все интересные детали. Stay tuned! 😎

