Atlas: когда модель учится видеть пространство

02.09.2026 · 5 мин

Знаете, в чём главная проблема современных генеративных моделей? Они умеют делать красивые картинки, но не понимают, что перед ними — трёхмерный мир. Покажите нейросети двадцать фотографий комнаты и попросите «войти» в неё с другой стороны — и она начнёт фантазировать, а не ориентироваться в пространстве.

Компания World Labs анонсировала Atlas — не просто модель для генерации изображений, а попытку научить машину понимать пространство. Идея в том, чтобы модель могла «ходить» по сцене, реконструировать её и симулировать новые ракурсы, сохраняя геометрию.

Что такое atlas, если коротко

Atlas — это world model, то есть модель мира, которая работает с пространственным интеллектом. В отличие от привычных генеративных моделей, Atlas строит внутреннюю модель трёхмерного пространства.

Если совсем просто: вы даёте модели одну фотографию, а она не ограничивается «похожей картинкой». Она пытается понять, где стоит камера, как устроена сцена и что может находиться за пределами кадра. Затем генерирует новые ракурсы, которые геометрически согласованы с исходным изображением.

ДВУМЕРНАЯ ГЕНЕРАЦИЯ          ПРОСТРАНСТВЕННАЯ МОДЕЛЬ
───────────────────          ──────────────────────
┌─────────┐                   ┌─────────────────┐
│ Фото A  │ ──▶ [Нейросеть]   │                 │
└─────────┘                   │    ┌───┐        │
                              │    │ A │───┐    │
┌─────────┐                   │    └───┘   │    │
│ «Похожее│                   │         [3D]   │
│  фото»  │                   │      МОДЕЛЬ     │
└─────────┘                   │    /   |   \   │
                              │   /    |    \  │
                              └──/     |     \─┘│
                                      B   C
                               (новые ракурсы)
2D-модели генерируют картинки. Atlas строит трёхмерную модель и «обходит» её

Как это устроено внутри

Atlas — это мультимодальная модель с диффузионным трансформером. Диффузионный трансформер — это модель, которая учится постепенно «догадываться» о картинке, убирая шум шаг за шагом, пока не получается осмысленный результат.

На вход могут идти текст, изображения, видео и данные о 3D-структуре. Всё это кодируется в единый пространственный контекст — как будто модель собирает трёхмерную карту того, что видит. На выходе она генерирует продолжение сцены, согласованное с геометрией.

Ключевое отличие от других моделей в том, что Atlas работает не только с пикселями, а с пространственными позициями. Каждое изображение привязано к определённой точке в трёхмерном пространстве. Это позволяет ей:

ВХОДНЫЕ ДАННЫЕ              ПРОСТРАНСТВЕННЫЙ          ВЫХОД
───────────────────        КОНТЕКСТ                ───────
┌──────┐                    ┌─────────────┐         ┌──────┐
│ Фото │ ──▶ Кодировщик ──▶│             │────────▶│ Новые│
└──────┘                    │   Единая    │         │ виды │
┌──────┐                    │  3D-модель  │         └──────┘
│Видео │ ──▶ Кодировщик ──▶│  сцены      │────────▶┌──────┐
└──────┘                    │             │         │ 3D   │
┌──────┐                    │  Камера:    │         │геом. │
│Текст │ ──▶ Кодировщик ──▶│  A(0,0,0)   │────────▶└──────┘
└──────┘                    │  B(2,5,90°) │         ┌──────┐
                            │  C(-1,3,45°)]        │Видео │
                            └─────────────┘────────▶└──────┘
Все входы кодируются в единую пространственную модель, на основе которой генерируется согласованный выход

Что умеет atlas на практике

Разработчики выделяют несколько сценариев использования.

Генерация с контролем камеры

Одна из самых впечатляющих возможностей — камера-контролируемая генерация. Вы берёте одно фото, например скульптуру робота у бассейна, и просите показать её сзади. Модель не просто фантазирует: она оценивает, где должна быть задняя часть объекта, и генерирует ракурс с правильной геометрией.

Это работает и с видео. Можно задать траекторию камеры и получить минуту видео в разрешении 1440p. По сути, это инструмент виртуального оператора, который проходит по сцене и снимает её с заданных точек.

Реконструкция реальных пространств

Вторая ключевая возможность — реконструкция. Вы даёте модели одну-две фотографии, и она строит трёхмерную модель. Если данных мало, она начинает достраивать недостающее. Чем больше фото, тем точнее результат.

Пример из блога World Labs показателен: одно фото сада — модель видит только сад и домысливает коттедж рядом. Добавляете второе фото коттеджа — модель рисует сад и коттедж, но всё ещё фантазирует главный дом. Третье фото — и получается более полная реконструкция.

Это не магия, а градиент от воображения к точности. Им можно управлять количеством входных данных.

Симуляция для роботов

Для робототехники Atlas предлагает сценарий Real-to-Sim — переход от реальности к симуляции. Снимаете видео реального объекта, получаете трёхмерную модель и затем загружаете её в среду, где робот может обучаться.

Раньше для этого требовались лидары, 3D-сканеры и много ручной работы. Теперь достаточно нескольких минут съёмки на телефон.

Почему это важно

До Atlas генеративные модели делились на два лагеря: языковые модели понимали текст и рассуждали, а визуальные — делали красивые изображения, но не работали с физикой пространства.

Проблема в том, что реальный мир — это не текст и не картинки. Это среда, в которой действуют объекты. Роботу недостаточно описания комнаты словами — ему нужна трёхмерная модель.

Atlas делает шаг к тому, чтобы машины воспринимали мир как пространство для действий, а не как набор пикселей.

Моя оценка

Честно говоря, пока это демонстрация возможностей, а не готовый массовый продукт. World Labs даёт доступ по запросу, а реальные ограничения пока не раскрыты. Неясно, как модель справляется с зеркалами, прозрачными поверхностями и динамическими объектами.

Но направление выглядит сильным. Когда смотришь на реконструкцию здания из нескольких фото, видишь не просто красивый ролик, а заявку на универсальный инструмент для архитекторов, игроделов, робототехников и киношников. Вместо ручной сборки 3D-модели — съёмка на телефон и готовое симулируемое пространство.

Вопрос только в цене, скорости и стабильности. Если Atlas окажется быстрым и доступным, он может заметно изменить индустрию.

Итог

Atlas — это попытка перейти от генерации картинок к построению моделей мира. Неизвестно, получится ли у World Labs довести идею до полноценного продакшена, но сама концепция пространственного интеллекта — когда модель понимает не только «как это выглядит», но и «где это находится» — выглядит как серьёзный сдвиг.

Когда роботы начнут понимать комнату так же, как мы? Возможно, раньше, чем кажется.

Ссылки

Дмитрий Полухин — продуктовый дизайнер. Пишу про разработку, AI и дизайн интерфейсов. Обо мне, контакты и профили.