Atlas: когда модель учится видеть пространство
Знаете, в чём главная проблема современных генеративных моделей? Они умеют делать красивые картинки, но не понимают, что перед ними — трёхмерный мир. Покажите нейросети двадцать фотографий комнаты и попросите «войти» в неё с другой стороны — и она начнёт фантазировать, а не ориентироваться в пространстве.
Компания World Labs анонсировала Atlas — не просто модель для генерации изображений, а попытку научить машину понимать пространство. Идея в том, чтобы модель могла «ходить» по сцене, реконструировать её и симулировать новые ракурсы, сохраняя геометрию.
Что такое atlas, если коротко
Atlas — это world model, то есть модель мира, которая работает с пространственным интеллектом. В отличие от привычных генеративных моделей, Atlas строит внутреннюю модель трёхмерного пространства.
Если совсем просто: вы даёте модели одну фотографию, а она не ограничивается «похожей картинкой». Она пытается понять, где стоит камера, как устроена сцена и что может находиться за пределами кадра. Затем генерирует новые ракурсы, которые геометрически согласованы с исходным изображением.
ДВУМЕРНАЯ ГЕНЕРАЦИЯ ПРОСТРАНСТВЕННАЯ МОДЕЛЬ
─────────────────── ──────────────────────
┌─────────┐ ┌─────────────────┐
│ Фото A │ ──▶ [Нейросеть] │ │
└─────────┘ │ ┌───┐ │
│ │ A │───┐ │
┌─────────┐ │ └───┘ │ │
│ «Похожее│ │ [3D] │
│ фото» │ │ МОДЕЛЬ │
└─────────┘ │ / | \ │
│ / | \ │
└──/ | \─┘│
B C
(новые ракурсы)
Как это устроено внутри
Atlas — это мультимодальная модель с диффузионным трансформером. Диффузионный трансформер — это модель, которая учится постепенно «догадываться» о картинке, убирая шум шаг за шагом, пока не получается осмысленный результат.
На вход могут идти текст, изображения, видео и данные о 3D-структуре. Всё это кодируется в единый пространственный контекст — как будто модель собирает трёхмерную карту того, что видит. На выходе она генерирует продолжение сцены, согласованное с геометрией.
Ключевое отличие от других моделей в том, что Atlas работает не только с пикселями, а с пространственными позициями. Каждое изображение привязано к определённой точке в трёхмерном пространстве. Это позволяет ей:
- реконструировать сцену из нескольких фотографий;
- генерировать новые ракурсы с точным контролем камеры;
- заполнять пробелы на основе знаний о мире и общей геометрии сцены.
ВХОДНЫЕ ДАННЫЕ ПРОСТРАНСТВЕННЫЙ ВЫХОД
─────────────────── КОНТЕКСТ ───────
┌──────┐ ┌─────────────┐ ┌──────┐
│ Фото │ ──▶ Кодировщик ──▶│ │────────▶│ Новые│
└──────┘ │ Единая │ │ виды │
┌──────┐ │ 3D-модель │ └──────┘
│Видео │ ──▶ Кодировщик ──▶│ сцены │────────▶┌──────┐
└──────┘ │ │ │ 3D │
┌──────┐ │ Камера: │ │геом. │
│Текст │ ──▶ Кодировщик ──▶│ A(0,0,0) │────────▶└──────┘
└──────┘ │ B(2,5,90°) │ ┌──────┐
│ C(-1,3,45°)] │Видео │
└─────────────┘────────▶└──────┘
Что умеет atlas на практике
Разработчики выделяют несколько сценариев использования.
Генерация с контролем камеры
Одна из самых впечатляющих возможностей — камера-контролируемая генерация. Вы берёте одно фото, например скульптуру робота у бассейна, и просите показать её сзади. Модель не просто фантазирует: она оценивает, где должна быть задняя часть объекта, и генерирует ракурс с правильной геометрией.
Это работает и с видео. Можно задать траекторию камеры и получить минуту видео в разрешении 1440p. По сути, это инструмент виртуального оператора, который проходит по сцене и снимает её с заданных точек.
Реконструкция реальных пространств
Вторая ключевая возможность — реконструкция. Вы даёте модели одну-две фотографии, и она строит трёхмерную модель. Если данных мало, она начинает достраивать недостающее. Чем больше фото, тем точнее результат.
Пример из блога World Labs показателен: одно фото сада — модель видит только сад и домысливает коттедж рядом. Добавляете второе фото коттеджа — модель рисует сад и коттедж, но всё ещё фантазирует главный дом. Третье фото — и получается более полная реконструкция.
Это не магия, а градиент от воображения к точности. Им можно управлять количеством входных данных.
Симуляция для роботов
Для робототехники Atlas предлагает сценарий Real-to-Sim — переход от реальности к симуляции. Снимаете видео реального объекта, получаете трёхмерную модель и затем загружаете её в среду, где робот может обучаться.
Раньше для этого требовались лидары, 3D-сканеры и много ручной работы. Теперь достаточно нескольких минут съёмки на телефон.
Почему это важно
До Atlas генеративные модели делились на два лагеря: языковые модели понимали текст и рассуждали, а визуальные — делали красивые изображения, но не работали с физикой пространства.
Проблема в том, что реальный мир — это не текст и не картинки. Это среда, в которой действуют объекты. Роботу недостаточно описания комнаты словами — ему нужна трёхмерная модель.
Atlas делает шаг к тому, чтобы машины воспринимали мир как пространство для действий, а не как набор пикселей.
Моя оценка
Честно говоря, пока это демонстрация возможностей, а не готовый массовый продукт. World Labs даёт доступ по запросу, а реальные ограничения пока не раскрыты. Неясно, как модель справляется с зеркалами, прозрачными поверхностями и динамическими объектами.
Но направление выглядит сильным. Когда смотришь на реконструкцию здания из нескольких фото, видишь не просто красивый ролик, а заявку на универсальный инструмент для архитекторов, игроделов, робототехников и киношников. Вместо ручной сборки 3D-модели — съёмка на телефон и готовое симулируемое пространство.
Вопрос только в цене, скорости и стабильности. Если Atlas окажется быстрым и доступным, он может заметно изменить индустрию.
Итог
Atlas — это попытка перейти от генерации картинок к построению моделей мира. Неизвестно, получится ли у World Labs довести идею до полноценного продакшена, но сама концепция пространственного интеллекта — когда модель понимает не только «как это выглядит», но и «где это находится» — выглядит как серьёзный сдвиг.
Когда роботы начнут понимать комнату так же, как мы? Возможно, раньше, чем кажется.
Ссылки
- Оригинальный анонс Atlas на сайте World Labs — источник материала о модели Atlas и её возможностях
Дмитрий Полухин — продуктовый дизайнер. Пишу про разработку, AI и дизайн интерфейсов. Обо мне, контакты и профили.