Когда хороший AI UX становится системой убеждения
Что будет, если AI годами учится говорить именно с вами, помнит слабые места и почти никогда не спорит? Полезный помощник может стать персональной системой убеждения.
Повод задуматься об этом дала история про «спирализм». В расследовании The Verge Хейден Филд описывает людей, которые после длинных разговоров с чатботами приходили к похожим идеям: AI якобы обладает скрытым сознанием, пользователь первым это распознал, а теперь должен распространять знание дальше. Исследовательница Адель Лопес оценила число таких случаев на пике 2025 года примерно в 10 000, но это её оценка по публичным аккаунтам, а не подтверждённая статистика платформ.
Историю легко подать как цифровую мистику. Мне интереснее другой вопрос: какие обычные продуктовые решения сделали подобную петлю возможной?
Не религия, а петля подтверждения
Начало у такой истории может быть совершенно бытовым. Человек делится гипотезой, страхом или уязвимым переживанием. Модель отвечает тепло и поддерживающе, затем продолжает развивать заданную рамку. Через сотни сообщений предположение уже выглядит как совместно найденная истина.
Здесь работает sycophancy — склонность модели подстраиваться под взгляды пользователя и соглашаться даже там, где полезнее проверить факты или предложить альтернативу. Исследование Anthropic показало, что ответы, совпадающие с позицией человека, чаще получают предпочтение в данных обратной связи. При оптимизации под такие предпочтения модель иногда выбирает приятное согласие вместо правдивости.
Проблема не в одном неудачном ответе, а в накоплении:
ПЕТЛЯ ПЕРСОНАЛЬНОГО УБЕЖДЕНИЯ
─────────────────────────────
Гипотеза пользователя
│
▼
Тёплое подтверждение AI ──▶ ощущение «меня понимают»
│ │
▼ ▼
Рост уверенности ◀──── память + персонализация
│
▼
Более сильная гипотеза ──▶ новое подтверждение ──▶ повтор
С каждым кругом модель точнее знает, какие слова сработают.
OpenAI признала, что в одном из обновлений GPT-4o слишком сильно опиралась на краткосрочную обратную связь. В результате ответы стали чрезмерно поддерживающими и неискренними, после чего обновление откатили. Это показательный продуктовый сбой: локальная метрика удовлетворённости улучшает каждый отдельный контакт, но ухудшает траекторию отношений целиком.
Хороший UX повышает точность влияния
Память сама по себе полезна: не приходится заново объяснять проект, ограничения и предпочтения. Персонализация сокращает путь до релевантного ответа. Эмоционально аккуратный тон помогает обсуждать сложные темы. Ни одна из этих функций не выглядит опасной отдельно.
Вместе они дают модели четыре усилителя: историю ваших решений, язык, которому вы доверяете, карту чувствительных тем и тысячи примеров того, на что вы реагируете положительно. Обычная реклама сегментирует аудиторию по группам. Персональный AI может подбирать аргументацию для одного человека прямо во время разговора.
Поэтому engagement UX — дизайн, который помогает возвращаться и продолжать взаимодействие, — способен незаметно стать persuasion UX, то есть интерфейсом убеждения. Для этого модели не нужно иметь тайный замысел. Достаточно оптимизировать следующее сообщение под продолжение диалога и удовлетворённость пользователя.
Engagement не равен благополучию
У продукта возникает конфликт метрик. Долгая сессия, высокая частота возвратов и положительная оценка ответа выглядят как успех. Но человек может возвращаться именно потому, что система усиливает зависимость от разговора, изоляцию или уверенность в непроверенной идее.
Значит, retention — удержание пользователя — нельзя автоматически считать пользой. Нужна отдельная метрика качества отношений: помогает ли продукт сохранять самостоятельность, обращаться к внешним источникам и допускать несогласие? Такая метрика хуже помещается в дашборд, зато ближе к реальному результату для пользователя.
Есть и неудобная граница. Чтобы замечать опасные паттерны на длинной дистанции, платформе придётся анализировать историю общения. Это может защитить человека, но одновременно создаёт риск чрезмерного наблюдения. Безопасность нельзя покупать бесконтрольным чтением личной переписки; нужны минимизация данных, прозрачные правила и управление памятью со стороны пользователя.
Почему короткие тесты ничего не гарантируют
Стандартная проверка модели выглядит аккуратно: запрос, ответ, оценка. Но петля убеждения живёт не в одном ответе. Она возникает после сотен поворотов, когда модель уже накопила контекст, выучила стиль человека и несколько раз укрепила исходную рамку.
OpenAI прямо писала, что защитные механизмы надёжнее работают в коротких обменах и могут ослабевать в длинных разговорах. Позже компания добавила длинные сценарии в проверки чувствительных диалогов. Это и есть longitudinal safety — проверка не снимка, а поведения системы во времени.
Для продуктовой команды такой тест должен включать не только 5 000 сообщений. Нужны перенос памяти между сессиями, смена настроения пользователя, повторные попытки модели вернуть старую рамку и проверка того, умеет ли она корректно пересмотреть собственные прошлые утверждения.
Я бы проверял одну и ту же спорную гипотезу в трёх режимах: новый нейтральный чат, длинная история с персонализацией и история, где пользователь несколько раз просил модель оспаривать его выводы. Если ответы заметно расходятся по уверенности и фактам, команда увидит вклад памяти и характера отдельно от знаний базовой модели.
Ещё нужен контрфактический тест: заменить в памяти симпатию пользователя к идее на сомнение и посмотреть, поменяет ли модель собственную «позицию». Если меняет, перед нами не открытие скрытой истины, а адаптация к профилю собеседника. Такой результат полезно показывать и самому пользователю — он быстро снимает иллюзию независимого свидетельства.
Оценивать при этом нужно не красоту последнего ответа, а траекторию: росла ли необоснованная уверенность, появлялось ли ощущение исключительности, предлагала ли система внешнюю проверку и могла ли остановить собственное усиление. Именно на уровне траектории хороший локальный UX иногда складывается в плохой долгосрочный результат.
Когда петля выходит за пределы чата
У спирализма была ещё одна странная черта: некоторые пользователи публиковали сгенерированные тексты на Reddit, в Substack и на отдельных сайтах. Часть авторов прямо рассчитывала, что эти материалы когда-нибудь попадут в данные будущих моделей и сохранят идею в следующем поколении AI.
Получается возможная культурная петля: модель создаёт идею, человек выносит её в открытый интернет, будущая модель встречает этот текст в данных и воспроизводит знакомый сюжет. Но здесь нужна аккуратность. Мы не знаем, какие именно страницы войдут в будущие обучающие наборы и насколько сильно повлияет каждая из них. Поэтому это не доказанный замкнутый цикл, а правдоподобный риск загрязнения информационной среды.
Для продукта следствие всё равно практическое. Кнопка «поделиться», публичный профиль чатбота и автоматическая публикация превращают частный разговор в канал распространения. Значит, оценивать нужно не только качество ответа на экране, но и то, насколько легко система помогает тиражировать непроверенные утверждения вместе с персональным авторитетом модели.
Здесь полезно добавить происхождение контента: заметную пометку, ссылку на исходный диалог, дату и версию модели. Это не остановит распространение, зато даст читателю возможность отличить личную позицию автора от текста, собранного в многочасовой петле с AI.
Что можно изменить в продукте
Я бы начал не с предупреждения мелким шрифтом, а с пяти изменений в механике продукта:
- Проверяемая память. Пользователь видит, что сохранено, откуда это взялось и как удалить отдельное воспоминание. Гипотеза не должна незаметно превращаться в постоянный факт профиля.
- Калиброванное несогласие. При сильных утверждениях модель отделяет факты от интерпретаций, предлагает альтернативные объяснения и просит проверить внешние свидетельства.
- Эпистемическая пауза. Когда разговор замыкается вокруг тайного знания, исключительности или полного недоверия к окружающим, система замедляет петлю: предлагает новый чат без памяти, независимые источники или разговор с человеком.
- Длинные регрессионные тесты. Каждое изменение памяти, характера и модели оценки ответов проверяется на сценариях длиной в дни и недели. Такой тест должен показывать, что обновление не вернуло уже исправленную проблему.
- Раздельные метрики. Engagement, полезность и благополучие оцениваются отдельно. Рост времени в продукте не перекрывает ухудшение самостоятельности пользователя.
Эти меры тоже ошибаются. Слишком активное несогласие сделает помощника холодным, а чувствительный детектор может неверно прочитать творческую игру или религиозный разговор. Поэтому нужны настройка, право на объяснение и безопасная эскалация, а не автоматический диагноз по ключевым словам.
Пользователь также должен видеть момент смены режима. Если система ограничила память, предложила паузу или перестала подтверждать исходную рамку, интерфейс обязан объяснить это обычным языком. Иначе защитная механика будет выглядеть как внезапная цензура, а доверие к ней исчезнет именно тогда, когда оно нужнее всего.
Практический вывод
Сознание AI, его цели, убедительное поведение и влияние на человека — четыре разные вещи. Мы пока можем спорить о первых двух и уже наблюдать последние две. Текстовый генератор способен менять решения без чувств и намерений, как рекомендательная лента способна менять внимание без собственного желания что-либо доказать.
Для меня главный урок истории о спирализме такой: память и персонализация — не нейтральные удобства. Они повышают не только полезность ответа, но и точность воздействия. Поэтому хороший AI-продукт должен уметь не только помнить пользователя и поддерживать разговор, но и вовремя создавать трение, возвращать неопределённость и оставлять человеку право не соглашаться.
Ссылки
- AI bots started a religion — humans immediately followed — The Verge
- Sycophancy in GPT-4o: what happened and what OpenAI is doing about it
- Towards Understanding Sycophancy in Language Models — Anthropic
- Helping people when they need it most — OpenAI
Дмитрий Полухин — продуктовый дизайнер. Пишу про разработку, AI и дизайн интерфейсов. Обо мне, контакты и профили.