Главное Авторские колонки Пресс-релизы Промо Вакансии Вопросы
Выбор редакции:
😼
Выбор
редакции
401 0 В избр. Сохранено
Авторизуйтесь
Вход с паролем

Синтетические респонденты: может ли LLM заменить ответы реальных людей?

Эксперты отрасли оценивают текущее состояние и перспективы развития технологии генерации мнений потребителей с помощью больших языковых моделей.
Мнение автора может не совпадать с мнением редакции

Стоимость сбора данных растет, активность респондентов снижается, а молодая и высокодоходная аудитория не представлена в панелях в нужном объеме. В этих условиях появляется соблазн обратиться к инструментам, которые обещают мгновенную генерацию ответов. Но стоит ли следовать этому импульсу?

В статье разберем:

  1. Кто такие синтетические респонденты
  2. В чем их отличие от синтетических данных
  3. Как на их основе принимать бизнес-решения с высокими рисками


Сгенерировано в Magnific

Синтетические данные VS синтетические респонденты: уточняем понятия

Начнем с понятий, и сразу обозначим, что мы будем иметь в виду под каждым из них.

Синтетические данные — это ответы, сгенерированные LLM по промту исследователя в одном чате. Для этого задается выборка (например, 385 жителей мегаполисов, которые регулярно покупают онлайн) и ставится задача — ответить на вопросы анкеты от лица этой группы.

Каждый такой запуск — продукт нового «коллективного разума», который логически не связан с предыдущими генерациями. В его основе — большая языковая модель, созданная для решения самых разных задач. Поэтому поведение такой выборки чувствительно к промпту и внутренним смещениям модели. Незначительные изменения в формулировках или порядке вопросов могут существенно изменить результаты.

Синтетические респонденты (или синтетики) устроены иначе. Это ограниченный пул «цифровых копий» людей. У каждой — свой портрет: демография, профессия, увлечения, модель потребления. Они формируются заранее и хранятся в системе, а не генерируются каждый раз с нуля под запрос.

Ими управляет система из множества агентов: одни алгоритмы обучают синтетиков, другие формируют выборку, третьи проверяют логику ответов на анкету.

В этом основное отличие синтетических данных от синтетических респондентов. В первом случае вы каждый раз получаете «фантазию» о том, как бы ответил работающий житель города-миллионника. Во втором — ответ конкретного цифрового персонажа с заданными ему разработчиком характеристиками.

При этом важно не забывать, что «под капотом» у синтетических респондентов — все та же большая языковая модель со свойственными ей искажениями. Предвзятость, склонность к усреднению и чувствительность к формулировкам никуда не исчезают — все это спрятано под более сложной архитектурой продукта.

Поэтому вопрос о том, насколько синтетические респонденты отличаются от синтетических данных сводится к тому, насколько добросовестно провайдер дообучает модель, чтобы закрыть слабые места LLM.

Синтез живых мнений: прорыв или самообман?

«Одна из ключевых проблем — в том, что для создания хорошей модели явления нужно либо глубокое понимание механизмов формирования мнений и поведения в больших популяциях, либо большой устойчивый поток содержательных персональных данных, позволяющий точно их предсказывать.

В первом случае мы опираемся на знание о тенденциях, а не на точные модели (что в целом характерно для гуманитарного знания). Во втором случае данные уже есть, но доступ к ним ограничен и позволяет делать слишком обобщенные выводы.

Человек — существо биопсихосоциальное, и построить реалистичную модель, которая предсказывает, как все три уровня проявляются в мнениях и действиях, пока представляется слишком сложным. Текущие модели воспроизводят усредненные паттерны и стандартные сценарии, тогда как прорывные и продуктивные идеи часто лежат в „хвостах“ распределения — в редких мнениях и неожиданных реакциях.

При этом я не исключаю, что, как это было с прорывом в архитектуре LLM, в какой-то момент появится подход, позволяющий хорошо моделировать реальность, которую мы до конца не понимаем» — Игнат Богдан, руководитель центра цифровой социологии и социогуманитарных технологий в здравоохранении ГБУ НИИОЗММ ДЗМ

Три класса рисков, о которых не рассказывают вендоры

Существует три класса ошибок моделей. Разберем каждый из них по порядку.

1. Интернет = реальность: как это заблуждение искажает данные

Первый класс рисков — систематические смещения. Все начинается с обучающего корпуса. Большие языковые модели обучаются на текстах в сети, которые чаще всего написаны активными авторами с выраженной позицией — преимущественно на английском и с уклоном в политику. Молчаливое большинство сюда просто не попадает.

Далее идет пост-обучение с обратой связью от человека. Оно делает модель вежливой, осторожной и более усредненной, чем исходный корпус текстов.

Стереотипные «роли» в промптах превращают синтетика-пенсионера в карикатуру на образ пенсионера в медиа. Модель склонна давать социально желательные и гиперрациональные ответы — «как должно быть», а не «как на самом деле». Кроме того, ответы чувствительны к формулировке вопроса и порядку вариантов ответов: перестановка пунктов заметно сдвигает распределение.

Эмпирически это выглядит так: синтетика обычно попадает в средние значения, но сжимает дисперсию. Она «съедает» хвосты распределения и делает невозможным анализ подгрупп. В результате исследователь получает правдоподобную, но методически искажённую картину.

Синтетики способны воспроизводить общие тренды с ошибкой в 3-5 п.п. по топлайнам, но на уровне подгрупп ошибки достигают критических значений в 10-30%. По сути они усредняют то, что уже есть в данных, не добавляя ничего нового о поведении реальных людей.
На данном этапе синтетика оправдана для пилотажа анкет, быстрой проверки гипотез и добора «респондентов» в труднодостижимых сегментах, по которым есть реальные данные для валидации ответов. Платить за синтетику для замены полевого исследования я пока не готов,

— прокомментировал Вячеслав Поспелов, СЕО Kelva Tech, компании-разработчика AI-ассистентов для маркетинговых и PR-агенств

2. Коллапс моделей: как нейроконтент снижает разнообразие

Второй класс рисков опасен в ближайшей перспективе. Нейроконтент, включая ответы синтетиков, будет попадать в обучающий корпус моделей следующего поколения. Сеть уже переполнена нейротекстами, которые технически сложно отличить от человеческих. Без притока живых человеческих рассуждений модель будет воспроизводить сама себя.

Этот эффект называют «коллапсом моделей». Чем больше синтетики на входе, тем хуже модель воспроизводит редкие случаи и тем лучше — усреднённые. Дисперсия схлопывается сильнее, чем в исходной модели. Картина становится логичной и правдоподобной, но недостоверной.

Еще один фактор, который нужно учитывать — скорость изменений. Текущий темп жизни, динамика глобальных процессов и высокая волатильность экономики меняют мнение и поведение реальных людей быстрее, чем адаптируется модель. Все это делает синтетиков ненадежным источником данных,

— пояснила Татьяна Мамонтова, руководитель направления маркетинговых исследований в ИКС Холдинг

3. Самосбывающееся пророчество: как синтетики формируют реальность

Третий класс рисков работает уже вне исследовательской инфраструктуры. Это выглядит так: исследователь получает синтетические инсайты и передаёт их в продукт, маркетинг, стратегию. На их основе принимаются решения: запускаются продукты, меняется коммуникация, публикуются отчеты.


Сгенерировано в Magnific

Реальные люди сталкиваются с этими продуктами и рекламой, и их поведение меняется. Данные об этом попадают сначала в сеть, а затем в обучающие корпуса. Модель следующего поколения обучается на реальности, которую сама же и создала, и подтверждает свою «правоту».

Это особенно опасно на чувствительных темах: от политических предпочтений до отношения к социальным группам. Модель генерирует «общественное» мнение, которое затем становится реальностью.

Иллюзия точности может быть опаснее случайной ошибки. Грубая ошибка в данных видна, ее можно заметить и отбраковать. В то время как гладкий, непротиворечивый, умный ответ модели вызывает доверие там, где происходят систематические ошибки — в хвостах распределения и структуре подгрупп. Чем правдоподобнее выглядит отчет, тем тщательнее его нужно проверять.

Почему синтетика особенно опасна на узких аудиториях

В этой связи у исследователя возникает резонное желание, если не полностью закрыть выборку синтетикой, то хотя бы добрать редкие и труднодостижимые группы респондентов.

Логика понятна. В неспециализированных панелях сложно собрать ответы жителей мегаполисов с высоким доходом или профильных врачей в нужном объеме. Под рукой оказывается инструмент, который обещает сгенерировать недостающие ответы за час. Обещание быстрого результата заглушает разумные доводы.

Почему это не работает? Для того чтобы синтетик адекватно отвечал за редкую группу, модели нужна обширная эмпирическая база именно по этой группе — десятки и сотни реальных интервью, опросных данных, поведенческих метрик. Если у провайдера панели этой базы нет, модель начинает заполнять пробелы стереотипами из медиа.

Чем реже и уязвимее группа (пенсионеры, жители малых городов, ЛПР в B2B-сегменте), тем сильнее синтетика превращает её в карикатуру из медийных стереотипов. Топ-менеджер начинает говорить цитатами из Forbes, а пенсионер — штампами из телевизионных сюжетов о пенсионерах.

Мои эксперименты подтверждают этот тезис. LLM хорошо воспроизводят мейнстрим культуру (типичное), но плохо редкие и необычные феномены. Поэтому без контроля за распределением ответов результаты рискуют быть банальными,

— прокомментировал Михаил Конинин, создатель проект «ОднаЦифра»

Цена ошибки в узких сегментах особенно высока. На данных о топ-менеджерах компании принимают дорогие стратегические решения. На данных о носителях редких заболеваний — медицинские. На данных о жителях малых территорий — социальные и инфраструктурные. И если в массовых аудиториях ошибка синтетиков размывается в средних значениях, то в узких группах она превращается в систематическое искажение.

Проверочный вопрос к вендору здесь один: есть ли у вас отдельная эмпирическая база по моей аудитории, или вы генерируете её из общих корпусов? Если второе — вы покупаете не респондентов, а литературную фантазию на тему.

Сейчас рынок движется к гибридным протоколам: синтетика — для итераций и скрининга, живые респонденты — для финальных замеров. Профессиональные стандарты (AAPOR, ASA) уже требуют прозрачности: документировать происхождение синтетики, проводить валидационные тесты, не смешивать синтетические и реальные данные без маркировки,

— рассказал Вячеслав Поспелов, СЕО Kelva Tech, компании-разработчика AI-ассистентов для маркетинговых и PR-агенств

Исследования с участием синтетических респондентов сейчас более актуальны для агентств. В текущих условиях заказчики нацелены на оптимизацию бюджетов и не готовы вкладываться в пилоты и экспериментальные методики, валидность которых только предстоит доказать,

— прокомментировала Татьяна Мамонтова, руководитель направления маркетинговых исследований в ИКС Холдинг.

Синтетики сегодня: в чем кроется опасность

Если собрать всё сказанное в одну мысль, она получится неудобной для провайдеров: на сегодняшнем уровне развития синтетические респонденты — опасный инструмент. Не бесполезный, но опасный — в том смысле, что его применение без понимания ограничений приводит к ложным данным и дорогим управленческим ошибкам. Проблема не в самой идее, а в состоянии индустрии, где пока не сложились единые стандарты валидации, общие протоколы тестирования на смещения и отраслевые критерии.

В этих условиях рабочая зона для синтетиков — всё, что не влияет на финальные решения. Первичное погружение в проблематику, генерация гипотез, пилотаж инструментарияв. Везде, где ошибки обходятся дешево и будут обнаружены на последующих этапах. Опросы реальных респондентов пока остаются тем фундаментом, без которого синтетики превращаются в набор медийных стереотипов с привлекательным интерфейсом.

Социология изучает человеческий опыт, который нельзя синтезировать из паттернов. Для понимания новых феноменов, редких групп, живой реакции человек незаменим. Сообщество движется к тому, чтобы рассматривать синтиков как «песочницу» для тестирования инструментария, а не как замену полевого этапа,

— рассказал Вячеслав Поспелов, СЕО Kelva Tech, компании-разработчика AI-ассистентов для маркетинговых и PR-агенств

Автор: Татьяна Смирнова, диджитал-исследователь сервиcа онлайн-опросов и маркетинговых исследований «Анкетолог»

0
В избр. Сохранено
Авторизуйтесь
Вход с паролем
Комментарии
Выбрать файл
Блог проекта
Расскажите историю о создании или развитии проекта, поиске команды, проблемах и решениях
Написать
Личный блог
Продвигайте свои услуги или личный бренд через интересные кейсы и статьи
Написать

Spark использует cookie-файлы. С их помощью мы улучшаем работу нашего сайта и ваше взаимодействие с ним.