Попросите покупателей оценить по пятибалльной шкале важность десяти характеристик смартфона — и почти все получат четыре-пять баллов. Батарея важна, камера важна, цена важна, надёжность тоже важна. Таблица средних выглядит как ровный забор, и продуктовая команда остаётся с тем же вопросом, с которым пришла: во что вкладываться в первую очередь?
Метод MaxDiff, известный также как Best-Worst Scaling, решает именно эту проблему. Он не позволяет респонденту считать всё одинаково значимым: в каждом задании нужно выбрать самый важный и самый неважный вариант из небольшого набора. Из множества таких выборов складывается шкала относительной важности, где различия между характеристиками видны отчётливо.
Расскажем, как устроен метод, в каких задачах он особенно полезен, как спроектировать исследование и на что смотреть при чтении результатов.
Почему рейтинговые шкалы не справляются с приоритетами
У оценочных шкал есть несколько врождённых особенностей, которые мешают ранжированию. Первая — эффект потолка: если всё кажется хоть сколько-нибудь нужным, ответы концентрируются в верхней части шкалы. Вторая — индивидуальный стиль ответа: одни люди щедро ставят пятёрки, другие никогда не поднимаются выше четвёрки, и средние значения смешивают реальное отношение с манерой отвечать. Третья — культурные и возрастные различия в использовании шкал, из-за которых сравнение групп становится ненадёжным.
Прямое ранжирование тоже не выход. Расставить по порядку пять пунктов человек ещё может, а пятнадцать — уже нет: середина списка заполняется почти случайно, а респондент устаёт. Подробнее о возможностях и ограничениях разных шкал можно прочитать в материале о шкалах в анкетах.
MaxDiff использует то, что людям даётся легче всего, — выбор крайностей. Определить лучшее и худшее из четырёх-пяти вариантов просто и быстро, а повторение таких заданий даёт статистически устойчивую картину.
Как выглядит задание MaxDiff
Респондент видит небольшой набор характеристик — обычно четыре или пять — и отмечает одну как наиболее важную и одну как наименее важную. Затем появляется следующий набор с другим сочетанием пунктов. Всего таких экранов бывает от восьми до пятнадцати, в зависимости от длины списка.
Условный пример для онлайн-сервиса доставки продуктов. Список проверяемых преимуществ: быстрая доставка, широкий ассортимент, низкие цены, свежесть продуктов, удобное приложение, бесплатная доставка от небольшой суммы, точные интервалы, вежливые курьеры, программа лояльности, возможность замены товаров, экологичная упаковка, оплата при получении. В одном задании респондент видит, например, «свежесть», «удобное приложение», «экологичная упаковка» и «точные интервалы» — и выбирает самое и наименее важное для себя.
Каждый ответ в задании из четырёх пунктов даёт информацию о пяти парных сравнениях из шести возможных: лучший пункт важнее трёх остальных, худший — менее важен, чем три других. Поэтому MaxDiff так эффективен: за десять экранов набирается несколько десятков парных суждений.
Проектирование исследования
Список характеристик
Качество результата напрямую зависит от списка. Пункты должны быть сопоставимыми по уровню абстракции: нельзя ставить рядом «качество» и «наличие застёжки-молнии на кармане». Формулировки — короткими, однозначными и понятными без пояснений. Каждый пункт описывает одну идею: «быстрая и бесплатная доставка» — это два пункта, а не один.
Оптимальная длина списка — от десяти до двадцати пяти характеристик. Меньше — можно обойтись простым ранжированием. Больше — заданий становится слишком много, и приходится использовать специальные модификации метода, о которых ниже.
Экспериментальный план
Сочетания пунктов в заданиях не подбирают вручную. Используется сбалансированный план: каждая характеристика показывается примерно одинаковое число раз, каждая пара встречается вместе примерно с одинаковой частотой, а позиция пункта на экране меняется. Обычно готовят несколько версий плана и распределяют их между респондентами, чтобы снизить влияние конкретных сочетаний.
Практическое правило для расчёта числа заданий: каждый пункт должен появиться у одного респондента три-четыре раза. При списке из шестнадцати пунктов и четырёх пунктах на экране это означает двенадцать-шестнадцать заданий.
Выборка
Для общей оценки важности по рынку обычно достаточно трёхсот-четырёхсот респондентов. Если планируется сравнивать сегменты, в каждом нужен хотя бы сто-двести человек. Логика расчёта та же, что и для любого количественного опроса, — см. статью о расчёте размера выборки.
Как считаются результаты
Самый простой способ — подсчёт: для каждой характеристики берут число выборов «лучшее», вычитают число выборов «худшее» и делят на количество показов. Получается индекс от минус единицы до плюс единицы. Этот метод нагляден и годится для быстрой проверки данных.
Более точный подход — статистическое моделирование на уровне респондента, чаще всего иерархическая байесовская модель. Она оценивает для каждого человека индивидуальную полезность каждого пункта. Это позволяет не только получить средние по выборке, но и сегментировать респондентов по их приоритетам, а также проверить, насколько последовательно отвечал каждый участник.
Для отчёта полезности обычно переводят в шкалу долей предпочтения, сумма которых по всем пунктам равна ста. Такая шкала интуитивно понятна: если «свежесть продуктов» набрала 14, а «экологичная упаковка» — 3, первая характеристика почти в пять раз чаще перевешивает при выборе.
| Характеристика (условный пример) | Доля предпочтения | Интерпретация |
|---|---|---|
| Свежесть продуктов | 14,2 | Базовое ожидание, критично |
| Низкие цены | 12,8 | Ключевой драйвер выбора |
| Точные интервалы доставки | 10,5 | Сильная зона дифференциации |
| Бесплатная доставка | 9,7 | Важна для частых заказов |
| Программа лояльности | 4,1 | Второстепенно |
| Экологичная упаковка | 3,0 | Ниша, важна для отдельного сегмента |
Где метод особенно полезен
Продуктовая разработка
Какие функции включить в первую версию, а какие отложить. MaxDiff показывает, за что пользователи держатся крепче всего.
Коммуникация
Выбор ключевых сообщений для рекламы и упаковки: из двадцати возможных преимуществ остаются три, которые действительно цепляют.
Клиентский сервис
Какие аспекты обслуживания улучшать в первую очередь, если ресурсов хватает только на часть изменений.
Сегментация
Индивидуальные оценки важности позволяют выделить группы с разными приоритетами: экономных, требовательных к качеству, ценящих удобство.
B2B-закупки
Какие критерии реально определяют выбор поставщика у закупщиков, а какие называются из вежливости.
Социальные исследования
Ранжирование проблем города или района, которые жители считают наиболее острыми.
Ограничения и как их обходить
MaxDiff измеряет относительную важность внутри предложенного списка. Он не говорит, важна ли характеристика сама по себе. Если все пункты в списке для респондента второстепенны, метод всё равно выстроит иерархию. Чтобы получить абсолютную точку отсчёта, используют модификацию с якорем: после основных заданий респондента спрашивают, какие из пунктов для него действительно значимы, или вводят порог «важно / не важно» в каждое задание.
Второе ограничение — метод не учитывает цену и компромиссы между конкретными уровнями характеристик. Он скажет, что батарея важнее камеры, но не скажет, сколько человек готов доплатить за дополнительные часы работы. Для таких задач нужен совместный анализ — подробнее в статье о conjoint-анализе.
Третье — длинные списки. При сорока-пятидесяти пунктах используют сокращённые схемы: респондент сначала отбирает релевантные пункты, и задания строятся только из них, либо план делится так, что каждый видит часть списка, а модель восстанавливает общую картину.
Типичные ошибки при применении MaxDiff
- Несопоставимые пункты. Смешение общих ценностей и мелких функций делает выбор очевидным и бесполезным.
- Двойные формулировки. «Надёжность и долговечность» — респондент не знает, какую половину оценивать.
- Слишком много пунктов на экране. Шесть-семь вариантов в задании резко повышают нагрузку и снижают качество выбора.
- Слишком мало заданий. Если характеристика показана респонденту один-два раза, индивидуальные оценки ненадёжны.
- Игнорирование качества ответов. Респонденты, отвечающие случайно, видны по низкой согласованности модели, их стоит исключать.
- Чтение результатов как абсолютных. Последнее место в рейтинге не означает «никому не нужно», это означает «менее важно, чем остальные пункты списка».
Практические выводы
MaxDiff — один из самых практичных инструментов приоритизации, когда список вариантов длинный, а ресурсы ограничены. Чтобы получить от него пользу:
- Начните с качественного этапа. Список характеристик лучше собирать из интервью и анализа отзывов, а не придумывать в переговорной.
- Выровняйте формулировки. Один пункт — одна идея, одинаковый уровень абстракции, короткий текст.
- Используйте сбалансированный план. Четыре-пять пунктов на экране, каждый показывается респонденту три-четыре раза.
- Моделируйте на уровне респондента. Это открывает сегментацию и контроль качества ответов.
- Добавьте якорь, если нужна абсолютная важность. Иначе не забывайте, что результаты относительны.
- Связывайте с решениями. Показывайте не только рейтинг, но и выводы: что усиливать, что не трогать, от чего можно отказаться.
Команда NRay проектирует и проводит MaxDiff-исследования в рамках тестирования продуктов и рекламы: от составления списка характеристик на основе качественного этапа до моделирования индивидуальных оценок и сегментации аудитории по приоритетам.
Нужна помощь с исследованием? Специалисты NRay проведут исследование под вашу задачу — от постановки целей до презентации результатов. Оставьте заявку или напишите на [email protected].