Почти любой отчёт по количественному опросу состоит из таблиц, где ответы на один вопрос разбиты по группам респондентов: мужчины и женщины, разные возрастные категории, клиенты и не клиенты. Это и есть кросс-табуляция, или таблицы сопряжённости. Метод выглядит простым, поэтому к нему часто относятся как к технической рутине. На деле именно здесь закладываются главные выводы исследования — и здесь же совершается большинство аналитических ошибок.
Кросс-табуляция отвечает на вопрос «различается ли ответ в зависимости от того, кто отвечает». Если среди молодых респондентов доля знающих бренд вдвое выше, чем среди старших, это повод задуматься о коммуникации. Если различий нет — это тоже результат.
Разберёмся, как устроены такие таблицы, какие проценты в них считать, как проверять различия и как сделать так, чтобы сотня таблиц превратилась в несколько ясных выводов.
Как устроена таблица сопряжённости
В простейшем виде это таблица, где в строках — варианты ответа на один вопрос, а в столбцах — группы респондентов по другому признаку. В ячейках — число ответивших и проценты. Признак в столбцах часто называют «баннером» или «разбивкой», вопрос в строках — «стабом».
Условный пример: опрос посетителей торгового центра, вопрос «Как часто вы бываете в нашем ТЦ?», разбивка по возрасту.
| Частота посещения | До 30 лет | 30–49 лет | 50 лет и старше | Всего |
|---|---|---|---|---|
| Чаще раза в неделю | 34% | 22% | 15% | 24% |
| Раз в неделю | 28% | 31% | 25% | 29% |
| Реже | 38% | 47% | 60% | 47% |
| База (число ответивших) | 180 | 240 | 130 | 550 |
Из такой таблицы сразу видно, что молодые посетители приходят чаще. Но прежде чем делать вывод, нужно убедиться, что различия не случайны и что база в каждой группе достаточна.
Проценты по столбцу, по строке или от итога
Одна и та же таблица может показывать три разных вида процентов, и выбор между ними определяет смысл выводов.
- Проценты по столбцу показывают структуру ответов внутри каждой группы: «какая доля молодёжи бывает в ТЦ чаще раза в неделю». Это самый распространённый и обычно самый полезный вариант.
- Проценты по строке показывают состав тех, кто дал конкретный ответ: «из всех частых посетителей какую долю составляет молодёжь». Это ответ на вопрос о профиле аудитории.
- Проценты от общего итога показывают долю каждой ячейки от всей выборки. В аналитике используются редко, в основном для расчётов долей сегментов.
Простое правило: ставьте в столбцы ту переменную, которая логически «объясняет», а в строки — ту, которую «объясняют», и считайте проценты по столбцу. Тогда сравнение идёт между группами по горизонтали, и таблицу легко читать.
Выбор разбивок: что ставить в баннер
Стандартный набор разбивок — пол, возраст, доход, регион. Но для решения бизнес-задач важнее разбивки, связанные с поведением и отношением: клиенты и не клиенты, частые и редкие покупатели, лояльные и критики, пользователи разных каналов. Именно они чаще всего показывают управленчески значимые различия.
Сколько разбивок нужно
Соблазнительно построить таблицы по всем переменным сразу. В результате получается файл на несколько сотен страниц, где ключевые находки теряются. Лучше заранее, ещё на этапе плана анализа, определить пять-семь разбивок, которые напрямую связаны с гипотезами исследования. Как формулировать такие гипотезы, рассказано в статье о гипотезах в исследовании.
Производные переменные
Иногда полезную разбивку нужно создать: объединить несколько вопросов в индекс, выделить сегмент по комбинации признаков, перекодировать открытый ответ в категории. Например, группа «ушедшие клиенты» может определяться сочетанием «пользовался раньше» и «сейчас не пользуется».
Проверка значимости различий
Разница в процентах между группами может быть случайной, особенно при небольших выборках. Если в одной группе 34%, а в другой 28%, но в каждой всего по пятьдесят человек, утверждать, что группы различаются, нельзя.
Для проверки используют статистические тесты: для таблицы целиком — критерий хи-квадрат, для попарного сравнения долей — z-тест для пропорций. Профессиональные программы обработки отмечают значимые различия буквами или цветом прямо в таблице. Логика этих проверок без формул объяснена в статье о статистической значимости.
Важно помнить о двух ограничениях. Во-первых, значимость не равна важности: при большой выборке значимым окажется и различие в два процентных пункта, которое для бизнеса ничего не меняет. Во-вторых, при множестве сравнений часть «значимых» различий появится случайно. Чем больше таблиц, тем осторожнее нужно относиться к единичным находкам.
Минимальная база и объединение групп
Проценты, посчитанные на базе меньше тридцати-пятидесяти человек, крайне неустойчивы: один-два ответа сдвигают долю на несколько пунктов. Такие ячейки нужно помечать, а выводы по ним формулировать осторожно — «ориентировочно», «на уровне тенденции».
Если группа слишком мала, её можно объединить с соседней: вместо пяти возрастных категорий использовать три. Альтернатива — заранее заложить в выборку квоты, чтобы важные для анализа группы были представлены достаточно. Это решение принимается на этапе проектирования, о чём подробнее — в материале о расчёте размера выборки.
Многомерные таблицы и ловушка скрытой переменной
Иногда различие между группами объясняется третьим фактором. Классический условный пример: владельцы дорогих смартфонов чаще пользуются мобильным банком. Но, возможно, дело не в смартфоне, а в возрасте и доходе — более молодые и обеспеченные люди и смартфоны покупают дороже, и цифровыми сервисами пользуются активнее.
Чтобы проверить такую гипотезу, строят трёхмерную таблицу: ту же разбивку, но отдельно внутри каждой возрастной группы. Если различие сохраняется во всех слоях — связь, скорее всего, реальная. Если исчезает — её объяснял возраст. Для более сложных случаев переходят к регрессионным моделям, но первый шаг почти всегда делается с помощью кросс-табуляции.
Индексы и отклонения от среднего
Когда групп много, сравнивать абсолютные проценты становится утомительно. Помогает индекс: доля в группе, делённая на долю по всей выборке и умноженная на сто. Индекс 100 означает, что группа не отличается от среднего, 150 — что показатель в полтора раза выше, 70 — заметно ниже. Например, если чаще раза в неделю в ТЦ бывают 24% всех посетителей и 34% молодёжи, индекс для молодёжи составит около 140.
Индексы особенно удобны для профилирования аудитории: какие группы перепредставлены среди покупателей продукта, среди читателей определённого издания, среди пользователей конкурирующего сервиса. Но у них есть ловушка: при маленьких исходных долях индекс легко «взлетает». Если признак встречается у 2% выборки и у 4% группы, индекс 200 выглядит впечатляюще, а за ним стоит всего несколько человек. Поэтому индекс всегда стоит показывать рядом с абсолютной долей и базой.
Таблицы для средних значений
Кросс-табуляция работает не только с категориальными ответами. Для шкальных вопросов — оценок от одного до десяти, сумм расходов, числа покупок — в ячейках показывают средние значения по группам, а иногда и медианы. Средняя оценка удовлетворённости по разным филиалам или средний чек в разных возрастных группах строятся по той же логике баннера и стаба.
Здесь важно помнить о выбросах: несколько респондентов, назвавших нереалистично большую сумму, способны сдвинуть среднее в маленькой группе. Перед построением таблиц со средними данные стоит почистить, а при сильно асимметричном распределении дополнительно смотреть медиану.
Типичные ошибки при работе с таблицами
- Сравнение процентов по строке как по столбцу. Вывод «женщины чаще покупают продукт» делают из того, что среди покупателей больше женщин, хотя женщин просто больше в выборке.
- Игнорирование базы. Выводы по группе из двадцати человек подаются так же уверенно, как по группе из трёхсот.
- Неучтённые множественные ответы. В вопросах, где можно выбрать несколько вариантов, сумма процентов превышает сто, и это нужно явно указывать.
- Невзвешенные данные. Если выборка смещена, а веса не применены, таблицы искажают картину генеральной совокупности.
- Неясная обработка «затрудняюсь ответить». Включать ли их в базу — решение, которое меняет проценты, и его нужно фиксировать.
- Охота за значимостью. Перебор десятков разбивок в поисках «чего-нибудь интересного» без исходной гипотезы.
От таблиц к выводам
Таблицы — сырьё, а не результат. Читатель отчёта не должен сам искать в них смысл. Хорошая практика — для каждого блока таблиц формулировать один-два вывода и выносить их в начало раздела. Например: «Молодые посетители бывают в ТЦ заметно чаще, но тратят меньше за визит; основной оборот обеспечивают покупатели среднего возраста».
Показывайте главное
В основной части отчёта — только таблицы и графики, подтверждающие ключевые выводы. Остальное — в приложение.
Подсвечивайте различия
Значимые отклонения от среднего по выборке отмечайте цветом или стрелками, чтобы взгляд сразу находил их.
Указывайте базу
Число ответивших в каждой группе должно быть видно рядом с процентами — иначе невозможно оценить надёжность.
Практические выводы
- Планируйте разбивки до сбора данных, исходя из гипотез, а не после — из любопытства.
- По умолчанию используйте проценты по столбцу и следите, чтобы читатель понимал, от чего они посчитаны.
- Проверяйте значимость, но оценивайте и практическую величину различий.
- Помечайте малые базы и не делайте по ним категоричных выводов.
- При подозрении на скрытую переменную добавляйте третье измерение.
- Превращайте таблицы в короткие текстовые выводы — именно их прочитает руководитель.
Кросс-табуляция не требует сложной математики, но требует дисциплины. Аккуратно построенные таблицы с понятными базами и подсвеченными различиями закрывают большую часть аналитических задач опроса и служат надёжной основой для более сложных методов.
Нужна помощь с исследованием? Специалисты NRay проведут исследование под вашу задачу — от постановки целей до презентации результатов. Оставьте заявку или напишите на [email protected].