Кросс-табуляция: базовый инструмент анализа опросов

Кросс-табуляция: базовый инструмент анализа опросов

Почти любой отчёт по количественному опросу состоит из таблиц, где ответы на один вопрос разбиты по группам респондентов: мужчины и женщины, разные возрастные категории, клиенты и не клиенты. Это и есть кросс-табуляция, или таблицы сопряжённости. Метод выглядит простым, поэтому к нему часто относятся как к технической рутине. На деле именно здесь закладываются главные выводы исследования — и здесь же совершается большинство аналитических ошибок.

Кросс-табуляция отвечает на вопрос «различается ли ответ в зависимости от того, кто отвечает». Если среди молодых респондентов доля знающих бренд вдвое выше, чем среди старших, это повод задуматься о коммуникации. Если различий нет — это тоже результат.

Разберёмся, как устроены такие таблицы, какие проценты в них считать, как проверять различия и как сделать так, чтобы сотня таблиц превратилась в несколько ясных выводов.

Как устроена таблица сопряжённости

В простейшем виде это таблица, где в строках — варианты ответа на один вопрос, а в столбцах — группы респондентов по другому признаку. В ячейках — число ответивших и проценты. Признак в столбцах часто называют «баннером» или «разбивкой», вопрос в строках — «стабом».

Условный пример: опрос посетителей торгового центра, вопрос «Как часто вы бываете в нашем ТЦ?», разбивка по возрасту.

Частота посещенияДо 30 лет30–49 лет50 лет и старшеВсего
Чаще раза в неделю34%22%15%24%
Раз в неделю28%31%25%29%
Реже38%47%60%47%
База (число ответивших)180240130550

Из такой таблицы сразу видно, что молодые посетители приходят чаще. Но прежде чем делать вывод, нужно убедиться, что различия не случайны и что база в каждой группе достаточна.

Проценты по столбцу, по строке или от итога

Одна и та же таблица может показывать три разных вида процентов, и выбор между ними определяет смысл выводов.

  • Проценты по столбцу показывают структуру ответов внутри каждой группы: «какая доля молодёжи бывает в ТЦ чаще раза в неделю». Это самый распространённый и обычно самый полезный вариант.
  • Проценты по строке показывают состав тех, кто дал конкретный ответ: «из всех частых посетителей какую долю составляет молодёжь». Это ответ на вопрос о профиле аудитории.
  • Проценты от общего итога показывают долю каждой ячейки от всей выборки. В аналитике используются редко, в основном для расчётов долей сегментов.

Простое правило: ставьте в столбцы ту переменную, которая логически «объясняет», а в строки — ту, которую «объясняют», и считайте проценты по столбцу. Тогда сравнение идёт между группами по горизонтали, и таблицу легко читать.

Выбор разбивок: что ставить в баннер

Стандартный набор разбивок — пол, возраст, доход, регион. Но для решения бизнес-задач важнее разбивки, связанные с поведением и отношением: клиенты и не клиенты, частые и редкие покупатели, лояльные и критики, пользователи разных каналов. Именно они чаще всего показывают управленчески значимые различия.

Сколько разбивок нужно

Соблазнительно построить таблицы по всем переменным сразу. В результате получается файл на несколько сотен страниц, где ключевые находки теряются. Лучше заранее, ещё на этапе плана анализа, определить пять-семь разбивок, которые напрямую связаны с гипотезами исследования. Как формулировать такие гипотезы, рассказано в статье о гипотезах в исследовании.

Производные переменные

Иногда полезную разбивку нужно создать: объединить несколько вопросов в индекс, выделить сегмент по комбинации признаков, перекодировать открытый ответ в категории. Например, группа «ушедшие клиенты» может определяться сочетанием «пользовался раньше» и «сейчас не пользуется».

Проверка значимости различий

Разница в процентах между группами может быть случайной, особенно при небольших выборках. Если в одной группе 34%, а в другой 28%, но в каждой всего по пятьдесят человек, утверждать, что группы различаются, нельзя.

Для проверки используют статистические тесты: для таблицы целиком — критерий хи-квадрат, для попарного сравнения долей — z-тест для пропорций. Профессиональные программы обработки отмечают значимые различия буквами или цветом прямо в таблице. Логика этих проверок без формул объяснена в статье о статистической значимости.

Важно помнить о двух ограничениях. Во-первых, значимость не равна важности: при большой выборке значимым окажется и различие в два процентных пункта, которое для бизнеса ничего не меняет. Во-вторых, при множестве сравнений часть «значимых» различий появится случайно. Чем больше таблиц, тем осторожнее нужно относиться к единичным находкам.

Минимальная база и объединение групп

Проценты, посчитанные на базе меньше тридцати-пятидесяти человек, крайне неустойчивы: один-два ответа сдвигают долю на несколько пунктов. Такие ячейки нужно помечать, а выводы по ним формулировать осторожно — «ориентировочно», «на уровне тенденции».

Если группа слишком мала, её можно объединить с соседней: вместо пяти возрастных категорий использовать три. Альтернатива — заранее заложить в выборку квоты, чтобы важные для анализа группы были представлены достаточно. Это решение принимается на этапе проектирования, о чём подробнее — в материале о расчёте размера выборки.

Многомерные таблицы и ловушка скрытой переменной

Иногда различие между группами объясняется третьим фактором. Классический условный пример: владельцы дорогих смартфонов чаще пользуются мобильным банком. Но, возможно, дело не в смартфоне, а в возрасте и доходе — более молодые и обеспеченные люди и смартфоны покупают дороже, и цифровыми сервисами пользуются активнее.

Чтобы проверить такую гипотезу, строят трёхмерную таблицу: ту же разбивку, но отдельно внутри каждой возрастной группы. Если различие сохраняется во всех слоях — связь, скорее всего, реальная. Если исчезает — её объяснял возраст. Для более сложных случаев переходят к регрессионным моделям, но первый шаг почти всегда делается с помощью кросс-табуляции.

Индексы и отклонения от среднего

Когда групп много, сравнивать абсолютные проценты становится утомительно. Помогает индекс: доля в группе, делённая на долю по всей выборке и умноженная на сто. Индекс 100 означает, что группа не отличается от среднего, 150 — что показатель в полтора раза выше, 70 — заметно ниже. Например, если чаще раза в неделю в ТЦ бывают 24% всех посетителей и 34% молодёжи, индекс для молодёжи составит около 140.

Индексы особенно удобны для профилирования аудитории: какие группы перепредставлены среди покупателей продукта, среди читателей определённого издания, среди пользователей конкурирующего сервиса. Но у них есть ловушка: при маленьких исходных долях индекс легко «взлетает». Если признак встречается у 2% выборки и у 4% группы, индекс 200 выглядит впечатляюще, а за ним стоит всего несколько человек. Поэтому индекс всегда стоит показывать рядом с абсолютной долей и базой.

Таблицы для средних значений

Кросс-табуляция работает не только с категориальными ответами. Для шкальных вопросов — оценок от одного до десяти, сумм расходов, числа покупок — в ячейках показывают средние значения по группам, а иногда и медианы. Средняя оценка удовлетворённости по разным филиалам или средний чек в разных возрастных группах строятся по той же логике баннера и стаба.

Здесь важно помнить о выбросах: несколько респондентов, назвавших нереалистично большую сумму, способны сдвинуть среднее в маленькой группе. Перед построением таблиц со средними данные стоит почистить, а при сильно асимметричном распределении дополнительно смотреть медиану.

Типичные ошибки при работе с таблицами

  1. Сравнение процентов по строке как по столбцу. Вывод «женщины чаще покупают продукт» делают из того, что среди покупателей больше женщин, хотя женщин просто больше в выборке.
  2. Игнорирование базы. Выводы по группе из двадцати человек подаются так же уверенно, как по группе из трёхсот.
  3. Неучтённые множественные ответы. В вопросах, где можно выбрать несколько вариантов, сумма процентов превышает сто, и это нужно явно указывать.
  4. Невзвешенные данные. Если выборка смещена, а веса не применены, таблицы искажают картину генеральной совокупности.
  5. Неясная обработка «затрудняюсь ответить». Включать ли их в базу — решение, которое меняет проценты, и его нужно фиксировать.
  6. Охота за значимостью. Перебор десятков разбивок в поисках «чего-нибудь интересного» без исходной гипотезы.

От таблиц к выводам

Таблицы — сырьё, а не результат. Читатель отчёта не должен сам искать в них смысл. Хорошая практика — для каждого блока таблиц формулировать один-два вывода и выносить их в начало раздела. Например: «Молодые посетители бывают в ТЦ заметно чаще, но тратят меньше за визит; основной оборот обеспечивают покупатели среднего возраста».

Показывайте главное

В основной части отчёта — только таблицы и графики, подтверждающие ключевые выводы. Остальное — в приложение.

Подсвечивайте различия

Значимые отклонения от среднего по выборке отмечайте цветом или стрелками, чтобы взгляд сразу находил их.

Указывайте базу

Число ответивших в каждой группе должно быть видно рядом с процентами — иначе невозможно оценить надёжность.

Практические выводы

  • Планируйте разбивки до сбора данных, исходя из гипотез, а не после — из любопытства.
  • По умолчанию используйте проценты по столбцу и следите, чтобы читатель понимал, от чего они посчитаны.
  • Проверяйте значимость, но оценивайте и практическую величину различий.
  • Помечайте малые базы и не делайте по ним категоричных выводов.
  • При подозрении на скрытую переменную добавляйте третье измерение.
  • Превращайте таблицы в короткие текстовые выводы — именно их прочитает руководитель.

Кросс-табуляция не требует сложной математики, но требует дисциплины. Аккуратно построенные таблицы с понятными базами и подсвеченными различиями закрывают большую часть аналитических задач опроса и служат надёжной основой для более сложных методов.

Нужна помощь с исследованием? Специалисты NRay проведут исследование под вашу задачу — от постановки целей до презентации результатов. Оставьте заявку или напишите на [email protected].