Данные не разговаривают. Они не формулируют вопрос, не выбирают выборку, не определяют шкалу графика и не решают, что считать успехом. Всё это делает человек.

Поэтому фраза «данные показали» часто скрывает длинную цепочку решений. Какие наблюдения собрали? Какие исключили? С чем сравнили? Какой показатель выбрали? Насколько вывод переносится на другие ситуации?

Главная мысль

Данные чаще вводят в заблуждение не потому, что их подделали, а потому, что правильный ответ получили на неправильно поставленный вопрос.

1. Показать только удобную часть данных

Представим образовательную программу, в которой начали учиться 1 000 человек. До финального теста дошли 120, а 100 из них получили высокий балл. Можно написать: «83% участников успешно освоили материал».

Формально расчёт верен: 100 из 120 — действительно около 83%. Но для оценки всей программы важен другой вопрос: что произошло с оставшимися 880 участниками? Если считать от всех начавших, доля успешных завершений равна 10%.

Убедительная цифра 83%

Успех среди тех, кто дошёл до финала.

Другой вопрос 10%

Успех среди всех, кто начал программу.

Ни одна из цифр не обязана быть «ложной». Они отвечают на разные вопросы. Манипуляция начинается тогда, когда вопрос не называют.

2. Показать процент и спрятать знаменатель

Фраза «риск вырос на 100%» звучит тревожно. Но рост с одного случая на десять тысяч до двух случаев на десять тысяч — это одновременно рост на 100% и увеличение абсолютного риска всего на 0,01 процентного пункта.

Относительные изменения полезны, но без исходного уровня могут создавать ложное ощущение масштаба. Поэтому рядом с процентом стоит искать ответ на простой вопрос: «100% от чего?»

Относительный рост с 1 до 2 случаев = +100% Абсолютное изменение: +1 случай на 10 000

3. Спрятать различия за средним значением

Среднее — мощный инструмент. Но один показатель не обязан хорошо описывать распределение.

У двух групп может быть одинаковый средний доход, одинаковая средняя оценка или одинаковое среднее время выполнения задания. При этом в первой группе значения близки друг к другу, а во второй — половина очень низких и половина очень высоких.

Набор A
Значения сосредоточены рядом со средним
Набор B
То же среднее, но совсем другой разброс

Поэтому полезно смотреть не только на среднее, но и на медиану, разброс, форму распределения и отдельные группы.

4. Превратить корреляцию в объяснение

Если два показателя меняются вместе, это ещё не означает, что один вызывает другой. Возможны как минимум три варианта:

  • первый фактор действительно влияет на второй;
  • второй влияет на первый;
  • оба зависят от третьего фактора.

Например, высокая активность студентов на образовательной платформе может быть связана с высокими результатами. Но это не доказывает, что именно платформа создала результат. Возможно, более мотивированные студенты одновременно чаще пользуются платформой и лучше учатся.

Корреляция — это сигнал для следующего вопроса

Она помогает заметить связь, но не освобождает от проверки причинного механизма.

5. Нарисовать график, который усиливает эффект

Один и тот же ряд данных может выглядеть как резкий скачок или как почти незаметное изменение. Достаточно изменить начало вертикальной оси.

Ось начинается с 94
96979899
Визуально — почти четырёхкратный рост.
Ось начинается с 0
96979899
Фактически — рост с 96 до 99.

Обрезанная ось не всегда является ошибкой: иногда она помогает рассмотреть небольшие различия. Но читатель должен понимать масштаб и видеть, что именно было сделано.

6. Получить точную модель для неправильного мира

Модель может показывать отличную точность на тестовых данных и плохо работать после запуска. Причины часто лежат за пределами алгоритма:

  • обучающая выборка не похожа на реальные данные;
  • в тест случайно попала информация из будущего;
  • выбран показатель, который не отражает цену ошибки;
  • условия изменились после сбора данных;
  • модель изучила удобный технический признак вместо нужной закономерности.

Например, при редком событии модель, которая всегда отвечает «нет», может иметь точность 99%. Но она не обнаружит ни одного важного случая. Значит, высокая accuracy сама по себе ничего не гарантирует.

На отчёте 99% accuracy

Выглядит почти идеально.

На практике 0 найденных случаев

Главная задача не решена.

7. Семь вопросов перед тем, как поверить выводу

1Какой точный вопрос задавали?
2Кто попал в данные, а кто остался за их пределами?
3Каков знаменатель у процентов?
4Что скрывается за средним значением?
5Связь является корреляцией или причинным эффектом?
6Не усиливает ли график небольшое различие?
7Соответствует ли метрика реальной цели решения?

Данные не отменяют мышление

Хороший анализ — это не соревнование в количестве графиков, моделей и знаков после запятой. Его задача — сделать вывод точнее, а неопределённость видимой.

Чем убедительнее выглядит число, тем полезнее на секунду остановиться и спросить: какая цепочка решений привела к этому числу?

Продолжить изучение

Анализ данных в век ИИ

Бесплатный курс: данные, статистическое мышление, визуализация, Orange, AI и практические задания.