Данные не разговаривают. Они не формулируют вопрос, не выбирают выборку, не определяют шкалу графика и не решают, что считать успехом. Всё это делает человек.
Поэтому фраза «данные показали» часто скрывает длинную цепочку решений. Какие наблюдения собрали? Какие исключили? С чем сравнили? Какой показатель выбрали? Насколько вывод переносится на другие ситуации?
Данные чаще вводят в заблуждение не потому, что их подделали, а потому, что правильный ответ получили на неправильно поставленный вопрос.
1. Показать только удобную часть данных
Представим образовательную программу, в которой начали учиться 1 000 человек. До финального теста дошли 120, а 100 из них получили высокий балл. Можно написать: «83% участников успешно освоили материал».
Формально расчёт верен: 100 из 120 — действительно около 83%. Но для оценки всей программы важен другой вопрос: что произошло с оставшимися 880 участниками? Если считать от всех начавших, доля успешных завершений равна 10%.
Успех среди тех, кто дошёл до финала.
Успех среди всех, кто начал программу.
Ни одна из цифр не обязана быть «ложной». Они отвечают на разные вопросы. Манипуляция начинается тогда, когда вопрос не называют.
2. Показать процент и спрятать знаменатель
Фраза «риск вырос на 100%» звучит тревожно. Но рост с одного случая на десять тысяч до двух случаев на десять тысяч — это одновременно рост на 100% и увеличение абсолютного риска всего на 0,01 процентного пункта.
Относительные изменения полезны, но без исходного уровня могут создавать ложное ощущение масштаба. Поэтому рядом с процентом стоит искать ответ на простой вопрос: «100% от чего?»
3. Спрятать различия за средним значением
Среднее — мощный инструмент. Но один показатель не обязан хорошо описывать распределение.
У двух групп может быть одинаковый средний доход, одинаковая средняя оценка или одинаковое среднее время выполнения задания. При этом в первой группе значения близки друг к другу, а во второй — половина очень низких и половина очень высоких.
Поэтому полезно смотреть не только на среднее, но и на медиану, разброс, форму распределения и отдельные группы.
4. Превратить корреляцию в объяснение
Если два показателя меняются вместе, это ещё не означает, что один вызывает другой. Возможны как минимум три варианта:
- первый фактор действительно влияет на второй;
- второй влияет на первый;
- оба зависят от третьего фактора.
Например, высокая активность студентов на образовательной платформе может быть связана с высокими результатами. Но это не доказывает, что именно платформа создала результат. Возможно, более мотивированные студенты одновременно чаще пользуются платформой и лучше учатся.
Она помогает заметить связь, но не освобождает от проверки причинного механизма.
5. Нарисовать график, который усиливает эффект
Один и тот же ряд данных может выглядеть как резкий скачок или как почти незаметное изменение. Достаточно изменить начало вертикальной оси.
Обрезанная ось не всегда является ошибкой: иногда она помогает рассмотреть небольшие различия. Но читатель должен понимать масштаб и видеть, что именно было сделано.
6. Получить точную модель для неправильного мира
Модель может показывать отличную точность на тестовых данных и плохо работать после запуска. Причины часто лежат за пределами алгоритма:
- обучающая выборка не похожа на реальные данные;
- в тест случайно попала информация из будущего;
- выбран показатель, который не отражает цену ошибки;
- условия изменились после сбора данных;
- модель изучила удобный технический признак вместо нужной закономерности.
Например, при редком событии модель, которая всегда отвечает «нет», может иметь точность 99%. Но она не обнаружит ни одного важного случая. Значит, высокая accuracy сама по себе ничего не гарантирует.
Выглядит почти идеально.
Главная задача не решена.
7. Семь вопросов перед тем, как поверить выводу
Данные не отменяют мышление
Хороший анализ — это не соревнование в количестве графиков, моделей и знаков после запятой. Его задача — сделать вывод точнее, а неопределённость видимой.
Чем убедительнее выглядит число, тем полезнее на секунду остановиться и спросить: какая цепочка решений привела к этому числу?
Анализ данных в век ИИ
Бесплатный курс: данные, статистическое мышление, визуализация, Orange, AI и практические задания.