Как лгать с помощью статистики. Как правильно лгать с помощью статистики Как лгать с помощью статистики

  • 08.12.2019

Первый шаг при сборе статистических данных - определить, что вы хотите анализировать. Специалисты по статистике называют информацию на этом этапе генеральной совокупностью . Затем нужно определить подкласс данных, которые при анализе должны представлять всё население в целом. Чем больше и точнее выборка, тем вернее будут результаты исследования.

Конечно, есть разные способы испортить статистическую выборку случайно или намеренно:

  • Систематическая ошибка отбора. Такая ошибка происходит, когда люди, принимающие участие в исследовании, сами относят себя к группе, не представляющей всё население.
  • Случайная выборка. Имеет место, когда анализируют легкодоступную информацию, а не пытаются собрать репрезентативные данные. Например, новостной канал может провести политический опрос среди своих зрителей. Не опросив людей, которые смотрят другие каналы (или вообще не смотрят телевизор), нельзя сказать, что результаты такого исследования будут отражать действительность.
  • Отказ респондентов от участия. Такая статистическая ошибка случается, когда часть людей не отвечает на вопросы, задаваемые в статистическом исследовании. Это приводит к неверному отображению результатов. Например, если в исследовании задаётся вопрос: «Изменяли ли вы когда-нибудь супругу/супруге?», некоторые просто не захотят признаться. В результате будет казаться, что измены происходят редко.
  • Опросы со свободным доступом. В таких опросах может принять участие любой человек. Часто даже не проверяется, сколько раз один и тот же человек отвечал на вопросы. Примером служат различные опросы в интернете. Проходить их очень интересно, но они не могут считаться объективными.

Прелесть ошибок отбора в том, что кто-нибудь где-нибудь наверняка проводит ненаучный опрос, который подтвердит любую вашу теорию. Так что просто поищите нужный опрос в Сети или создайте свой собственный.

Выбирайте результаты, которые подтверждают ваши идеи

Так как статистика использует числа, нам кажется, что она убедительно доказывает любую идею. Статистика опирается на сложные математические , которые при неправильном обращении могут привести к совершенно противоположным результатам.

Чтобы продемонстрировать изъяны анализа данных, английский математик Фрэнсис Энскомб создал квартет Энскомба . Он состоит из четырёх наборов числовых данных, которые на графиках выглядят совершенно по-разному.

На рисунке X1 - стандартная диаграмма рассеяния; X2 - кривая, которая сначала поднимается вверх, а потом опускается вниз; X3 - линия, немного поднимающаяся вверх, с одним выбросом на оси Y; X4 - данные на оси X, кроме одного выброса, расположенного высоко на обеих осях.

Для каждого из графиков верны следующие высказывания:

  • Среднее значение переменной x для каждого набора данных равно 9.
  • Среднее значение переменной y для каждого набора данных равно 7,5.
  • Дисперсия (разброс) переменной x - 11, переменной y - 4,12.
  • Корреляция между переменными x и y для каждого набора данных равна 0,816.

Если бы мы видели эти данные только в форме текста, мы бы подумали, что ситуации полностью одинаковы, хотя графики это опровергают.

Поэтому Энскомб предложил сначала визуализировать данные, а только потом делать выводы. Конечно, если вы хотите ввести кого-то в заблуждение, пропустите этот шаг.

Составляйте графики, которые подчеркнут желаемые результаты

У большинства людей нет времени проводить собственный статистический анализ. Они ждут, что вы предъявите им графики, обобщающие все ваши исследования. Правильно составленные графики должны отражать идеи, которые соответствуют реальности. Но также они могут подчеркнуть те данные, которые вы хотите показать.

Опускайте названия некоторых параметров, немного поменяйте шкалу на оси координат, не объясняйте контекст. Так вы сможете убедить всех в свой правоте.

Всеми средствами скрывайте источники

Если вы открыто указываете свои источники, людям легко проверить ваши выводы. Конечно, если вы стремитесь обвести всех вокруг пальца, ни за что не рассказывайте, как вы пришли к своим выводам.

Обычно в статьях и исследованиях всегда указывают ссылки на источники. При этом оригинальные работы могут предоставляться не полностью. Главное, чтобы источник отвечал на следующие вопросы:

Теперь вы знаете, как манипулировать числами и с помощью статистики доказать практически что угодно. Это поможет вам распознавать ложь и опровергать сфабрикованные теории.


Дарелл Хафф

Как лгать при помощи статистики

Переводчик Е. Лалаян

Редактор А. Черникова

Научный редактор В. Ионов

Руководитель проекта А. Деркач

Корректор Е. Аксёнова

Компьютерная верстка К. Свищёв

Дизайн обложки Ю. Буга

© Darrell Huff and Irving Geis, 1954

© Издание на русском языке, перевод, оформление. ООО «Альпина Паблишер», 2015

Все права защищены. Произведение предназначено исключительно для частного использования. Никакая часть электронного экземпляра данной книги не может быть воспроизведена в какой бы то ни было форме и какими бы то ни было средствами, включая размещение в сети Интернет и в корпоративных сетях, для публичного или коллективного использования без письменного разрешения владельца авторских прав. За нарушение авторских прав законодательством предусмотрена выплата компенсации правообладателя в размере до 5 млн. рублей (ст. 49 ЗОАП), а также уголовная ответственность в виде лишения свободы на срок до 6 лет (ст. 146 УК РФ).

Существуют три вида лжи: ложь, наглая ложь и статистика.

Бенджамин Дизраэли

Придет время, и статистическое мышление станет таким же необходимым качеством для истинного гражданина, как умение читать и писать.

Герберт Уэллс

Нам досаждают не столько те вещи, о которых мы не знаем, сколько те, о которых мы знаем, что с ними что-то не так.

Артемус Уорд

Круглые числа всегда лгут.

Сэмюэл Джонсон

У меня есть обширная тема [статистика] и есть много, что написать по этой теме, но со всей остротой я осознаю, что мне не хватит литературных талантов, чтобы изложить ее просто и доходчиво, не жертвуя при этом точностью и основательностью.

Сэр Фрэнсис Гальтон

К читателю

Будь моя воля, я бы назвал эту книгу еще короче – «Как лгать», потому что ложь приобрела убедительность, логику и, что еще важнее, цифры, за которыми может скрываться все что угодно в «умелых руках». А «умелых рук» очень много.

В наше время вопросы лжи и правды все так же актуальны. Помимо прямого обмана появилось множество способов «огибать правду» или же показывать реальность таким образом, что даже знающему человеку сложно распознать скрывающуюся за ней ложь.

В искажении статистики заинтересованы все, кто ищет способы исказить общественное мнение и воспользоваться этим в целях собственного обогащения. Немало и таких, кто хочет скрыть настоящие цифры, потому как они отражают крайне неприглядные факты. Наконец, статистика оказывается объектом прямого манипулирования во всех случаях, когда она является частью процессов принятия решений государственного масштаба.

В России ситуация со статистикой никогда не была столь печальной, как сейчас. Если в 80-х и 90-х гг. прошлого столетия официальная статистика в России страдала от тотального недофинансирования, то сегодня сами принципы государственного и муниципального управления в России таковы, что статистика стремительно превращается из инструмента доверия в инструмент распределения государственных средств.

В последних исследованиях Фонда «Хамовники» Ольга Моляренко очень подробно разобрала примеры искажения муниципальной статистики в России. Из-за отсутствия кооперации между органами власти, использования статистических данных как основы для принятия решений о выделении бюджетных средств и многих других российских особенностей мы оказываемся перед острой необходимостью реорганизации сбора государственной статистики в целом.

Книга Даррелла Хаффа хороша не выводами и даже не огромным числом примеров, а тем, что она учит критическому мышлению, она учит отношению к цифрам не как к «сакральному знанию», а как к инструменту, с помощью которого осуществляется манипулирование нашим мнением.

И я могу сказать, что именно критического взгляда нам остро не хватает в последние годы. Вот лишь один пример. Одна общественная организация в России решила публиковать свой рейтинг восприятия коррупции. Дабы придать этому рейтингу «научности», в качестве критериев было решено использовать абсолютные статистические показатели, такие как статистика преступлений, публикуемая МВД и Генеральной прокуратурой. Хотя благое намерение отслеживать ситуацию с коррупцией в нашей стране можно только приветствовать, сам подход является ошибочным, потому как ошибочны изначально заложенные в нем метрики.

Существует три вида лжи: ложь, наглая ложь и статистика...(Бенджамин Дизраэли)...
Придет время, и статистическое мышление станет таким же необходимым качеством для истинного гражданина, как умение читать и писать...(Герберт Уэллс)...
Круглые числа всегда лгут...(Сэмюэл Джонсон)
Статистика, действительно, коварная и хитрая вещь, особенно в умелых руках...

Дарелл Хафф

Пять приемов, которые реально работают...

Даррел Хафф «Как лгать при помощи статистики».

Будь моя воля, я бы назвал эту книгу еще короче – «Как лгать», потому что ложь приобрела убедительность, логику и, что еще важнее, цифры, за которыми может скрываться все что угодно в «умелых руках». А «умелых рук» очень много.

В наше время вопросы лжи и правды все так же актуальны. Помимо прямого обмана появилось множество способов «огибать правду» или же показывать реальность таким образом, что даже знающему человеку сложно распознать скрывающуюся за ней ложь.

В искажении статистики заинтересованы все, кто ищет способы исказить общественное мнение и воспользоваться этим в целях собственного обогащения. Немало и таких, кто хочет скрыть настоящие цифры, потому как они отражают крайне неприглядные факты. Наконец, статистика оказывается объектом прямого манипулирования во всех случаях, когда она является частью процессов принятия решений государственного масштаба .

Статистика, действительно, коварная и хитрая вещь, особенно в умелых руках. На первый взгляд, книга Дарелла Хаффа "Как лгать при помощи статистики», выпущенная издательством «Альпина Паблишер» - инструкция по применению для мошенников, которые хотят ввести в заблуждение доверчивых читателей. Но на самом деле - это прививка от излишней доверчивости.

Сам автор пишет: «Полагаю всё же, что смогу оправдать её в манере бывшего грабителя, опубликовавшего мемуары, в сущности представляющие собой учебный курс на тему о том, как подобрать отмычку к замку. Жуликам и ворам все эти трюки давно известны, а порядочные люди должны узнать о них, чтобы уметь защитить свой дом от непрошенных гостей».

Хотя книга написана в далеком 1954 году, актуальности своей она не потеряла, также как и коварные приемы, описываемые в ней.

Необъективная выборка

Чтобы данные выборочного исследования имели ценность, они должны основываться на репрезентативной выборке, из которой исключены все возможные источники предвзятости.


Вот пример нерепрезентативной выборки, который приводит Хафф...:

Один психиатр заявил, что практически любой человек - неврастеник. Но спросим себя: что послужило основой для такого вывода? Каких именно людей наблюдал данный психиатр? Оказывается, он пришел к такому поучительному выводу, изучая своих пациентов, а они более чем неподходящие кандидатуры на роль выборки из всего населения. Если человек вполне нормален, то у психиатра нет никаких шансов увидеть его у себя на приеме.

Другой - уже хрестоматийный - пример связан с выборами президента США.

Журнал Literary Digest в 1936 году, опросив своих подписчиков, предсказал триумфальную победу республиканца Альфреда Лэндона над демократом Франклином Рузвельтом. В журнале забыли учесть, что его подписчики - это в основном богатые и зажиточные американцы, чаще всего сторонники республиканской партии. Победу на выборах одержал Рузвельт.

Вывод: если вам говорят, что 74% избирателей поддержат кандидата на предстоящих выборах президента - задайтесь вопросом, какие именно 74% граждан- избирателей?

Грамотно выбранное среднее

Чиновники едят мясо, я - капусту. В среднем, мы едим голубцы.

Термин «среднее» имеет очень расплывчатое толкование. В цитате, приведенной выше, это среднее арифметическое. Помимо него существуют мода и медиана.

В чём разница - читайте чуть ниже.

Во многих случаях все три средних показателя настолько близки по значению, что нет никакой необходимости делать различие между ними. Но если речь идет о доходах, то разница между тремя средними - огромная.

«Если вам попадается заявление владельца компании, где говорится, что у его сотрудников средняя зарплата достаточно высока, это может означать нечто конкретное, а может и не означать ничего.

Если упомянутый средний показатель представляет собой медиану, то он укажет на то, что половина сотрудников зарабатывает больше указанной суммы, а другая половина - меньше.
Но если перед вами среднее арифметическое (а можете мне поверить, так оно и бывает, если вид среднего не уточняется), то эта цифра не даст вам никакой полезной информации», - пишет Дарелл Хафф.
Что касается моды, то это самое часто встречающееся значение из множества и, возможно, оно лучше всего характеризует уровень заработной платы в компании.

Так это выглядит на конкретном примере, где владелец компании зарабатывает 45 тыс. долларов, среднее арифметическое получается 5,7 тыс., а большинство сотрудников довольствуются 2 тыс. долларов.

Кстати, средняя заработная плата по итогам февраля 2016 года - почти 28 тыс. рублей. Ну, вы поняли…

Красивые графики

Простейшая разновидность статистической картинки - это график.


Полезная вещь - когда нужно продемонстрировать те или иные тенденции, напугать или успокоить. Всё, что требуется - задать нужную единицу деления на оси координат. 10% могут выглядеть и как восходящая тенденция, и как впечатляющий рост. Никаких фальсификаций, те же самые значения, та же самая кривая, но эффект другой.


Псевдообоснованная цифра

«Если не получается доказать то, что вы хотите доказать, продемонстрируйте нечто другое и настаивайте, что это то же самое. Привязать цифру, отражающую какой-то факт, к другому факту - прием известный и всегда сослужит вам добрую службу. Действует безотказно», - говорит Хафф.


Примеры? Да пожалуйста!

В 1953 году в авиакатастрофах погибло больше людей, чем в 1910 году. Должен ли отсюда следовать вывод, что авиаперелеты стали более опасны? Нет! Просто люди стали летать в сотни раз больше, чем раньше, вот и всё.


Уровень смертности в военно-морском флоте США в период Испано-Американской войны в 1898 году составлял девять человек на тысячу. За тот же период уровень смертности среди гражданского населения Нью-Йорка достигал шестнадцати человек на тысячу. На войне безопаснее, чем дома?

Конечно, нет!

В рядах военно-морского флота служат главным образом молодые и здоровые мужчины. Гражданское население состоит среди прочего из малых детей, стариков и больных, и для этих категорий населения уровень смертности выше, где бы они ни находились.

Неправильная причинно-следственная связь

После - не всегда значит вследствие! И Дарелл Хафф доказывает это на конкретных примерах и призывает быть бдительными.

«Отстают ли в учебе студенты-курильщики от некурящих студентов. Согласно одному исследованию - да, отстают. Очень многим это пришлось по душе, они пошли дальше и сделали вывод - курение пагубно влияет на умственные способности, - пишет Хафф. - Вышеупомянутое исследование, как мне верится, было проведено по всем правилам: объем выборки был достаточно велик, подобрали ее добросовестно и тщательно, величина корреляции оказалась значимой. Но в нем делается неоправданное предположение, что курение и есть причина плохой успеваемости. Но разве всё это нельзя с таким же успехом перевернуть наоборот? Может быть, именно скверные оценки заставили студентов искать утешения в курении? Если уж на то пошло, данный вывод столь же вероятен и не хуже подкреплен фактами».


Часто бывает так: взаимосвязь существует, но нельзя сказать, какая из переменных выступает причиной, а какая следствием. Гораздо коварнее, когда ни одна из переменных не оказывает воздействия на другую, но корреляция между ними всё равно есть, причем существенная.

Вот пример такой фиктивной корреляции. По словам Хаффа, уровень самоубийств достигает максимума в июне. Тогда же насчитывается наибольшее количество новобрачных. В чем дело? Самоубийства порождают такое количество свадеб? Или свадьбы провоцируют отвергнутых женихом или невестой свести счеты с жизнью? Более убедительным, но тоже недоказанным объяснением будет следующее. Некто отчаявшийся всю зиму борется с депрессией в надежде, что весной тучи рассеются. Но он окончательно сдается, когда наступает лето, выглядывает солнце, а никакого просвета нет…

Вывод: чтобы не поддаваться заблуждению «после - значит вследствие» - подвергайте любое утверждение анализу.

В общем, смотрите в оба и помните, что существует три вида лжи: ложь, наглая ложь и статистика.

Иллюстрации из книги «Как лгать при помощи статистики»

Выучите терминологию. Словом “среднестатистический” сегодня бросаются налево и направо, едва лишь речь заходит об обсуждении чего-то, относящегося к статистике. На первый взгляд термин звучит вполне ясно: среднестатистическое - это то, что в середине. Тем не менее, есть несколько видов среднестатистических данных, каждый из которых может быть весьма и весьма обманчив для человека, не умеющего с ним работать.

  • Среднее арифметическое: его мы знаем со школы. Складываем все цифры, делим на количество цифр - и готово. К примеру, есть цифры 3, 3, 5, 4, 7. Среднее арифметическое высчитывается так: сперва сложим (22), потом поделим на 5 (5 цифр).
    • Среднее арифметическое равняется 4.4
  • Медиана: некое число, которое находится строго в середине выборки. Если взять тот же набор чисел - 3, 3, 5, 4, 7 - то медианой в его случае будет 4, так как есть 2 числа меньше четверки и два числа больше.
  • Мода: это то число, которое чаще всего повторяется в выборке. Так, в нашем случае это 3, так как в этом - 3, 3, 5, 4, 7 - наборе чисел есть две тройки.
  • Когда лжет среднее арифметическое. Может казаться, что среднее арифметическое лгать не может просто по определению, но это только кажется. Аномальное высокие или аномальное низкие данные в выборке могут существенно исказить картину и, собственно, само среднее арифметическое! Чтобы лгать с его помощью, вам нужно найти выбросы значений данных и воспользоваться ими.

    • Пример: вы проводите опрос среди 50 домохозяйств в вашем районе. Тема опроса - уровень дохода. Допустим, все соседи получают доход в долларах. И все соседи зарабатывают около 40-60 тысяч долларов в год. Но один-единственный сосед умудряется делать в год 5 миллионов. Сами понимаете, когда вы сядете высчитывать среднее арифметическое по доходу в районе, то этот богатей своими 5 миллионами серьезно поднимет общую планку.
    • Аналогично: у 9 ваших соседей в банке лежит по тысяче долларов, а у десятого - всего один доллар. Среднее арифметическое получается равным $900,10, то есть почти на 10% меньше суммы вклада большей части людей.
    • В ходе проведения серьезных опросов, как правило, самые высокие и низкие показатели отбрасываются, только потом высчитывается среднее арифметическое. Увы, далеко не каждый опрос, чьи результаты вы видите в СМИ, можно назвать серьезным. Если у вас нет доступа к данным, полученным в ходе опроса, либо если нет письменного заявления о том, что в ходе анализа данных были отброшены экстремумы, то верить такому опросу… не стоит.
  • Когда лжет медиана. Откровенно говоря, тут лгать сложнее всего, что и понятно - медиана суть середина, она не может быть слишком большой или маленькой. Она просто должна быть в середине… тем не менее, с ее помощью можно прятать очень большие или очень маленькие данные. Например, у нас есть набор следующих цифр: 1, 1, 2, 3, 4, 5, 3000. Медиана здесь - 3.

    • Когда у вас четное количество данных, медиану можно найти, если найти среднее арифметическое двух данных, оказавшихся в середине выборки. Впрочем, это не вариант в случае резких выбросов показателей.
    • Не стоит слепо доверять отчетам об изменении результатов по прошествии времени, если оные изменения описываются медианами. Если какая-то компания заявляет, что медианный рост цен на ее услуги составил 3% в год, то это может значить, что в этом году компания повысила цены на все 20% и теперь просто пытается это скрыть за данными прошлых лет.
  • Когда лжет мода. В ряде случаев, и это объективно, моды лгать не могут. Например, когда речь заходит о том, сколько в среднем было куплено одним человеком билетов на спортивный матч, то тут фальсифицировать просто нечего. Тем не менее, моды тоже могут искажать действительность, особенно когда речь заходит о небольших выборках.

    • Например, в нашей выборке есть все цифры от 1 до 100, но “1” повторяется 3 раза. Соответственно, 1 будет модой по выборке, хотя среднее арифметическое будет гораздо ближе к 50.
    • Любой опрос, предлагающий оценить что-то по широкой шкале, может с помощью моды исказить действительность. Например, если опрошено 100 респондентов, каждому из которых предлагалось оценить что угодно по шкале от 1 до 10, и если люди оценивали на “10” чаще, чем ставили другие оценки (даже если десяток всего на одну больше, чем, к примеру, единиц), то можно смело заявить, что средняя мода по выборке равняется 10.
  • Цитата Я купил эту маленькую легкую книжку после того, как увидел ее в списке полезных книг для инвесторов Wall Street Journal. Она так пришлась мне по душе, что на конференции TED этого года я вместе с несколькими другими книгами рекомендовал ее всем подряд. Очень заинтересовала глава, посвященная применению визуальных средств для гиперболизации трендов и искажения сравнений, - актуальное напоминание, учитывая, как часто в последнее время в лентах Facebook и Twitter появляется инфографика. Билл Гейтс Очем книга В этой всемирно известной книге Дарелл Хафф рассказывает о различных способах злоупотребления статистикой в целях обмана аудитории и манипулирования ее мнением. Каждый день на вас пытаются повлиять, чтобы сподвигнуть на покупку какого-то нужного продукта или на выбор правильного кандидата: Благодаря пасте Чистые зубы образование кариеса снижается на 23%! ; Политика N поддерживает 85% граждан Как понять, насколько достоверны те или иные данные? Каким образом происходят подсчеты? Что учитывается, а что остается за кадром? Ответы на эти и многие другие вопросы вы найдете в этой книге. Почему книга достойна прочтения Это первая и единственная книга, написанная легким языком, на тему статистических исследований. Из этой книги вы узнаете, как на самом деле проводятся опросы, как выбирается средний показатель, насколько репрезентативна выборка. Автор раскрывает секретные инструменты статистиков и вооружает читателя знаниями, которые помогут разобраться во всех хитросплетениях этой науки и не позволят ввести в заблуждение. Кто автор Дарелл Хафф - известный американский писатель. Получил образование в Университете штата Айова. Прежде чем стать писателем, служил редактором в журналах Better Homes and Gardens и Liberty. Хафф написал 16 книг, большинство из которых касались бытовых проектов. Он читал лекции по статистике для старшеклассников и студентов. Его лекции всегда были очень познавательны и наглядны. Кроме того, он вел курс по сложным математическиммоделям. Ключевые понятия Статистика, расчеты, выборка, опрос, манипулирование, цифры, мнение. Особенности оформления книги Твердый переплет. Отзывы Статистика - это такая хитрая, покрытая камуфляжем, отрасль математики. С одной стороны, это цифры, логика и научный метод. С другой стороны, важная для нас статистика (и та, которая нас обманывает) - это всегда отражение поведения человека или его отношения к другим людям. Цифры продают нам нас же самих, завернутых в формулы статистическихраспределений и байесианских множеств. Василий Гатов приглашенный исследователь Центра коммуникационного лидерства и политики, Школа коммуникаций и журналистики Университета Южной Калифорнии Существует два метода убеждения - аналитический (цифры) и нарративный (истории). И у каждого есть своя темная, манипулятивная версия. В этой книге описаны все известные мне темные приемы аналитического метода. Здесь и махинации с отбором данных, и игры с интервалами осреднения, и манипулятивная визуализация. Приветствую появление этой книги на русском - теперь и у нас есть защита от темных статистических методов. Андрей Скворцов, директор компании `Меркатор` Издательство благодарит Сергея Багузина за идею издать книгу на русском языке.