Исходный размер 1730x2798

Исследование проблемы ошибок при типировании

PROTECT STATUS: not protected

Введение

Я увлекаюсь типологиями личности, это мое хобби и я хочу развиваться в этой теме, ведь чувствую в ней потенциал. Даже дипломный проект я делаю на тему типологий. А значит анализ данных, связанный с этой тематикой, должен оказать мне помощь в столь важной работе.

В качестве датасета были взяты данные с сайта kaggle.com, где собрана информация с сайта personality-database.com.

раздел pdb со знаменитостями // как выглядят результат голосования на pdb

Сайт (кратко pdb) представляет собой гигантскую базу данных персонажей/людей/явлений/вещей и тд, которые типируются людьми (с помощью голосования) по различным типологиям. Голосовать может любой зарегистрированный пользователь.

В исследуемом датасете представлены только знаменитости, их типологии (из pdb), а также количество людей, проголосовавших за определенную типологию.

В типологическом сообществе результаты голосования с pdb обычно не считаются верными по причине поверхностного типирования большей части голосовавших. Поэтому мне будет интересно исследовать датасет со следующими задачами:

1. Выяснить уровень популярности различных типологий

2. Сравнить результаты голосования за MBTI и соционику

3. Проследить насколько типирования с сайта попадают в строгие типологические корреляции

4. Выявить типологии и типы, которые вызывают больше всего проблем в типировании

big
Исходный размер 2798x1730

мудборд визуализации // собран в Figma

post

Цвета для визуализации:

#280004 #3546F8 #9E9E9E #BAF6FF #EBF6FF

(создаем словарь с палитрой для удобства)

Шрифт для визуализации:

post

Установка шрифта — загружены все начертания и с помощью словаря присвоены имена для удобства.

Для исследования были построены несколько видов графиков, которые хорошо подходят для визуализации категориальных данных:

[1] Столбчатые диаграммы

[2] Круговые диаграммы

[3] Матрицы

А также один вид для числовых данных:

[4] Диаграмма рассеяния

post

Использованные библиотеки:

• pandas
• matplotlib • numpy
• seaborn

Обработка данных и поиск ценной информации

Ищем самую популярную типологию

Начнем с легкого — соберем статистику типологий, за которые проголосовали больше и меньше всего. Для этого нужно суммировать голоса со всех строк и столбцов, которые подсчитывают количество проголосовавших за типологию в целом.

Исходный размер 866x728

Выбрана столбчатая диаграмма, потому что с ее помощью легче всего отследить разницу количества голосов.

Из интересного в коде — максимальное значение выделяется визуально.

0

Узнаем как часто любители самой популярной типологии ошибаются

post

Есть две типологии — соционика и мбти. У них одна основа и по этой причине типы из одной типологии можно назвать эквивалентами типов из другой.

Я создала словарь, чтобы обозначить эти эквиваленты.

В сообществе соционика считается более весомой и качественной типологией, по этой причине можно утверждать, что голоса за соционику более валидные, чем за мбти. Но для начала я хочу узнать процент совпадающих эквивалентов.

0

После того как мы увидели какой небольшой процент совпадений, хочется узнать какие именно типы совпадают, а какие нет. Для этого прекрасно подойдет матрица.

0

Для любителей типологий будет очень интересно рассматривать эту матрицу, ведь тут можно увидеть кого, в кого и насколько часто люди мистайпят.

Из интересного в коде — я выделила черной обводкой линию по диагонали. Квадраты этой диагонали как раз указывают верный эквивалент, то есть, зачастую, правдивое попадание.

Давайте еще сделаем столбчатую диаграмму, чтобы точно увидеть какие типы с какими чаще всего путают.

0
post

Также мне стало интересно сравнить, насколько сильно перевес голосов по мбти влияет на разрыв голосов между мбти и соционикой (для того чтобы ее вычислить создадим новый признак)

0

Получается, когда за мбти голосуют больше людей, то количество голосов за соционику не меняется, а значит вероятность ошибиться в итоговом варианте мбти также растет. Именно по этой причине типированиям сайта pdb не доверяют.

Исследование проблемы ошибок при типировании
Проект создан 14.01.2026