Узел «Профилирование» позволяет исследовать данные с целью выяснения статистических характеристик переменных.
Список параметров узла представлен в таблице ниже.
Параметр | Возможные значения и ограничения | Описание |
Название | Ручной ввод. Ограничений на значение нет. | Название узла, которое будет отображаться в интерфейсе. |
Описание | Ручной ввод. Ограничений на значение нет. | Описание. |
Результаты выполнения узла:
- Таблица с примером данных. Отображаются первые 100 наблюдений.
- Профиль
Общие статистики
Для всех наблюдений набора данных считается следующий набор статистик (пункт Статистика по набору данных):
- Количество значений.
- Количество уникальных значений.
- Процент уникальных значений (в процентах).
- Количество дублирующих строк.
- Процент дублирующих строк (в процентах).
Категориальные переменные
Для категориальных переменных рассчитывается набор статистик в соответствии с таблицей ниже.
Статистика | Описание |
Процент уникальных значений | Процент уникальных значений от общего количества значений |
Процент пропущенных значений | Процент пропущенных значений от общего количества значений |
Минимальная длина | Количество знаков минимального по длине значения |
Максимальная длина | Количество знаков максимального по длине значения |
Количество уникальных значений | Количество неповторяющихся значений |
Количество пропущенных значений | Количество пропущенных значений |
Top | 3 значения с максимальной частотой |
Bottom | 3 значения с минимальной частотой |
Для удобства интерпретации и анализа также предусмотрено построение Облака слов.
Облако слов (или облако тегов) визуализирует частоту появления значения переменной. Размер облака отражает частоту появления значения. Цветовая гамма не несет в себе смысла и выполняет исключительно эстетическую функцию.
Посмотреть Облако слов можно в том же контейнере с профилированием, выбрав в правом верхнем углу иконку .
Количественные переменные
Для количественных переменных подсчитывается набор статистик в соответствии с таблицей ниже.
Статистика | Описание |
Количество уникальных значений | Количество неповторяющихся значений переменной |
Процент уникальных значений | Процент неповторяющихся значений переменной |
Количество пропущенных значений | Количество пропущенных значений переменной |
Процент пропущенных значений | Процент пропущенных значений |
Минимальное значение | Наименьшее значение переменной |
Максимальное значение | Наибольшее значение переменной |
Среднее значение | Сумма всех значений переменной, разделенная на число этих значений |
5-й персентиль | Это некоторое значение X из данного ряда, которое делит все имеющиеся в нем значения на две группы: 5% значений, которые меньше X, и оставшиеся значения (то есть 95%), которые превышают X. |
95-й персентиль | Это некоторое значение X из данного ряда, которое делит все имеющиеся в нем значения на две группы: 95% значений, которые меньше X, и оставшиеся значения (то есть 5%), которые превышают X. |
1-й квартиль | 25-й персентиль |
3-й квартиль | 75-й персентиль |
Медиана | Значение, которое делит распределение пополам (его площадь в т. ч.): половина значений больше медианы, половина — не больше. |
Межквартильный размах | Разница между 3-м и 1-м квартилями. |
Количество выбросов | Выбросами считаются наблюдения, которые отклоняются от своего математического ожидания более чем на три среднеквадратических отклонения (правило трех сигм). |
Коэффициент вариации | Величина, равная отношению стандартного (среднеквадратичного) отклонения случайной величины к ее математическому ожиданию. Он применяется для сравнения вариативности одного и того же признака в нескольких совокупностях с различным средним арифметическим. Если значение коэффициента вариации не превышает 33%, то совокупность считается однородной, а если больше 33%, то — неоднородной. |
Коэффициент эксцесса | Характеризует меру высоты графика. Если коэффициент больше нуля, то распределение является более высоким («островершинным») относительно «эталонного» нормального распределения. Если коэффициент ниже нуля, то более низким и пологим. |
Медианное абсолютное отклонение | Вычисляется как медиана абсолютного значения для каждого значения минус медианное значение группы. Является статистикой, более устойчивой к выбросам в наборе данных, чем стандартное отклонение. |
Асимметрия | Характеризует меру скошенности графика влево/вправо. Если коэффициент асимметрии отрицателен, то скос левосторонний. Если коэффициент положителен, то скос правосторонний. И чем коэффициент больше по модулю, тем сильнее скос распределения. |
Стандартное отклонение | Статистическая характеристика распределения случайной величины, показывающая среднюю степень разброса значений величины относительно математического ожидания. Большее значение среднеквадратического отклонения показывает больший разброс наблюдаемых значений признака относительно среднего; меньшее значение, соответственно, показывает, что величины в множестве сгруппированы вокруг среднего. |
Дисперсия | Величина, которая характеризует меру разброса значений случайной величины относительно ее математического ожидания. |
Т-статистика | T-статистика — это разница между средним по выборке и гипотетическим средним (предполагаемым равным нулю), деленная на расчетную стандартную ошибку среднего. |
Пи-значение | Уровень значимости — вероятность получить T-значение, равное или превышающее то значение, которое мы в действительности рассчитали по имеющимся выборочным данным (при условии, что нулевая гипотеза верна). |
Для удобства интерпретации и анализа предусмотрено построение Гистограммы.
Гистограмма визуализирует распределение данных в рамках непрерывного интервала. На горизонтальной оси отмечаются интервалы (бины), а на вертикальной оси отмечается частота попаданий наблюдений в каждый интервал. Количество бинов не изменяемо и по умолчанию равно 50.
Посмотреть гистограмму можно в том же контейнере, выбрав в правом верхнем углу иконку .



