В основе узла «Иерархическая кластеризация» лежит алгоритм кластеризации, направленный на создание иерархии вложенных кластеров.
Алгоритм работы: первоначально рассчитывается расстояние между точками (наблюдениями), ближайшие из них объединяются в один класс (Шаг 1 и Шаг 2). Расчет расстояния задает параметр «Метрика», параметр «Критерий объединения» определяет стратегию слияния кластеров. Затем вычисляется расстояние между классами и ближайшие объединяются в один большой класс (Шаг 3). Слияние классов происходит до тех пор, пока не будет синтезирован один класс (Шаг 4).
Для остановки алгоритма необходимо указать в параметре Критерий остановки требуемый вариант – по достижении заданного количества кластеров, либо по минимальному расстоянию между кластерами.
Для определения значения количества кластеров или расстояния между кластерами рекомендуется воспользоваться дендрограммой в результатах узла.
Список параметров узла представлен в таблице.
Таблица «Параметры узла "Иерархическая кластеризация"»
Параметр | Возможные значения и ограничения | Описание |
|---|---|---|
Название | Ручной ввод. | Название узла, которое будет отображаться в интерфейсе. |
Описание | Ручной ввод. | Описание узла. |
Критерий остановки | Раскрывающийся список со следующими значениями:
| Данный параметр отвечает за выбор критерия остановки. Предусмотрены следующие методы:
|
Количество кластеров | Ручной ввод целочисленного значения. | Данный параметр задает число кластеров, на которые будет делиться векторное пространство. Действителен при выбранном критерии остановки «Количество кластеров» |
Стандартизация | Раскрывающийся список со следующими значениями:
| Данный параметр отвечает за выбор метода стандартизации данных. Предусмотрены следующие методы:
|
Метрика | Раскрывающийся список со следующими значениями:
| Данный параметр отвечает за выбор метрики, которая влияет на форму кластеров. |
Критерий объединения | Раскрывающийся список со следующими значениями:
| Метрика, используемая для объединения кластеров. Предусмотрены следующие метрики близости кластеров:
|
Сид иерархической кластеризации | Ручной ввод целочисленного значения. | Начальное числовое значение для генератора случайных чисел. |
Размер выборки | Ручной ввод целочисленного значения. | Данный параметр задает размер выборки для графика «Силуэт». |
Расстояние между кластерами | Ручной ввод. | Данный параметр задает расстояние между кластерами для графика «Силуэт». |
Количество бинов | Ручной ввод целочисленного значения. | Данный параметр задает количество бинов для графика с параллельными осями. |
Переменные, по которым делать оси | Раскрывающийся список с выбором нескольких переменных. | Данный параметр задает переменные для графика с параллельными осями. |
Максимальное количество линий | Ручной ввод целочисленного значения. | Данный параметр задает максимальное количество линий, которые будут отображаться на графике с параллельными осями. |
Результаты выполнения узла:
- Табличные результаты
- Таблица с примером данных. Отображаются первые 100 наблюдений. В результате выполнения узла будет рассчитана новая переменная с результатами кластеризации (переменная Cluster_ID0).
- Таблица со статистиками по переменным кластера. По каждому кластеру отражены среднее и стандартное отклонение для каждой переменной.
Графические результаты
- Круговая диаграмма с количеством наблюдений в каждом кластере (аналогично результату узла «Кластерный анализ (k-means)»).
- Силуэт – Silhouette Plot. Значение Silhouette для каждого наблюдения (на графике отображается указанное в параметре «Размер выборки» число наблюдений) является мерой того, насколько это наблюдение похоже на наблюдения в собственном кластере по сравнению с наблюдениями в других кластерах. Значение Silhouette находится в диапазоне от -1 до 1. Высокое значение указывает на то, что наблюдение хорошо соответствует собственному кластеру и плохо соответствует другим кластерам. Если большинство наблюдений имеют низкое или отрицательное значение Silhouette, тогда пользователь должен перестроить кластеризацию с большим или меньшим количеством кластеров.
- Дендрограмма кластеризации. Дендрограмма показывает близость отдельных наблюдений и кластеров, а также последовательность их объединения. Количество уровней соответствует количеству слияний кластеров. По оси Y расположена шкала, на которой откладывается расстояние между объектами в пространстве признаков.


