Узел «Кластерный анализ (k-means)» используется для кластеризации набора данных в отдельные группы (кластеры) исходя из выявленных шаблонов во входном наборе данных. Наблюдения группируются таким образом, чтобы они были похожи друг на друга внутри кластера, но различались с наблюдениями из других кластеров.
Алгоритм работы: Модель k-средних определяет начальный набор центроидов для кластеров (исходя из параметра Количество кластеров). Затем каждое наблюдение определяется в кластер с наиболее близким центроидом. Центроиды кластеров обновляются в соответствии с набором наблюдений, назначенным в каждый кластер. Далее итерационно проверяется, необходимо ли переназначить наблюдение в другой кластер. Данный процесс продолжается до момента достижения максимального числа итераций (параметр Максимальное количество итераций).
Список параметров узла представлен в таблице ниже.
Таблица «Параметры узла "Кластерный анализ (k-means)"»
Параметр | Возможные значения и ограничения | Описание |
|---|---|---|
Название | Ручной ввод. | Название узла, которое будет отображаться в интерфейсе. |
Описание | Ручной ввод. | Описание узла. |
Количество кластеров | Ручной ввод целочисленного значения. | Задание числа кластеров, на которые будет делиться векторное пространство. |
Сид K-means кластеризации | Ручной ввод целочисленного значения. | Начальное числовое значение для генератора случайных чисел. |
Метод инициализации кластеров | Раскрывающийся список со следующими значениями:
| Данный параметр отвечает за выбор метода инициализации начальных точек кластеров. Предусмотрены следующие методы:
|
Стандартизация | Раскрывающийся список со следующими значениями:
| Данный параметр отвечает за выбор метода стандартизации данных. Предусмотрены следующие методы:
|
Количество запусков | Ручной ввод целочисленного значения. | Данный параметр задает число запусков. |
Максимальное количество итераций | Ручной ввод целочисленного значения. | Данный параметр задает максимальное количество итераций. |
Алгоритм K-средних | Раскрывающийся список со следующими значениями:
| Данный параметр отвечает за выбор алгоритма. |
Размер выборки | Ручной ввод целочисленного значения. | Данный параметр задает размер выборки для графика «Силуэт». |
Расстояние между кластерами | Ручной ввод целочисленного значения. | Данный параметр задает расстояние между кластерами для графика «Силуэт». |
Количество бинов | Ручной ввод целочисленного значения. | Данный параметр задает количество бинов для графика с параллельными осями. |
Переменные, по которым делать оси | Раскрывающийся список с выбором нескольких переменных. | Данный параметр задает переменные для графика с параллельными осями. |
Максимальное количество линий | Ручной ввод. | Данный параметр задает максимальное количество линий, которые будут отображаться на графике с параллельными осями. |
Результаты выполнения узла:
- Таблица с примером данных. Отображаются первые 100 наблюдений. В результате выполнения узла будет рассчитана новая переменная с результатами кластеризации (переменная Cluster_ID0).
- Круговая диаграмма с количеством наблюдений по кластерам.
- Силуэт (Silhouette Plot) (подробнее о графике см. в разделе «Результат расчета кластеризации»).
- Таблица с координатами центроидов, где в качестве строк выступают номера кластеров и значения переменных, в которых находятся центроиды этих кластеров.
- Таблица со статистиками по кластерам.
- Таблица со статистиками по переменным кластера. По каждому кластеру отражены среднее и стандартное отклонение для каждой переменной.




