Узел «Кластерный анализ (k-means)» используется для кластеризации набора данных в отдельные группы (кластеры) исходя из выявленных шаблонов во входном наборе данных. Наблюдения группируются таким образом, чтобы они были похожи друг на друга внутри кластера, но различались с наблюдениями из других кластеров.
Алгоритм работы: Модель k-средних определяет начальный набор центроидов для кластеров (исходя из параметра Количество кластеров). Затем каждое наблюдение определяется в кластер с наиболее близким центроидом. Центроиды кластеров обновляются в соответствии с набором наблюдений, назначенным в каждый кластер. Далее итерационно проверяется, необходимо ли переназначить наблюдение в другой кластер. Данный процесс продолжается до момента достижения максимального числа итераций (параметр Максимальное количество итераций).
Список параметров узла представлен в таблице ниже.


Таблица «Параметры узла "Кластерный анализ (k-means)"»

Параметр

Возможные значения и ограничения

Описание

Название

Ручной ввод.
Ограничений на значение нет.

Название узла, которое будет отображаться в интерфейсе.

Описание

Ручной ввод.
Ограничений на значение нет.

Описание узла.

Количество кластеров

Ручной ввод целочисленного значения.
По умолчанию — 5.

Задание числа кластеров, на которые будет делиться векторное пространство.
Для определения количества кластеров можно воспользоваться априорной информацией об исходных данных в разделе «Исследования данных» (подробнее см. в разделах «Кластеризация» и «Результат расчета кластеризации»).

Сид K-means кластеризации

Ручной ввод целочисленного значения.
По умолчанию — 42.

Начальное числовое значение для генератора случайных чисел.

Метод инициализации кластеров

Раскрывающийся список со следующими значениями:

  • k-means++ (по умолчанию),
  • Forgy.

Данный параметр отвечает за выбор метода инициализации начальных точек кластеров. Предусмотрены следующие методы:

  • k-means++.
    Идея метода k-means++ состоит в том, чтобы выбрать начальные точки, которые находятся как можно дальше друг от друга. 
  • Forgy.
    Метод Forgy случайным образом выбирает k наблюдений (по числу заданных кластеров) из набора данных и использует их в качестве начальных значений.

Стандартизация

Раскрывающийся список со следующими значениями:

  • Нет.
  • Стандартное отклонение (по умолчанию).
  • Диапазон.

Данный параметр отвечает за выбор метода стандартизации данных. Предусмотрены следующие методы:

  • Нет.
  • Стандартное отклонение – преобразует наблюдения таким образом, чтобы их среднее значение равнялось нулю, а стандартное отклонение равнялось 1.
  • Диапазон – линейно преобразует значения переменных в диапазон [0, 1].

Количество запусков

Ручной ввод целочисленного значения.
По умолчанию — 10.

Данный параметр задает число запусков.

Максимальное количество итераций

Ручной ввод целочисленного значения.
По умолчанию — 300.

Данный параметр задает максимальное количество итераций.

Алгоритм K-средних

Раскрывающийся список со следующими значениями:

  • elkan,
  • full.

Данный параметр отвечает за выбор алгоритма.

Размер выборки

Ручной ввод целочисленного значения.
По умолчанию — 1000.

Данный параметр задает размер выборки для графика «Силуэт».

Расстояние между кластерами

Ручной ввод целочисленного значения.
По умолчанию — 25.

Данный параметр задает расстояние между кластерами для графика «Силуэт».

Количество бинов

Ручной ввод целочисленного значения.
По умолчанию — 10.

Данный параметр задает количество бинов для графика с параллельными осями.

Переменные, по которым делать оси

Раскрывающийся список с выбором нескольких переменных.

Данный параметр задает переменные для графика с параллельными осями.

Максимальное количество линий

Ручной ввод.
По умолчанию — 50.

Данный параметр задает максимальное количество линий, которые будут отображаться на графике с параллельными осями.

Результаты выполнения узла: