Cluster Analysis Explorer

Domain: Mutu dan Analisis Lanjutan · SQalytics · k-means · Ward hierarchical · silhouette coefficient · dendrogram

1 Introduksi

1.1 Latar Belakang

Cluster analysis adalah unsupervised learning untuk mengelompokkan observasi tanpa label apriori — temukan natural grouping dalam data multivariat. Dua keluarga dominan: partitional clustering (k-means; MacQueen, 1967) yang mempartisi data ke $k$ cluster tetap dengan minimasi within-cluster sum of squares, dan hierarchical clustering (Ward, 1963) yang membangun dendrogram dari bottom-up (agglomerative) atau top-down (divisive).

Aplikasi sains pangan: segmentasi konsumen by preference (cluster sensory ratings), klasifikasi produk by chemical fingerprint, identifikasi cultivars by NIR spectra, outlier detection di QC data. Pemilihan jumlah cluster optimal memakai silhouette coefficient (Rousseeuw, 1987) atau gap statistic (Tibshirani, Walther, & Hastie, 2001).

1.2 Tujuan Modul

1.3 Posisi di Antara Alternatif

Pilih Cluster Analysis Explorer untuk unsupervised grouping. Untuk dimensionality reduction, pakai PCA Explorer. Untuk supervised classification, pakai Class Modelling (SIMCA) atau Quick ML / Pattern Finder. Untuk preference segmentation sensory, pakai Preference Mapping.

2 Metode

2.1 Dasar Teoretis

Standarisasi data (z-score), karena cluster sensitif terhadap skala:

$$z_{ij} = \frac{x_{ij} - \bar{x}_j}{s_j}$$

Distance metrics — Euclidean (default):

$$d(\mathbf{x}_i, \mathbf{x}_j) = \sqrt{\sum_{k=1}^{p} (x_{ik} - x_{jk})^2}$$

Alternatif: Manhattan (city block), Mahalanobis (covariance-weighted), correlation-based.

k-means algorithm (MacQueen, 1967; Lloyd, 1982):

  1. Inisialisasi $k$ centroids (random atau k-means++, Arthur & Vassilvitskii, 2007).
  2. Assign tiap titik ke nearest centroid.
  3. Re-compute centroid = mean dari cluster members.
  4. Iterasi 2–3 sampai konvergen (no reassignment).

Objective: minimasi within-cluster sum of squares (WCSS):

$$\boxed{\, \text{WCSS} = \sum_{c=1}^{k} \sum_{\mathbf{x}_i \in C_c} \| \mathbf{x}_i - \boldsymbol{\mu}_c \|^2 \,}$$

Hierarchical clustering — Ward's linkage (Ward, 1963):

$$D(C_a, C_b) = \frac{n_a n_b}{n_a + n_b} \| \boldsymbol{\mu}_a - \boldsymbol{\mu}_b \|^2$$

Merge pasangan cluster dengan increase WCSS minimum. Hasil: dendrogram dengan height = merge distance.

Linkage alternatif:

Silhouette coefficient (Rousseeuw, 1987) untuk titik $i$:

$$s(i) = \frac{b(i) - a(i)}{\max\{a(i), b(i)\}}$$

dengan $a(i)$ = mean intra-cluster distance, $b(i)$ = mean nearest-cluster distance. Range $[-1, 1]$. Average silhouette > 0.5 → strong cluster structure; 0.25–0.5 reasonable; < 0.25 weak.

Elbow method: plot WCSS vs $k$, pilih titik "siku" sebelum diminishing returns.

Gap statistic (Tibshirani et al., 2001): bandingkan WCSS observed dengan WCSS dari $B$ null reference distributions.

2.2 Persamaan Inti

2.3 Asumsi & Batas Validitas

AsumsiKonsekuensi jika dilanggarCara cek di SQalytics
Variabel di-standarisasiVariabel besar dominateDefault z-score on
Tidak ada outlier ekstremk-means tergangguRobustness check + boxplot
Cluster spherical (k-means)Wrong assignment untuk elongated clusterPakai Ward atau DBSCAN
Jumlah cluster $k$ dipilih tepatOver/under-segmentationSilhouette + elbow + gap
Variables relevantNoise variables blur clusterFeature selection sebelum cluster
Distance metric appropriateWrong groupingPilih metric sesuai data

3 Cara Kerja

3.1 Step-by-Step di SQalytics

  1. Buka Cluster Analysis Explorer dari domain Mutu dan Analisis Lanjutan.
  2. Muat matriks: rows = objek (produk/panelis/sampel), columns = fitur numerik.
  3. Pilih standarisasi: z-score (default), range, atau none.
  4. Pilih algoritma: k-means / hierarchical Ward / hierarchical average / hierarchical complete.
  5. Pilih jumlah cluster $k$ atau opsi auto (silhouette-maximizing).
  6. Klik Run Clustering.
  7. Tinjau: Tab Cluster Assignment — tabel objek + cluster label; Tab Dendrogram (hierarchical) atau Centroid Plot (k-means); Tab Silhouette Plot — per-cluster silhouette + average; Tab PCA Projection — 2D scatter dengan cluster coloring; Tab Cluster Profile — mean per variabel per cluster.

3.2 Template Tabel Input + Contoh Data Sintetis

Sensory descriptors 12 cookie products (panel mean):

ProductCrispnessSweetnessButteryCocoaAftertaste
A8.56.27.85.06.5
B8.76.08.05.26.7
C4.27.54.58.07.0
D4.07.84.28.27.2
E6.55.06.03.04.5
F6.74.86.23.24.3
… (12 products total, 5 descriptors)
SYNTHETIC Sensory descriptor data 12 cookie products dari QDA panel. CSV setara: docs/assets/example-data/id/quality-advanced/template_quality_cluster.csv.

3.3 Contoh Luaran

Optimal $k$ selection:

$k$WCSSSilhouetteGap
228.50.420.58
315.20.610.74 ✓
411.80.480.62
59.50.350.51

Pilih $k = 3$ (silhouette + gap maximum).

Cluster assignment (Ward linkage):

ClusterMembersProfile
1: Crispy-butteryA, B, G, HHigh crispness (8.5), buttery (7.8), low cocoa
2: Soft-cocoaC, D, I, JSoft texture (4.2), high cocoa (8.0), sweet
3: Bland-balancedE, F, K, LMedium all attributes, low intensity

Silhouette plot: average $s = 0.61$ → strong cluster structure.

PCA 2D projection: PC1 (43% variance) = crispness-vs-cocoa axis, PC2 (28%) = sweetness intensity. Clusters well-separated visual.

Cluster profile (z-score means):

VariableCluster 1Cluster 2Cluster 3
Crispness+1.2−1.3−0.1
Sweetness−0.5+1.0−0.6
Buttery+1.1−1.2−0.2
Cocoa−1.0+1.4−0.5
Aftertaste+0.3+0.8−1.0
Cluster Analysis Explorer — figure 01
Gambar 1. Panel (a) Dendrogram Ward linkage — 12 cookie products dengan 3 cluster coloring; panel (b) PCA 2D projection (PC1 43%, PC2 28%) dengan cluster color coding dan centroid markers.
Kesimpulan ringkas: "Cluster analysis 12 cookie products mengidentifikasi 3 natural cluster (silhouette = 0.61, kuat). Cluster 1 (crispy-buttery): A, B, G, H — high crispness + buttery, low cocoa. Cluster 2 (soft-cocoa): C, D, I, J — high cocoa + sweet, soft texture. Cluster 3 (bland-balanced): E, F, K, L — medium all attributes (likely lowest preference). Implikasi: market punya 2 product positioning yang jelas (Cluster 1 vs 2) — competitor analysis bisa dilakukan per cluster, bukan all-vs-all. Bila brand di Cluster 3, repositioning ke Cluster 1 atau 2 lebih strategic. Lanjut ke Preference Mapping untuk overlay consumer preference per cluster, atau ke PCA Explorer untuk loadings analysis detail."

4 Kesimpulan

4.1 Relevansi Real-World

4.2 Where to Go from Here

Troubleshooting Cepat

Silhouette rendah di semua $k$. Data tidak ada cluster natural; mungkin continuous gradient.
Cluster size sangat imbalanced. Outliers menarik 1 cluster ke sendiri; cek outlier removal.
k-means hasil berbeda tiap run. Inisialisasi random; pakai k-means++ atau seed reproducible.

i Riwayat Revisi

TanggalRevisiPenulis
2026-05-12Draft v2 publikasi (KaTeX k-means + Ward + silhouette + gap + APA MacQueen/Ward/Rousseeuw/Tibshirani)Claude
2026-05-12Konversi MD → HTML (W5 quality-advanced batch)Claude

4 Referensi

  • MacQueen, J. (1967). Some methods for classification and analysis of multivariate observations. Proceedings of the Fifth Berkeley Symposium on Mathematical Statistics and Probability, 1, 281–297.
  • Ward, J. H. (1963). Hierarchical grouping to optimize an objective function. Journal of the American Statistical Association, 58(301), 236–244. https://doi.org/10.1080/01621459.1963.10500845
  • Rousseeuw, P. J. (1987). Silhouettes: A graphical aid to the interpretation and validation of cluster analysis. Journal of Computational and Applied Mathematics, 20, 53–65. https://doi.org/10.1016/0377-0427(87)90125-7
  • Tibshirani, R., Walther, G., & Hastie, T. (2001). Estimating the number of clusters in a data set via the gap statistic. Journal of the Royal Statistical Society B, 63(2), 411–423. https://doi.org/10.1111/1467-9868.00293
  • Arthur, D., & Vassilvitskii, S. (2007). k-means++: The advantages of careful seeding. Proceedings of the ACM-SIAM Symposium on Discrete Algorithms, 1027–1035.
  • Kaufman, L., & Rousseeuw, P. J. (2005). Finding groups in data: An introduction to cluster analysis. John Wiley & Sons.