Descriptive Analysis Studio

Domain: Statistika Terapan · SQalytics · Desk eksploratory dengan standar + robust statistics + uji normalitas + korelasi multi-metode

1 Introduksi

1.1 Latar Belakang

Analisis deskriptif adalah langkah pertama dalam Exploratory Data Analysis (Tukey, 1977) — tahap "look at the data" sebelum analisis inferensial. Peneliti perlu menjawab: "Berapa central tendency? Berapa dispersi? Apakah distribusinya simetris? Adakah outlier? Bagaimana hubungan antar variabel?". Descriptive Analysis Studio adalah desk expert yang menjawab semua pertanyaan ini dalam satu workspace, dengan kontrol lebih dalam daripada Quick Stats Check.

Modul ini menggabungkan statistik standar (mean, SD, median, IQR) dengan statistik robust (trimmed mean, MAD, Huber location) yang tahan terhadap outlier (Wilcox, 2017). Ditambah uji normalitas (Shapiro-Wilk, Anderson-Darling) dan analisis korelasi multi-metode (Pearson, Spearman, Kendall). Modul ini menjembatani eksplorasi data dengan publication-quality Table 1.

1.2 Tujuan Modul

1.3 Posisi di Antara Alternatif

Pilih Descriptive Analysis Studio untuk eksplorasi numerik dalam dengan output publikasi. Untuk review cepat satu kolom, pakai Quick Stats Check. Untuk uji statistik perbandingan, lanjut ke ANOVA Studio. Untuk regresi, pakai Regression Studio. Untuk heatmap korelasi kustom, pakai Correlation Explorer. Untuk multivariate latent variable, gunakan PLSR Studio.

2 Metode

2.1 Dasar Teoretis

Central tendency: Mean ($\bar{x} = \frac{1}{n}\sum x_i$, sensitif outlier), Median (robust 50% breakdown), Trimmed mean (Tukey, default $\alpha = 20\%$):

$$ \bar{x}_{\alpha} = \frac{1}{n - 2g} \sum_{i=g+1}^{n-g} x_{(i)}, \quad g = \lfloor \alpha n \rfloor $$

Huber M-estimator (Huber, 1964) — iterative reweighted dengan $\psi(u) = u$ bila $|u| \leq k$, $k \cdot \text{sign}(u)$ bila $|u| > k$, dengan $k = 1.345$ untuk 95% efisiensi pada normal.

Dispersi:

Shape:

Uji normalitas:

Shapiro-Wilk (paling powerful $n \leq 50$):

$$ W = \frac{(\sum a_i x_{(i)})^2}{\sum (x_i - \bar{x})^2} $$

Anderson-Darling (robust untuk $n$ besar, weight pada tail):

$$ A^2 = -n - \frac{1}{n} \sum_i (2i-1)[\ln F(x_{(i)}) + \ln(1 - F(x_{(n-i+1)}))] $$

Korelasi:

$$ r_{\text{Pearson}} = \frac{\sum (x_i - \bar{x})(y_i - \bar{y})}{\sqrt{\sum (x_i - \bar{x})^2 \sum (y_i - \bar{y})^2}} $$
$$ \rho_{\text{Spearman}} = 1 - \frac{6 \sum d_i^2}{n(n^2 - 1)}, \quad d_i = \text{rank}(x_i) - \text{rank}(y_i) $$ $$ \tau_{\text{Kendall}} = (n_{\text{concordant}} - n_{\text{discordant}}) / \binom{n}{2} $$

Interpretasi Cohen (1988): $|r| < 0.3$ lemah, 0.3–0.7 sedang, $\geq 0.7$ kuat. Inferensi: $t = r\sqrt{(n-2)/(1-r^2)} \sim t_{n-2}$.

2.2 Persamaan Inti

Standard: $\bar{x} = \frac{1}{n}\sum x_i$, $s = \sqrt{\frac{1}{n-1}\sum (x_i - \bar{x})^2}$

Trimmed mean: $\bar{x}_{0.20} = \frac{1}{n-2g} \sum_{i=g+1}^{n-g} x_{(i)}$

MAD: $1.4826 \cdot \text{median}(|x_i - \tilde{x}|)$

Skew / Kurt: $g_1 = \frac{1}{n}\sum z_i^3$, $g_2 = \frac{1}{n}\sum z_i^4 - 3$

Shapiro-Wilk W: $(\sum a_i x_{(i)})^2 / \sum (x_i - \bar{x})^2$

Pearson: $r = \sum (x_i - \bar{x})(y_i - \bar{y}) / \sqrt{\sum (x_i - \bar{x})^2 \sum (y_i - \bar{y})^2}$

Spearman: $1 - 6 \sum d_i^2 / [n(n^2-1)]$

Kendall: $(n_{\text{conc}} - n_{\text{disc}}) / \binom{n}{2}$

2.3 Asumsi & Batas Validitas

AsumsiKonsekuensi jika dilanggarCara cek di SQalytics
Data numerik kontinuStatistik invalidModul validate tipe
Mean/SD assume normal distribusiBias bila skew/outlierBandingkan dengan trimmed mean / MAD
Pearson assume bivariate normalBias bila outlierAuto-toggle ke Spearman bila non-normal
Shapiro-Wilk paling power $n \leq 50$Kurang sensitif untuk $n$ besarAnderson-Darling untuk $n > 50$
Outlier dideteksi via IQR ruleBias pada distribusi non-normalVisual box plot
Korelasi tidak menangkap non-linierKorelasi rendah padahal ada pola3D scatter; polinomial di Regression Studio
Replikasi $n \geq 8$ untuk Shapiro reliablePower rendahModul flag warning $n < 8$

3 Cara Kerja

3.1 Step-by-Step di SQalytics

  1. Buka Descriptive Analysis Studio dari domain Statistika Terapan.
  2. (Opsional) Muat seed stats_group_compare.
  3. Pada Analysis Function, pilih: Basic Statistics, Correlation Matrix, atau 3D Scatter.
  4. Pada Analyze Num. Vars., pilih satu atau lebih kolom numerik.
  5. Isi Group by (Optional) bila ingin ringkasan per kategori.
  6. Klik Run.
  7. Tinjau hasil: Standard → Robust → Shapiro-Wilk → Box Plot → (untuk korelasi) Heatmap.
  8. Klik Save Results to TXT.

3.2 Template Tabel Input + Contoh Data Sintetis

KolomTipeWajibCatatan
<var1>, <var2>, ...numeric✓ (≥1)Kolom analisis
GroupcategoryGroup by opsional

Contoh data sintetis (15 baris — 5 atribut quality multi-batch):

BatchMoistureProteinTextureColorScoreYield
B0112.511.27.48.585.2
B0212.811.47.68.686.1
B0312.411.17.28.484.8
B0412.711.37.58.785.9
B0512.611.57.38.585.5
B0612.911.67.88.886.4
B0712.311.07.18.384.5
B0812.811.47.58.685.8
B09 (outlier)13.411.77.98.986.8
B10–B15… (6 batch lainnya)
SYNTHETIC Lima atribut quality (Moisture %, Protein %, Texture N, ColorScore 1–10, Yield %) untuk 15 batch produksi biskuit. Korelasi ekspektasi: Moisture-Texture positif kuat (r ≈ 0.85), Yield berkorelasi positif dengan semua. B09 sebagai potential outlier dengan Moisture 13.4 (mean ± 2SD threshold). CSV setara: docs/assets/example-data/id/statistics/template_stats_groups.csv.

3.3 Contoh Luaran

Tabel Standard Descriptive Statistics:

Variable$n$MeanSDMedianIQRSkewnessKurtosis
Moisture1512.670.2712.60.301.211.74
Protein1511.330.2011.30.300.18-0.71
Texture157.470.257.50.300.20-0.93
ColorScore158.560.178.50.300.42-0.45
Yield1585.570.6685.51.100.41-0.49

Tabel Robust Descriptive Statistics:

VariableTrimmed Mean (20%)MADHuber Location$\Delta$(Mean - Trim)
Moisture12.640.3012.65+0.03 (slight skew)
Protein11.330.3011.330.00 (symmetric)
Texture7.470.307.470.00 (symmetric)
ColorScore8.550.308.56+0.01 (symmetric)
Yield85.550.7485.56+0.02 (symmetric)

Tabel Shapiro-Wilk Normality Test:

Variable$W$ statisticp-valueDecision (α = 0.05)
Moisture0.8640.028⚠ Non-normal (skewed by B09)
Protein0.9540.586✓ Normal
Texture0.9530.572✓ Normal
ColorScore0.9450.456✓ Normal
Yield0.9690.840✓ Normal

Tabel Correlation Matrix (Pearson):

MoistureProteinTextureColorScoreYield
Moisture1.00
Protein0.82***1.00
Texture0.87***0.84***1.00
ColorScore0.79***0.82***0.86***1.00
Yield0.89***0.91***0.92***0.88***1.00

*** = $p < 0.001$ — semua korelasi strong positive

Kesimpulan ringkas: "Lima atribut quality biskuit menunjukkan karakteristik distribusi heterogen. Empat dari lima ternormal (Shapiro $p > 0.45$) — aman untuk uji parametrik. Moisture menunjukkan skewness positif (skew = 1.21, Shapiro $p = 0.028$) — outlier B09 (13.4%) meningkatkan mean ke 12.67 vs trimmed mean 12.64 (Δ = +0.03, marginal). MAD Moisture (0.30) similar to SD (0.27) — outlier impact moderate. Korelasi antar atribut sangat kuat (Pearson $r$ = 0.79–0.92, semua $p < 0.001$) — konsisten dengan dugaan bahwa semua atribut adalah proxy quality batch yang co-vary. Yield paling terkait dengan Texture ($r = 0.92$) dan Protein ($r = 0.91$). Rekomendasi: (i) Investigasi B09; (ii) untuk pemodelan, gunakan PLSR Studio untuk handle multicollinearity dengan latent components; (iii) Tukey HSD pada Moisture pakai Welch atau Kruskal-Wallis karena non-normal."

Grafik utama: dua panel — (a) box plot multi-seri z-scored dengan jitter + B09 outlier highlighted; (b) correlation heatmap Pearson.

Descriptive Analysis Studio box plot multi-atribut + correlation heatmap
Gambar 1. Eksplorasi multivariate 5 atribut quality biskuit (n = 15 batch). (a) Box plot z-scored (standardized) untuk perbandingan distribusi: Moisture (biru), Protein (merah), Texture (hijau), ColorScore (ungu), Yield (amber). Bintang amber pada Moisture menandai B09 (13.4%, ≈ 2.7 SD di atas mean) — outlier yang menyebabkan skewness positif (1.21) dan Shapiro $p$ = 0.028 (non-normal). Empat atribut lainnya symmetric (skew < 0.5, Shapiro $p$ > 0.45). (b) Correlation heatmap Pearson dengan annotation $r$ per sel (colormap RdBu_r divergen). Semua korelasi di luar diagonal sangat tinggi ($r$ = 0.79–0.92, semua signifikan $p < 0.001$) — indikasi multicollinearity ekstrem: kelima atribut adalah proxy quality batch yang co-vary, dengan Yield sebagai aggregate marker terkait erat dengan keempat predictor. Implikasi untuk pemodelan: hindari OLS multi-X, gunakan PLSR atau pilih single dominant predictor (Texture).

4 Kesimpulan

4.1 Relevansi Real-World

Pada Rencana Publikasi Singkil v5, modul ini dipakai pada semua tahap sebagai langkah pertama eksplorasi data.

4.2 Where to Go from Here

Pembacaan lanjutan:

Troubleshooting Cepat

Hasil kosong walau tabel aktif sudah ada. Pastikan minimal satu kolom numerik benar-benar dipilih.
Korelasi tidak jalan. Periksa apakah jumlah kolom numerik yang dipilih minimal dua.
Box plot tampak aneh. Cek apakah salah satu kolom masih berisi teks atau terlalu banyak nilai kosong.
Shapiro-Wilk error pada $n < 3$. Test butuh minimal 3 observasi; pakai Anderson-Darling untuk $n$ kecil.
Skewness atau kurtosis aneh. Bandingkan mean dengan trimmed mean; gunakan MAD vs SD.
Korelasi tinggi semua atribut. Indikasi multicollinearity — lanjut ke PLSR Studio.
3D scatter tidak rendering. Pastikan 3 kolom berbeda dipilih untuk X, Y, Z.

i Riwayat Revisi

TanggalRevisiPenulis
2026-05-12Migrasi MD v2 → HTML final dengan figure dual-panel box plot + correlation heatmap + caption Elsevier-styleClaude
2026-05-12Migrasi v1 → v2 (template publikasi + KaTeX descriptive/robust/normality/correlation + APA Tukey/Wilcox/Shapiro)Claude
2026-05-09Draft awal v1Tim docs

4 Referensi

  • Tukey, J. W. (1977). Exploratory data analysis. Addison-Wesley.
  • Wilcox, R. R. (2017). Introduction to robust estimation and hypothesis testing (4th ed.). Academic Press. https://doi.org/10.1016/C2015-0-01807-3
  • Shapiro, S. S., & Wilk, M. B. (1965). An analysis of variance test for normality (complete samples). Biometrika, 52(3/4), 591–611. https://doi.org/10.2307/2333709
  • Anderson, T. W., & Darling, D. A. (1954). A test of goodness of fit. Journal of the American Statistical Association, 49(268), 765–769. https://doi.org/10.1080/01621459.1954.10501232
  • Huber, P. J. (1964). Robust estimation of a location parameter. The Annals of Mathematical Statistics, 35(1), 73–101. https://doi.org/10.1214/aoms/1177703732
  • Spearman, C. (1904). The proof and measurement of association between two things. The American Journal of Psychology, 15(1), 72–101. https://doi.org/10.2307/1412159
  • Kendall, M. G. (1938). A new measure of rank correlation. Biometrika, 30(1/2), 81–93. https://doi.org/10.2307/2332226
  • Cohen, J. (1988). Statistical power analysis for the behavioral sciences (2nd ed.). Lawrence Erlbaum Associates.