Regression Studio

Domain: Statistika Terapan · SQalytics · Desk expert untuk Linear / Polynomial / Logarithmic / Exponential model + diagnostik penuh

1 Introduksi

1.1 Latar Belakang

Analisis regresi adalah keluarga teknik yang memodelkan hubungan fungsional antara prediktor $X$ dan respons $Y$. Sejak Galton (1886) memperkenalkan istilah "regression to the mean", regresi menjadi metode paling banyak dipakai di sains untuk deskripsi, prediksi, dan inferensi kausal (Draper & Smith, 1998; Montgomery, Peck, & Vining, 2021). Empat bentuk model paling umum di sains pangan dan farmasi:

  1. Linear — $y = \beta_0 + \beta_1 x$ untuk hubungan proporsional (Beer-Lambert, kalibrasi HPLC).
  2. Polynomial — $y = \beta_0 + \beta_1 x + \beta_2 x^2 + \ldots$ untuk kurva non-linier (dose-response, RSM).
  3. Logarithmic — $y = \beta_0 + \beta_1 \ln(x)$ untuk efek saturasi.
  4. Exponential — $y = \beta_0 e^{\beta_1 x}$ untuk pertumbuhan/peluruhan.

Regression Studio adalah desk expert yang mendukung keempat model dengan kontrol penuh: multi-Y simultan, group-by-fit, prediction interval, dan tool prediksi.

1.2 Tujuan Modul

1.3 Posisi di Antara Alternatif

Pilih Regression Studio untuk kontrol manual model + diagnostik penuh. Untuk pertanyaan beginner, pakai X-Y Relationship. Untuk multi-prediktor, gunakan Predict One Result from Many Variables. Untuk multivariate latent variable, gunakan PLSR Studio. Untuk ANOVA dengan faktor kategori, gunakan ANOVA Studio.

2 Metode

2.1 Dasar Teoretis

Model linear OLS (Gauss-Markov, 1809) — estimasi koefisien minimisasi residual squared:

$$ \hat{\beta} = (X^T X)^{-1} X^T y $$

Untuk model linear sederhana ($y = \beta_0 + \beta_1 x$):

$$ \hat{\beta}_1 = \frac{\sum (x_i - \bar{x})(y_i - \bar{y})}{\sum (x_i - \bar{x})^2}, \quad \hat{\beta}_0 = \bar{y} - \hat{\beta}_1 \bar{x} $$

Polynomial regression orde-$d$ — basis $\{1, x, x^2, \ldots, x^d\}$:

$$ y = \beta_0 + \beta_1 x + \beta_2 x^2 + \cdots + \beta_d x^d + \varepsilon $$

Bahaya overfitting untuk $d$ tinggi — gunakan adj $R^2$ + AIC untuk pemilihan optimal.

Logarithmic — linearisasi via $u = \ln(x)$: $y = \beta_0 + \beta_1 \ln(x) + \varepsilon$. Memerlukan $x > 0$.

Exponential — model multiplikatif dilinearisasi via $\ln$ pada $y$:

$$ y = \beta_0 e^{\beta_1 x} + \varepsilon \quad \xrightarrow{\ln} \quad \ln(y) = \ln(\beta_0) + \beta_1 x $$

Memerlukan $y > 0$.

Metrik goodness-of-fit:

$$ R^2 = 1 - \text{SS}_{\text{res}} / \text{SS}_{\text{tot}}, \quad R^2_{\text{adj}} = 1 - (1-R^2) \cdot \frac{n-1}{n-p-1} $$ $$ \text{RMSE} = \sqrt{\sum (y_i - \hat{y}_i)^2 / n} $$ $$ \text{AIC} = n \ln(\text{SS}_{\text{res}}/n) + 2(p+1), \quad \text{BIC} = n \ln(\text{SS}_{\text{res}}/n) + (p+1)\ln(n) $$

Gauss-Markov assumptions untuk OLS BLUE:

  1. Linearitas — bentuk model benar.
  2. Random sampling — observasi i.i.d.
  3. No perfect multicollinearity (untuk multi-X).
  4. Zero conditional mean — $E[\varepsilon | X] = 0$.
  5. Homoskedastisitas — $\text{Var}(\varepsilon | X) = \sigma^2$ konstan.
  6. Normalitas residual — $\varepsilon \sim \mathcal{N}(0, \sigma^2)$.

Diagnostik visual standar (Belsley, Kuh, & Welsch, 1980):

Prediction interval untuk $\hat{y}_{\text{new}}$:

$$ \hat{y}_{\text{new}} \pm t_{\alpha/2, n-p-1} \cdot \sqrt{\text{MS}_{\text{res}} \left(1 + \frac{1}{n} + \frac{(x_{\text{new}} - \bar{x})^2}{\sum (x_i - \bar{x})^2}\right)} $$

2.2 Persamaan Inti

OLS estimator: $\hat{\beta} = (X^T X)^{-1} X^T y$

$R^2$ dan adj $R^2$: $R^2 = 1 - \text{SS}_{\text{res}}/\text{SS}_{\text{tot}}$, $R^2_{\text{adj}} = 1 - (1-R^2) \cdot (n-1)/(n-p-1)$

RMSE: $\sqrt{\sum (y_i - \hat{y}_i)^2 / n}$

AIC / BIC: $n \ln(\text{SS}_{\text{res}}/n) + 2(p+1)$ / $\ln(n)(p+1)$

F-statistic: $F = (R^2/p) / ((1-R^2)/(n-p-1)) \sim F_{p, n-p-1}$

2.3 Asumsi & Batas Validitas

AsumsiKonsekuensi jika dilanggarCara cek di SQalytics
Linearitas (bentuk model benar)Bias sistematis, $R^2$ rendahResidual vs fitted — pola lengkung → ganti model
Independensi residualSE underestimated, p biasPlot residual vs order; Durbin-Watson
HomoskedastisitasSE bias, PI salahResidual vs fitted; Breusch-Pagan
Normalitas residualt/F invalid untuk $n$ kecilQQ-plot; Shapiro-Wilk
Tidak ada outlier mendominasiKoefisien biasCook's distance $> 4/n$
Polynomial degree wajar ($d \leq n/3$)OverfittingAdj $R^2$ tidak naik signifikan
Logarithmic: $x > 0$Tidak terdefinisiModul flag otomatis
Exponential: $y > 0$Linearisasi gagalModul flag otomatis

3 Cara Kerja

3.1 Step-by-Step di SQalytics

  1. Buka Regression Studio dari domain Statistika Terapan.
  2. (Opsional) Muat seed stats_group_compare.
  3. Pada DJ Entry Panel, pilih preset: Straight line first, Curved relationship, Logarithmic, atau Exponential.
  4. Sesuaikan: Regression Model, Independent (X), Dependent (Y) (satu atau lebih), Group by (opsional), Polynomial Degree (jika polinomial), Confidence Interval (%).
  5. Klik Run from DJ Entry Panel atau Run Regression.
  6. Tinjau hasil per accordion Y vs X: Regression Plot → Diagnostics → Model Summary → Metrics.
  7. (Opsional) Gunakan Make a Prediction untuk input X baru.
  8. Klik Save Report to TXT.

3.2 Template Tabel Input + Contoh Data Sintetis

KolomTipeWajibCatatan
WeeknumericIndependent X
Moisturenumeric✓ (≥1)Dependent Y
TreatmentcategoryGroup by (opsional)

Contoh data sintetis (12 baris — Moisture (%) vs Week selama storage 0–11 minggu):

WeekMoisture
014.20
113.85
213.40
313.10
412.95
512.85
612.80
712.85
812.95
913.15
1013.40
1113.70
SYNTHETIC Kadar air (%) biskuit selama 11 minggu storage ambient. Pola U-shape klasik: dehidrasi awal (0–6 mg, ke headspace) lalu rehidrasi (7–11 mg, dari packaging RH). Model polinomial orde-2: $\hat{y} = 14.20 - 0.45 x + 0.038 x^2$, $R^2 \approx 0.99$. Linear fit memberikan $R^2$ rendah ($\approx 0.05$). CSV setara: docs/assets/example-data/id/statistics/template_stats_groups.csv.

3.3 Contoh Luaran

Tabel Model Summary (polynomial $d = 2$):

TermEstimateSEt-statisticp-value95% CI
$\beta_0$ (Intercept)14.1960.082173.1< 0.001[14.013, 14.379]
$\beta_1$ (Week)-0.45020.038-11.84< 0.001[-0.536, -0.365]
$\beta_2$ (Week²)0.03830.003411.23< 0.001[0.031, 0.046]

Tabel Metrics:

MetricValueInterpretation
$R^2$0.992899.3% variansi Y terjelaskan
Adj $R^2$0.9912Penyesuaian untuk df ($p = 2$)
RMSE0.045Standar error prediksi ≈ 0.045% moisture
F-statistic$F_{2,9} = 619.0$$p < 0.001$ — model signifikan
AIC-45.2Lebih rendah = model lebih baik
BIC-43.7Untuk perbandingan model lain

Comparison dengan model alternatif:

Model$R^2$Adj $R^2$AICRMSEDecision
Linear ($y \sim x$)0.052-0.04318.40.512✗ Tidak fit (pola non-monoton)
Polynomial $d=2$0.9930.991-45.20.045✓ Best fit
Polynomial $d=3$0.9930.990-43.40.045Tidak ada improvement
LogarithmicNANANANA✗ Tidak valid (week=0)

Tabel Diagnostics:

Test / PlotResultInterpretation
Residual vs fittedRandom scatterLinearitas OK ✓
QQ-plot residualMostly alignedNormal asymptotically ✓
Shapiro-Wilk residual$W = 0.94$, $p = 0.485$Normal ✓
Cook's distance max0.62 (week 0)High but below cutoff $4/n = 0.33$
Breusch-Pagan$p = 0.41$Homoskedastik ✓

Prediction example (input Week = 13):

InputPredicted $\hat{Y}$95% Prediction Interval
Week = 1314.81%[14.66, 14.96]
Kesimpulan ringkas: "Model polinomial orde-2 memberikan fit excellent: $\hat{y} = 14.20 - 0.450 x + 0.0383 x^2$ dengan $R^2 = 0.9928$, adj $R^2 = 0.9912$, RMSE 0.045%. Polynomial orde-2 jauh superior dibanding linear ($R^2 = 0.05$, gagal menangkap U-shape) dan orde-3 (tidak ada improvement signifikan, $\Delta$AIC > -2). Semua koefisien signifikan ($p < 0.001$). Diagnostik tervalidasi: residual normal (Shapiro $p = 0.485$), homoskedastik (Breusch-Pagan $p = 0.41$), tidak ada Cook's distance di atas cutoff. Interpretasi: kadar air biskuit menunjukkan U-shape klasik storage — dehidrasi awal (0–6 mg) diikuti rehidrasi (7–11 mg). Minimum moisture tercapai sekitar week 5.9 ($x_{\min} = -\beta_1 / (2\beta_2)$). Prediksi week 13 = 14.81%. Untuk shelf life decision-making, lanjut ke Predictive Microbiology (mikrobial) atau Water Activity / Sorption Isotherm (target $a_w$ storage)."

Grafik utama: tiga panel — (a) regression plot dengan 95% CI band; (b) residual vs fitted; (c) QQ-plot.

Regression Studio polynomial U-shape moisture vs week dengan diagnostik
Gambar 1. Polynomial regression orde-2 untuk kadar air biskuit (%) selama 11 minggu storage ambient. (a) Panel utama: 12 titik observasi (lingkaran biru) + kurva fit polinomial $d = 2$ (garis merah) + 95% CI band (biru transparan). Bintang amber pada $x_{\min} = 5.88$ menandai titik minimum kuadratik. Kotak putih menampilkan metrik: $R^2 = 0.9928$, adj $R^2 = 0.9912$, RMSE = 0.045, $F_{2,9} = 619$ ($p < 0.001$). Pola U-shape klasik storage: dehidrasi awal (week 0–6, kehilangan moisture ke headspace) diikuti rehidrasi (week 7–11, equilibrium dengan packaging RH). (b) Diagnostik residual vs fitted: titik tersebar random di sekitar garis nol (merah putus-putus) — linearitas + homoskedastisitas terjaga. (c) QQ-plot residual: titik berdistribusi sesuai garis referensi normal — Shapiro-Wilk $p$ = 0.485, asumsi normalitas tervalidasi. Konsisten: polinomial orde-2 adalah model terbaik (vs linear $R^2 = 0.05$ atau orde-3 tanpa improvement signifikan).

4 Kesimpulan

4.1 Relevansi Real-World

Pada Rencana Publikasi Singkil v5, modul ini dipakai pada T3 Tahap 2 untuk kalibrasi marker fenolik (HPLC) dan T5 Tahap 2 untuk model shelf life atribut sensoris.

4.2 Where to Go from Here

Pembacaan lanjutan:

Troubleshooting Cepat

Tombol run tetap nonaktif. Pastikan satu kolom X dan minimal satu kolom Y dipilih. X tidak boleh sama dengan Y.
Hasil model gagal pada log atau eksponensial. Logaritmik: $x > 0$. Eksponensial: $y > 0$.
Model terasa terlalu "pas". Turunkan derajat polinomial — overfitting pada $d$ tinggi. Cek adj $R^2$ dan AIC: bila $d+1$ tidak menurunkan AIC ≥ 2 unit, pakai $d$.
Residual menunjukkan pola lengkung. Indikasi bentuk model salah — coba polinomial atau transformasi.
Residual fan-shaped. Pakai transformasi log/sqrt pada Y atau weighted least squares.
Cook's distance tinggi pada satu titik. Investigate: error pengukuran, outlier teknis, atau influential observation? Jangan asal hapus; report dengan/tanpa point.
Prediksi out-of-range. Extrapolasi bahaya — 95% PI sangat lebar. Modul flag bila $x_{\text{new}}$ di luar rentang $[\min(x), \max(x)]$.

i Riwayat Revisi

TanggalRevisiPenulis
2026-05-12Migrasi MD v2 → HTML final dengan figure 3-panel regression + residual + QQ-plot + caption Elsevier-styleClaude
2026-05-12Migrasi v1 → v2 (template publikasi + KaTeX OLS/R²/AIC/PI + Gauss-Markov + 4 model + APA Draper/Montgomery/Kutner)Claude
2026-05-09Draft awal v1Tim docs

4 Referensi

  • Galton, F. (1886). Regression towards mediocrity in hereditary stature. Journal of the Anthropological Institute of Great Britain and Ireland, 15, 246–263. https://doi.org/10.2307/2841583
  • Draper, N. R., & Smith, H. (1998). Applied regression analysis (3rd ed.). John Wiley & Sons. https://doi.org/10.1002/9781118625590
  • Montgomery, D. C., Peck, E. A., & Vining, G. G. (2021). Introduction to linear regression analysis (6th ed.). John Wiley & Sons.
  • Kutner, M. H., Nachtsheim, C. J., Neter, J., & Li, W. (2005). Applied linear statistical models (5th ed.). McGraw-Hill/Irwin.
  • Belsley, D. A., Kuh, E., & Welsch, R. E. (1980). Regression diagnostics: Identifying influential data and sources of collinearity. John Wiley & Sons. https://doi.org/10.1002/0471725153
  • Akaike, H. (1974). A new look at the statistical model identification. IEEE Transactions on Automatic Control, 19(6), 716–723. https://doi.org/10.1109/TAC.1974.1100705
  • Schwarz, G. (1978). Estimating the dimension of a model. The Annals of Statistics, 6(2), 461–464. https://doi.org/10.1214/aos/1176344136