1 Introduksi
1.1 Latar Belakang
Analisis regresi adalah keluarga teknik yang memodelkan hubungan fungsional antara prediktor $X$ dan respons $Y$. Sejak Galton (1886) memperkenalkan istilah "regression to the mean", regresi menjadi metode paling banyak dipakai di sains untuk deskripsi, prediksi, dan inferensi kausal (Draper & Smith, 1998; Montgomery, Peck, & Vining, 2021). Empat bentuk model paling umum di sains pangan dan farmasi:
- Linear — $y = \beta_0 + \beta_1 x$ untuk hubungan proporsional (Beer-Lambert, kalibrasi HPLC).
- Polynomial — $y = \beta_0 + \beta_1 x + \beta_2 x^2 + \ldots$ untuk kurva non-linier (dose-response, RSM).
- Logarithmic — $y = \beta_0 + \beta_1 \ln(x)$ untuk efek saturasi.
- Exponential — $y = \beta_0 e^{\beta_1 x}$ untuk pertumbuhan/peluruhan.
Regression Studio adalah desk expert yang mendukung keempat model dengan kontrol penuh: multi-Y simultan, group-by-fit, prediction interval, dan tool prediksi.
1.2 Tujuan Modul
- Memfitkan 4 model regresi: Linear, Polynomial ($d \leq 5$), Logarithmic, Exponential.
- Mendukung multi-Y simultan: satu X terhadap beberapa Y dalam satu run.
- Mendukung group-by-fit: model terpisah per kategori.
- Menampilkan metrik model: $R^2$, adjusted $R^2$, RMSE, AIC, BIC, F-statistic.
- Plot diagnostik: regression curve + 95% CI + residual + QQ-plot.
- Tool prediksi: input X baru → $\hat{Y}$ + 95% PI.
- Audiens: mahasiswa S2/S3 dose-response, R&D kalibrasi instrumen, peneliti publikasi.
1.3 Posisi di Antara Alternatif
Pilih Regression Studio untuk kontrol manual model + diagnostik penuh. Untuk pertanyaan beginner, pakai X-Y Relationship. Untuk multi-prediktor, gunakan Predict One Result from Many Variables. Untuk multivariate latent variable, gunakan PLSR Studio. Untuk ANOVA dengan faktor kategori, gunakan ANOVA Studio.
2 Metode
2.1 Dasar Teoretis
Model linear OLS (Gauss-Markov, 1809) — estimasi koefisien minimisasi residual squared:
Untuk model linear sederhana ($y = \beta_0 + \beta_1 x$):
$$ \hat{\beta}_1 = \frac{\sum (x_i - \bar{x})(y_i - \bar{y})}{\sum (x_i - \bar{x})^2}, \quad \hat{\beta}_0 = \bar{y} - \hat{\beta}_1 \bar{x} $$Polynomial regression orde-$d$ — basis $\{1, x, x^2, \ldots, x^d\}$:
$$ y = \beta_0 + \beta_1 x + \beta_2 x^2 + \cdots + \beta_d x^d + \varepsilon $$Bahaya overfitting untuk $d$ tinggi — gunakan adj $R^2$ + AIC untuk pemilihan optimal.
Logarithmic — linearisasi via $u = \ln(x)$: $y = \beta_0 + \beta_1 \ln(x) + \varepsilon$. Memerlukan $x > 0$.
Exponential — model multiplikatif dilinearisasi via $\ln$ pada $y$:
$$ y = \beta_0 e^{\beta_1 x} + \varepsilon \quad \xrightarrow{\ln} \quad \ln(y) = \ln(\beta_0) + \beta_1 x $$Memerlukan $y > 0$.
Metrik goodness-of-fit:
$$ R^2 = 1 - \text{SS}_{\text{res}} / \text{SS}_{\text{tot}}, \quad R^2_{\text{adj}} = 1 - (1-R^2) \cdot \frac{n-1}{n-p-1} $$ $$ \text{RMSE} = \sqrt{\sum (y_i - \hat{y}_i)^2 / n} $$ $$ \text{AIC} = n \ln(\text{SS}_{\text{res}}/n) + 2(p+1), \quad \text{BIC} = n \ln(\text{SS}_{\text{res}}/n) + (p+1)\ln(n) $$Gauss-Markov assumptions untuk OLS BLUE:
- Linearitas — bentuk model benar.
- Random sampling — observasi i.i.d.
- No perfect multicollinearity (untuk multi-X).
- Zero conditional mean — $E[\varepsilon | X] = 0$.
- Homoskedastisitas — $\text{Var}(\varepsilon | X) = \sigma^2$ konstan.
- Normalitas residual — $\varepsilon \sim \mathcal{N}(0, \sigma^2)$.
Diagnostik visual standar (Belsley, Kuh, & Welsch, 1980):
- Residual vs fitted plot — cek linearitas + homoskedastisitas.
- QQ-plot residual — cek normalitas.
- Cook's distance $D_i$ — influential point ($D_i > 4/n$ ⇒ investigate).
- Leverage $h_{ii}$ — high-leverage bila $h_{ii} > 2(p+1)/n$.
Prediction interval untuk $\hat{y}_{\text{new}}$:
$$ \hat{y}_{\text{new}} \pm t_{\alpha/2, n-p-1} \cdot \sqrt{\text{MS}_{\text{res}} \left(1 + \frac{1}{n} + \frac{(x_{\text{new}} - \bar{x})^2}{\sum (x_i - \bar{x})^2}\right)} $$2.2 Persamaan Inti
OLS estimator: $\hat{\beta} = (X^T X)^{-1} X^T y$
$R^2$ dan adj $R^2$: $R^2 = 1 - \text{SS}_{\text{res}}/\text{SS}_{\text{tot}}$, $R^2_{\text{adj}} = 1 - (1-R^2) \cdot (n-1)/(n-p-1)$
RMSE: $\sqrt{\sum (y_i - \hat{y}_i)^2 / n}$
AIC / BIC: $n \ln(\text{SS}_{\text{res}}/n) + 2(p+1)$ / $\ln(n)(p+1)$
F-statistic: $F = (R^2/p) / ((1-R^2)/(n-p-1)) \sim F_{p, n-p-1}$
2.3 Asumsi & Batas Validitas
| Asumsi | Konsekuensi jika dilanggar | Cara cek di SQalytics |
|---|---|---|
| Linearitas (bentuk model benar) | Bias sistematis, $R^2$ rendah | Residual vs fitted — pola lengkung → ganti model |
| Independensi residual | SE underestimated, p bias | Plot residual vs order; Durbin-Watson |
| Homoskedastisitas | SE bias, PI salah | Residual vs fitted; Breusch-Pagan |
| Normalitas residual | t/F invalid untuk $n$ kecil | QQ-plot; Shapiro-Wilk |
| Tidak ada outlier mendominasi | Koefisien bias | Cook's distance $> 4/n$ |
| Polynomial degree wajar ($d \leq n/3$) | Overfitting | Adj $R^2$ tidak naik signifikan |
| Logarithmic: $x > 0$ | Tidak terdefinisi | Modul flag otomatis |
| Exponential: $y > 0$ | Linearisasi gagal | Modul flag otomatis |
3 Cara Kerja
3.1 Step-by-Step di SQalytics
- Buka
Regression Studiodari domain Statistika Terapan. - (Opsional) Muat seed
stats_group_compare. - Pada
DJ Entry Panel, pilih preset:Straight line first,Curved relationship,Logarithmic, atauExponential. - Sesuaikan: Regression Model, Independent (X), Dependent (Y) (satu atau lebih), Group by (opsional), Polynomial Degree (jika polinomial), Confidence Interval (%).
- Klik Run from DJ Entry Panel atau Run Regression.
- Tinjau hasil per accordion Y vs X: Regression Plot → Diagnostics → Model Summary → Metrics.
- (Opsional) Gunakan Make a Prediction untuk input X baru.
- Klik Save Report to TXT.
3.2 Template Tabel Input + Contoh Data Sintetis
| Kolom | Tipe | Wajib | Catatan |
|---|---|---|---|
Week | numeric | ✓ | Independent X |
Moisture | numeric | ✓ (≥1) | Dependent Y |
Treatment | category | ◯ | Group by (opsional) |
Contoh data sintetis (12 baris — Moisture (%) vs Week selama storage 0–11 minggu):
| Week | Moisture |
|---|---|
| 0 | 14.20 |
| 1 | 13.85 |
| 2 | 13.40 |
| 3 | 13.10 |
| 4 | 12.95 |
| 5 | 12.85 |
| 6 | 12.80 |
| 7 | 12.85 |
| 8 | 12.95 |
| 9 | 13.15 |
| 10 | 13.40 |
| 11 | 13.70 |
docs/assets/example-data/id/statistics/template_stats_groups.csv.
3.3 Contoh Luaran
Tabel Model Summary (polynomial $d = 2$):
| Term | Estimate | SE | t-statistic | p-value | 95% CI |
|---|---|---|---|---|---|
| $\beta_0$ (Intercept) | 14.196 | 0.082 | 173.1 | < 0.001 | [14.013, 14.379] |
| $\beta_1$ (Week) | -0.4502 | 0.038 | -11.84 | < 0.001 | [-0.536, -0.365] |
| $\beta_2$ (Week²) | 0.0383 | 0.0034 | 11.23 | < 0.001 | [0.031, 0.046] |
Tabel Metrics:
| Metric | Value | Interpretation |
|---|---|---|
| $R^2$ | 0.9928 | 99.3% variansi Y terjelaskan |
| Adj $R^2$ | 0.9912 | Penyesuaian untuk df ($p = 2$) |
| RMSE | 0.045 | Standar error prediksi ≈ 0.045% moisture |
| F-statistic | $F_{2,9} = 619.0$ | $p < 0.001$ — model signifikan |
| AIC | -45.2 | Lebih rendah = model lebih baik |
| BIC | -43.7 | Untuk perbandingan model lain |
Comparison dengan model alternatif:
| Model | $R^2$ | Adj $R^2$ | AIC | RMSE | Decision |
|---|---|---|---|---|---|
| Linear ($y \sim x$) | 0.052 | -0.043 | 18.4 | 0.512 | ✗ Tidak fit (pola non-monoton) |
| Polynomial $d=2$ | 0.993 | 0.991 | -45.2 | 0.045 | ✓ Best fit |
| Polynomial $d=3$ | 0.993 | 0.990 | -43.4 | 0.045 | Tidak ada improvement |
| Logarithmic | NA | NA | NA | NA | ✗ Tidak valid (week=0) |
Tabel Diagnostics:
| Test / Plot | Result | Interpretation |
|---|---|---|
| Residual vs fitted | Random scatter | Linearitas OK ✓ |
| QQ-plot residual | Mostly aligned | Normal asymptotically ✓ |
| Shapiro-Wilk residual | $W = 0.94$, $p = 0.485$ | Normal ✓ |
| Cook's distance max | 0.62 (week 0) | High but below cutoff $4/n = 0.33$ |
| Breusch-Pagan | $p = 0.41$ | Homoskedastik ✓ |
Prediction example (input Week = 13):
| Input | Predicted $\hat{Y}$ | 95% Prediction Interval |
|---|---|---|
| Week = 13 | 14.81% | [14.66, 14.96] |
Predictive Microbiology (mikrobial) atau Water Activity / Sorption Isotherm (target $a_w$ storage)."Grafik utama: tiga panel — (a) regression plot dengan 95% CI band; (b) residual vs fitted; (c) QQ-plot.
4 Kesimpulan
4.1 Relevansi Real-World
- Kalibrasi instrumen analitik — Beer-Lambert (UV-Vis), AUC vs konsentrasi (HPLC), FID (GC).
- Shelf life modeling — quality attribute vs storage time (moisture, color, hardness).
- Dose-response curves — sigmoid 4PL, Michaelis-Menten, Hill (antimikroba).
- Response Surface Methodology (RSM) — second-order polynomial untuk optimasi.
- Bioassay validation — log-dose vs response linear fit.
- Pharmacokinetics — exponential decay drug concentration.
- Agronomy yield model — polinomial yield vs nutrient (diminishing returns).
- Mikrobiologi growth — Gompertz dapat di-decompose ke linear via $\log$ transformasi.
Pada Rencana Publikasi Singkil v5, modul ini dipakai pada T3 Tahap 2 untuk kalibrasi marker fenolik (HPLC) dan T5 Tahap 2 untuk model shelf life atribut sensoris.
4.2 Where to Go from Here
Pembacaan lanjutan:
- Draper & Smith (1998) — buku rujukan klasik regresi terapan.
- Montgomery, Peck, & Vining (2021) — modern textbook regresi.
- Kutner et al. (2005) — applied linear models komprehensif.
- Belsley, Kuh, & Welsch (1980) — buku rujukan diagnostik.
⚙ Troubleshooting Cepat
i Riwayat Revisi
| Tanggal | Revisi | Penulis |
|---|---|---|
| 2026-05-12 | Migrasi MD v2 → HTML final dengan figure 3-panel regression + residual + QQ-plot + caption Elsevier-style | Claude |
| 2026-05-12 | Migrasi v1 → v2 (template publikasi + KaTeX OLS/R²/AIC/PI + Gauss-Markov + 4 model + APA Draper/Montgomery/Kutner) | Claude |
| 2026-05-09 | Draft awal v1 | Tim docs |
4 Referensi
- Galton, F. (1886). Regression towards mediocrity in hereditary stature. Journal of the Anthropological Institute of Great Britain and Ireland, 15, 246–263. https://doi.org/10.2307/2841583
- Draper, N. R., & Smith, H. (1998). Applied regression analysis (3rd ed.). John Wiley & Sons. https://doi.org/10.1002/9781118625590
- Montgomery, D. C., Peck, E. A., & Vining, G. G. (2021). Introduction to linear regression analysis (6th ed.). John Wiley & Sons.
- Kutner, M. H., Nachtsheim, C. J., Neter, J., & Li, W. (2005). Applied linear statistical models (5th ed.). McGraw-Hill/Irwin.
- Belsley, D. A., Kuh, E., & Welsch, R. E. (1980). Regression diagnostics: Identifying influential data and sources of collinearity. John Wiley & Sons. https://doi.org/10.1002/0471725153
- Akaike, H. (1974). A new look at the statistical model identification. IEEE Transactions on Automatic Control, 19(6), 716–723. https://doi.org/10.1109/TAC.1974.1100705
- Schwarz, G. (1978). Estimating the dimension of a model. The Annals of Statistics, 6(2), 461–464. https://doi.org/10.1214/aos/1176344136