Langsung ke isi
Lyra
Matematika ยท Kelas 11โ€“12 ยท Fase F ยท 8 menit baca UTBKTKA

Garis Best-Fit & Prediksi Regresi Linear

Setelah ini kamu bisa menyusun garis regresi linear, menafsirkan gradien dan koefisien korelasi, serta memprediksi dengan sadar batas ekstrapolasi.

Sebuah toko roti mencatat: makin lama mereka beriklan, makin banyak pelanggan yang datang. Apakah iklan benar-benar menyebabkan pelanggan membeli? Garis regresi membantu merangkum pola dua variabel jadi satu garis lurus, sementara koefisien korelasi mengukur seberapa erat hubungannya. Tetapi hati-hati โ€” garis yang pas bukan bukti sebab-akibat. Coba lihat sendiri di bawah.

Coba amati sebaran titik dan garis tren merah yang merangkum arah polanya.

Scatter plot: membaca arah pola

Sebelum menghitung apa pun, lihat dulu pola titik-titik data pada diagram pencar (scatter). Pola naik berarti kedua variabel bertambah bersama; pola turun berarti satu naik sementara yang lain turun; bila titik berjajar acak tanpa arah, hubungannya lemah.

Garis regresi linear (garis best-fit) adalah garis lurus y=a+bxy = a + bx yang paling dekat merangkum pola scatter, dihitung dengan metode kuadrat terkecil (least-squares).

Pada widget di atas, titik makin ke kanan makin ke atas โ€” pola naik yang kuat. Garis merah adalah garis terbaik yang menyusuri tengah kerumunan titik, dan nilai rr di pojok menunjukkan seberapa rapat titik menghimpit garis itu.

y=a+bxy = a + bx

Arti tiap simbol: yy = variabel tak bebas (respons), xx = variabel bebas, bb = gradien (perubahan yy tiap xx bertambah satu), aa = intersep (nilai yy saat x=0x = 0).

Garis tren manual: meminimalkan kuadrat galat

Bagaimana mesin tahu garis mana yang โ€œterbaikโ€? Kuncinya pada galat: jarak tegak tiap titik dari garis. Metode kuadrat terkecil menjumlahkan kuadrat semua galat, lalu memilih garis yang membuat jumlah itu sekecil mungkin.

Mengapa dikuadratkan? Supaya galat positif dan negatif tidak saling menghapus, sekaligus menghukum galat besar lebih keras. Inilah yang disebut kuadrat galat atau sum of squared errors (SSE).

Bayangkan kamu memasang karet elastis melintasi deretan paku. Tiap paku menarik karet ke arahnya, dan karet akhirnya beristirahat di posisi yang menyeimbangkan semua tarikan โ€” itulah garis best-fit. Makin rapat paku ke karet, makin kecil kuadrat galatnya.

Sekarang cobalah sendiri: geser gradien dan intersep garis manual di bawah, lalu perhatikan angka kuadrat galat. Bandingkan dengan tombol โ€œgaris terbaikโ€ untuk melihat apakah tebakanmu mendekati minimum.

Garis terbaik otomatis: rumus least-squares

Saat kamu menyerahkan pekerjaan ke mesin, ia menghitung dua angka pasti untuk gradien dan intersep. Gradien bb dirumuskan dari perbandingan kovarians terhadap sebaran xx; intersep aa kemudian menempatkan garis agar lewat di titik rata-rata (xห‰,yห‰)(\bar{x}, \bar{y}).

b=โˆ‘(xiโˆ’xห‰)(yiโˆ’yห‰)โˆ‘(xiโˆ’xห‰)2,a=yห‰โˆ’bโ€‰xห‰b = \frac{\sum (x_i - \bar{x})(y_i - \bar{y})}{\sum (x_i - \bar{x})^2}, \qquad a = \bar{y} - b\,\bar{x}

Arti tiap simbol: bb = gradien garis regresi, aa = intersep, xห‰\bar{x} dan yห‰\bar{y} = rata-rata xx dan yy, โˆ‘\sum = jumlahkan atas semua titik data.

Bandingkan garis otomatis di bawah dengan tebakanmu sebelumnya. Garis ini selalu melewati titik rata-rata data, dan kuadrat galatnya tak bisa dibuat lebih kecil oleh garis lurus lain.

Koefisien korelasi r: kuat vs lemah

Gradien hanya bicara arah dan curam; ia tidak memberi tahu seberapa erat titik menghimpit garis. Tugas itu dipegang koefisien korelasi Pearson rr, yang nilainya selalu di antara โˆ’1-1 dan 11. Nilai mendekati 11 artinya hubungan positif kuat (titik rapat naik); mendekati โˆ’1-1 artinya negatif kuat (titik rapat turun); mendekati 00 artinya hubungan lemah atau tak berpola.

Nilai rrArah polaKekuatan
Mendekati 11NaikKuat positif
Mendekati โˆ’1-1TurunKuat negatif
Mendekati 00Tak berpola jelasLemah

Pada widget di bawah, titik-titik berjajar acak tanpa arah โ€” rr mendekati nol dan garis tren hampir datar. Inilah ciri korelasi lemah: garis best-fit nyaris tak berarti.

Prediksi: interpolasi aman, ekstrapolasi berbahaya

Setelah garis regresi ada, kamu bisa memakainya memprediksi nilai yy untuk xx baru. Namun ada batas penting: memprediksi di dalam rentang data yang diamati disebut interpolasi dan relatif aman; sedangkan memprediksi di luar rentang data disebut ekstrapolasi dan berbahaya, karena pola linear di luar rentang belum tentu berlaku.

Misalnya, garis โ€œjam belajar vs nilaiโ€ mungkin meramal nilai 95 untuk 10 jam belajar. Tetapi meramal nilai 200 untuk 100 jam belajar jelas konyol โ€” ada batas maksimal nilai. Di luar rentang data, asumsi linear gampang runtuh.

Soal regresi di UTBK dan TKA sering menjebak di dua titik: menafsirkan gradien (bukan mengira rr) dan memperingatkan ekstrapolasi. Kerangka TKA (Peraturan Ka. BSKAP 045/H/AN/2025) memasukkan analisis data sebagai cakupan resmi. Bila soal bertanya prediksi untuk xx jauh di luar data, jawaban yang benar biasanya โ€œtidak dapat dipercayaโ€ atau โ€œperlu data tambahanโ€.

Pada widget di bawah, titik hijau menandai prediksi untuk x=10x = 10 โ€” jauh di luar rentang data yang diamati (1 sampai 4). Garis peringatan muncul menandai zona ekstrapolasi.

Korelasi kuat belum tentu sebab-akibat

Inilah jebakan paling licik: nilai rr mendekati 11 hanya membuktikan dua variabel bergerak bersama, bukan bahwa satu menyebabkan yang lain. Banyak pasangan variabel memiliki korelasi tinggi tanpa hubungan sebab-akibat โ€” disebut korelasi semu (spurious). Penjual es krim dan kasus tenggelam naik bersama di musim panas, tapi es krim tidak menyebabkan orang tenggelam; keduanya dipengaruhi faktor ketiga (cuaca panas).

Di bawah ini dua variabel memiliki korelasi sangat kuat (rr mendekati 11), namun secara logis tidak saling menyebabkan. Garis regresi tetap terlihat rapi โ€” itulah mengapa grafik saja tidak cukup untuk membuktikan kausalitas.

Coba dulu di kertas, baru buka.

Soal. Data lima siswa membandingkan lama belajar (jam, xx) dengan nilai ulangan (yy): (1,50),(2,58),(3,65),(4,70),(5,82)(1, 50), (2, 58), (3, 65), (4, 70), (5, 82). Tentukan garis regresi linear, lalu perkirakan nilai siswa yang belajar 3,5 jam.

Jumlah x=15x = 15, jadi xห‰=155=3\bar{x} = \dfrac{15}{5} = 3. Jumlah y=325y = 325, jadi yห‰=3255=65\bar{y} = \dfrac{325}{5} = 65.

Dengan rumus b=โˆ‘(xiโˆ’xห‰)(yiโˆ’yห‰)โˆ‘(xiโˆ’xห‰)2b = \dfrac{\sum (x_i - \bar{x})(y_i - \bar{y})}{\sum (x_i - \bar{x})^2}, perhitungan memberi pembilang 4646 dan penyebut 1010, sehingga b=4610=4,6b = \dfrac{46}{10} = 4,6.

a=yห‰โˆ’bโ€‰xห‰=65โˆ’4,6ร—3=65โˆ’13,8=51,2a = \bar{y} - b\,\bar{x} = 65 - 4,6 \times 3 = 65 - 13,8 = 51,2. Garis regresinya: y=51,2+4,6xy = 51,2 + 4,6x.

Substitusi x=3,5x = 3,5: y=51,2+4,6(3,5)=51,2+16,1=67,3y = 51,2 + 4,6(3,5) = 51,2 + 16,1 = 67,3. Karena 3,5 berada di dalam rentang data (1-5), ini interpolasi yang relatif aman.

Jebakan: menyamakan gradien bb dengan koefisien korelasi rr. Yang benar: gradien bicara seberapa curam garis berubah, sedangkan rr bicara seberapa erat titik menghimpit garis โ€” dua hal berbeda yang dihitung terpisah.

Jebakan: menyimpulkan sebab-akibat hanya dari nilai rr yang tinggi. Yang benar: korelasi tinggi hanya membuktikan dua variabel bergerak bersama; sebab-akibat butuh alasan logis atau uji terkontrol, bukan sekadar grafik rapi.

Jebakan: memakai garis regresi meramal jauh di luar rentang data tanpa peringatan. Yang benar: ekstrapolasi berbahaya karena asumsi linear belum tentu berlaku di luar rentang yang diamati โ€” sebut selalu batas itu saat memprediksi.

  • Garis regresi linear y=a+bxy = a + bx merangkum pola scatter dengan metode kuadrat terkecil.
  • Gradien bb adalah perubahan yy tiap xx bertambah satu; intersep aa = nilai yy saat x=0x = 0.
  • Garis best-fit meminimalkan kuadrat galat dan selalu melewati titik rata-rata data.
  • Koefisien rโˆˆ[โˆ’1,1]r \in [-1, 1]: mendekati ยฑ1\pm 1 kuat, mendekati 00 lemah; tanda menunjukkan arah pola.
  • Interpolasi aman; ekstrapolasi berbahaya. Korelasi kuat bukan bukti sebab-akibat.