Yang Diuji Normal Itu Residual Regresi, Bukan Variabelnya
Asumsi normalitas regresi berlaku pada residual, bukan pada variabel X dan Y. Dua jalur SPSS yang hasilnya bisa beda kesimpulan di data yang sama.
Di halaman ini
- Dari mana salah kaprahnya berasal
- Dua jalur SPSS bersebelahan
- Kenapa variabel bebas tidak perlu normal
- Cara menyimpan residual dan mengujinya
- Apa yang sebenarnya rusak kalau residual tidak normal
- Kesalahan yang sering terjadi
- FAQ
- Jadi variabel Y saya yang tidak normal itu masalah atau tidak?
- Kalau uji normalitas variabel sudah ditulis di bab tiga, perlu dihapus?
- Residual mana yang diuji, yang unstandardized atau yang standardized?
- Untuk regresi sederhana dengan satu X, aturannya sama?
- Uji normalitasnya pakai Shapiro-Wilk atau Kolmogorov-Smirnov?
- Setelah normalitas, asumsi apa lagi yang harus diuji?
Asumsi normalitas dalam regresi linear berlaku untuk residual, bukan untuk variabel X atau Y satu per satu. Keduanya sering ditukar karena jalur klik di tutorial yang paling banyak ditonton memang mengarahkan kamu memasukkan variabel ke kotak Dependent List pada menu Explore. Hasilnya bisa membalik kesimpulan di data yang sama: variabel pendapatan yang menceng ke kanan ditolak Shapiro-Wilk, sementara residual dari regresi yang memakai variabel itu lolos tanpa masalah.
Dari mana salah kaprahnya berasal
Jalur yang paling mudah diingat adalah Analyze, lalu Descriptive Statistics, lalu Explore. Kotak Dependent List ada di depan mata, nama variabelmu ada di daftar sebelah kiri, dan satu klik Plots dengan centang Normality plots with tests sudah mengeluarkan tabel Tests of Normality.
Tabelnya rapi, angkanya keluar, dan tidak ada apa pun di layar yang memberi tahu bahwa kamu baru saja menguji benda yang salah. Di situ letak masalahnya. SPSS mengerjakan persis apa yang kamu minta, yaitu menguji distribusi variabel yang kamu taruh di kotak itu, dan asumsi regresi tidak pernah berbicara soal distribusi itu.
Kesalahan ini menular cepat karena outputnya enak dilihat. Satu tabel, dua baris, dua nilai Sig. Sementara jalur yang benar butuh satu langkah tambahan yang tidak kelihatan di menu mana pun, yaitu menyimpan residual dulu sebagai variabel baru.
Dua jalur SPSS bersebelahan
| Jalur | Yang diuji | Statusnya bagi asumsi regresi |
|---|---|---|
| Explore dengan X dan Y di Dependent List | distribusi tiap variabel secara terpisah | tidak relevan, bukan asumsi regresi |
| Regression, Save, Unstandardized residual, lalu Explore pada variabel baru itu | distribusi galat model | inilah asumsi yang dimaksud |
| Regression, Plots, Normal P-P plot of regression standardized residual | distribusi galat model, versi grafik | relevan, tapi hanya visual |
Baris ketiga penting untuk disadari. Grafik P-P plot yang muncul dari dalam menu Regression memang sudah memakai residual, bukan variabel. Jadi banyak skripsi sebenarnya memuat satu bukti yang benar di satu halaman dan satu bukti yang salah sasaran di halaman sebelumnya, keduanya diberi judul uji normalitas, dan ketika hasilnya saling bertabrakan tidak ada yang tahu harus memilih yang mana.
Hasil yang berbeda di data yang sama bukan kebetulan, itu akibat yang bisa diperkirakan. Variabel seperti pendapatan, aset perusahaan, lama bekerja, atau jumlah pengikut hampir selalu menceng ke kanan karena bentuk sebarannya di populasi memang begitu. Kemencengan itu masuk ke model sebagai informasi, bukan sebagai gangguan. Residual mengukur sisa yang tidak bisa dijelaskan model, dan sisa itu bisa simetris dan rapi meski bahan bakunya tidak.
Kenapa variabel bebas tidak perlu normal
Ada satu contoh yang menyelesaikan perdebatan ini dalam satu kalimat: variabel dummy.
Jenis kelamin dikode 0 dan 1. Sebarannya dua tiang, tidak ada ekor, tidak ada puncak di tengah, dan tidak akan pernah lolos uji normalitas pada ukuran sampel apa pun. Variabel dummy dipakai di ribuan regresi setiap hari dan tidak seorang pun menyebutnya pelanggaran asumsi. Kalau normalitas X benar-benar sebuah syarat, seluruh regresi dengan variabel kategorik harus dibatalkan.
Alasannya ada pada cara metode kuadrat terkecil bekerja. Nilai X diperlakukan sebagai sesuatu yang diketahui dan tetap, bukan sebagai hasil undian dari sebuah distribusi. Yang diundi adalah galat, yaitu bagian Y yang tidak bisa diramal dari X. Semua sifat baik penaksir kuadrat terkecil, termasuk tidak biasnya, berbicara tentang perilaku galat itu. Distribusi X tidak masuk ke dalam daftar syarat sama sekali.
Variabel terikat pun sebenarnya tidak disyaratkan normal secara mentah. Yang diminta normal adalah Y setelah pengaruh X dikeluarkan, dan itu definisi lain dari residual.
Cara menyimpan residual dan mengujinya
Lima langkah, sekali jalan.
- Buka Analyze, Regression, Linear. Masukkan variabel terikat ke Dependent dan seluruh variabel bebas ke Independent(s). Pastikan susunan modelnya sudah final, karena residual yang disimpan hanya berlaku untuk model itu.
- Klik tombol Save. Pada kotak Residuals, centang Unstandardized. Kalau kamu juga ingin menyaring kasus bermasalah, centang Cook's di kotak Distances.
- Klik Continue lalu OK. Di Data View akan muncul kolom baru bernama RES_1 di ujung kanan. Itu residual per responden.
- Buka Analyze, Descriptive Statistics, Explore. Masukkan RES_1 ke Dependent List, klik Plots, centang Normality plots with tests, lalu OK.
- Baca tabel Tests of Normality pada baris RES_1. Kalau Sig. di atas 0,05, residualmu tidak berbeda nyata dari normal.
Satu hal yang gampang terlewat: tiap kali kamu mengubah model, misalnya menambah variabel kontrol atau membuang satu variabel yang tidak signifikan, RES_1 yang lama jadi usang. Jalankan ulang langkah 1 sampai 3, dan SPSS akan membuat RES_2. Menguji RES_1 untuk model yang sudah berubah adalah kesalahan yang sulit terdeteksi karena outputnya tetap keluar dengan rapi.
Apa yang sebenarnya rusak kalau residual tidak normal
Bagian ini jarang ditulis, padahal menentukan seberapa panik kamu seharusnya.
Taksiran koefisien tetap tidak bias meski residual tidak normal. Angka b di tabel Coefficients tidak kehilangan maknanya. Yang bergantung pada asumsi normalitas adalah pengujiannya, yaitu nilai t, nilai F, nilai Sig., dan selang kepercayaan. Semua itu dihitung dengan mengandaikan bentuk sebaran tertentu, dan kalau andaian itu jauh dari kenyataan, nilai p-nya bisa terlalu optimis atau terlalu pesimis.
Beratnya akibat bergantung pada ukuran sampel. Pada sampel kecil, bentuk sebaran galat sangat menentukan. Pada sampel besar, sebaran penaksir cenderung mendekati normal walau galatnya tidak, sehingga pelanggaran ringan tidak banyak mengubah kesimpulan. Karena itu menolak seluruh model gara-gara Sig. normalitas 0,03 pada 250 responden biasanya reaksi yang berlebihan. Langkah lanjutannya dibahas di data tidak normal, transformasi atau ganti uji.
Selang prediksi untuk satu kasus individu adalah pengecualian. Yang ini tetap bergantung penuh pada bentuk sebaran galat berapa pun besar sampelmu, jadi kalau skripsimu memang meramal nilai untuk satu unit tertentu, normalitas residual kembali menjadi serius.
Kesalahan yang sering terjadi
- Menguji X dan Y di Explore lalu melaporkannya sebagai uji normalitas regresi.
- Menguji residual terstandar (ZRE_1) dengan uji satu sampel yang membandingkannya terhadap distribusi normal baku. Nilai tengah dan sebaran residual terstandar memang sudah dipaksa mendekati nol dan satu, jadi uji semacam itu cenderung selalu lolos dan tidak membuktikan apa pun.
- Membuang responden yang residualnya besar supaya tabel normalitas berubah hijau, tanpa alasan substantif.
- Menguji normalitas setiap variabel satu per satu lalu mentransformasi variabel yang gagal, padahal residual model aslinya sudah normal. Transformasi itu mengubah arti koefisien tanpa manfaat apa pun.
- Memakai RES_1 dari model lama setelah susunan variabelnya direvisi.
- Melaporkan histogram residual sebagai bukti tunggal. Bentuk histogram sangat bergantung pada lebar kelas, dan pada 40 responden hampir semua histogram terlihat tidak rapi.
FAQ
Jadi variabel Y saya yang tidak normal itu masalah atau tidak?
Bukan masalah selama residual modelmu normal. Kemencengan Y sering sudah terjelaskan oleh X, dan yang tersisa justru simetris. Uji residualnya dulu sebelum mengambil kesimpulan apa pun soal Y.
Kalau uji normalitas variabel sudah ditulis di bab tiga, perlu dihapus?
Tidak harus dihapus kalau format kampus memintanya, tapi beri label yang jujur, misalnya deskripsi sebaran variabel penelitian. Yang penting uji normalitas residual tetap ada dan itulah yang dirujuk saat kamu menyatakan asumsi terpenuhi.
Residual mana yang diuji, yang unstandardized atau yang standardized?
Pakai yang unstandardized. Residual terstandar adalah residual yang sama setelah dibagi simpangan baku, jadi bentuk sebarannya identik, namun uji yang membandingkannya terhadap normal baku jadi tidak informatif.
Untuk regresi sederhana dengan satu X, aturannya sama?
Sama. Jumlah variabel bebas tidak mengubah asumsinya, yang diuji tetap residual. Yang berubah hanya derajat kebebasan untuk uji t, dan cara menghitungnya ada di menentukan r tabel dan t tabel.
Uji normalitasnya pakai Shapiro-Wilk atau Kolmogorov-Smirnov?
Keduanya muncul di tabel yang sama dan sering memberi kesimpulan sama. Kalau berbeda, pilihan dan alasannya dibahas di Shapiro-Wilk atau Kolmogorov-Smirnov.
Setelah normalitas, asumsi apa lagi yang harus diuji?
Linearitas, heteroskedastisitas, multikolinearitas, dan autokorelasi untuk data berurutan waktu. Urutan pengerjaan dan tindakan kalau salah satu gagal ada di uji asumsi klasik dan apa yang dilakukan kalau gagal.
Artikel Terkait
Siap taklukkan UTS, UAS, dan skripsi?
Gabung gratis di Pintarly. Ubah catatan kuliahmu jadi rangkuman, flashcards, dan kuis otomatis, plus AI tutor yang siap bantu kapan aja butuh.
