Lewati ke konten utama
CalcMax

Kalkulator Uji t

Minimum: 0

Minimum: 2

Minimum: 0

Minimum: 2

Hasil

1,0000

Statistik t

Nilai p
34,6594%
Derajat kebebasan
8
Galat baku
1,0000

Kalkulator uji t ini menjalankan uji rata-rata yang paling umum: ia mengubah rata-rata sampel, simpangan baku, dan ukuran sampel menjadi statistik t, nilai p, serta derajat kebebasan yang dipakai untuk membaca keduanya. Mode satu sampel membandingkan sebuah rata-rata dengan nilai tetap — sebuah target, sebuah spesifikasi, sebuah rata-rata historis. Mode dua sampel membandingkan dua kelompok satu sama lain, dan versi yang diterapkan di sini adalah uji t dua sampel dengan varians gabungan, yang mengandaikan kedua kelompoknya berbagi satu varians: kedua simpangan bakunya dirata-ratakan dengan bobot n − 1, dan satu varians gabungan itulah yang menggerakkan galat bakunya. Alternatifnya, uji Welch, melepaskan andaian kesamaan varians dan lebih aman dipakai ketika kelompoknya berbeda ukuran dan sebarannya, tetapi derajat kebebasannya keluar berupa pecahan dan perhitungannya berada di tempat lain di dalam kodenya; halaman ini mengerjakan uji dengan varians yang sama dan mengatakannya alih-alih menghampirinya diam-diam. Kolom masukan yang tidak dipakai oleh mode pilihan Anda boleh dibiarkan apa adanya, karena isinya tidak memengaruhi hasilnya. Nilai p-nya adalah luas ekor distribusi t di luar statistiknya, dan dicetak sebagai persentase.

Rumus

t = (x̄ − μ₀) / (s / √n) t = (x̄₁ − x̄₂) / √(s_p²(1/n₁ + 1/n₂)) s_p² = ((n₁−1)s₁² + (n₂−1)s₂²) / (n₁ + n₂ − 2)

t
Statistik uji — seberapa banyak satuan galat baku jarak rata-rata yang teramati dari nilai yang diuji. Tandanya membawa arah, dan itulah sebabnya uji satu ekor yang salah arah mengembalikan nilai p yang besar alih-alih galat: t sebesar −1 terhadap alternatif lebih besar bukan pengaruh yang kecil, melainkan bukti yang menunjuk ke arah sebaliknya, dan luas ekornya mengatakan hal itu
x̄, μ₀
Rata-rata sampel dan nilai yang diujikan terhadapnya, pada mode satu sampel. Pembilangnya adalah selisih keduanya, jadi statistiknya mengukur jarak dalam satuan datanya — selisih yang sama jauh kurang berarti kalau sebarannya lebar atau sampelnya kecil, dan itulah yang dipasok oleh penyebutnya
s
Simpangan baku sampel, diestimasi dari datanya dan bukan diketahui sebelumnya. Estimasi itulah seluruh alasan distribusi t dipakai sebagai ganti distribusi normal: ketidakpastian tambahan yang ditimbulkannya membuat ekornya lebih berat, dan ekor yang lebih berat itulah yang diperhitungkan oleh nilai kritis t. Nilainya harus lebih besar daripada nol — sampel tanpa variasi tidak punya penyebut untuk dibagi
n
Ukuran sampelnya, yang memberi n − 1 derajat kebebasan pada mode satu sampel. Untuk uji dua sampel, kedua ukurannya berjumlah satu lebih banyak daripada salah satunya saja: n₁ + n₂ − 2, karena varians gabungannya membelanjakan satu derajat kebebasan pada rata-rata masing-masing kelompok sebelum mengukur sebaran di sekitarnya
s_p²
Varians gabungan — rata-rata berbobot dari varians kedua kelompoknya, masing-masing dibobot oleh derajat kebebasannya sendiri. Di sinilah andaian kesamaan varians masuk: kedua kelompoknya diperlakukan sebagai dua sampel dari satu sebaran populasi, sehingga kelompok yang pengamatannya lebih banyak, atau yang variansnya sendiri lebih kecil, menyumbang secara proporsional pada satu estimasi bersama. Kalau kedua variansnya berbeda cukup jauh, penggabungan itulah yang salah, dan uji Welch adalah perbaikannya
p-value
Peluang memperoleh statistik yang setidaknya sejauh ini dari nol, ke arah yang ditanyakan ujinya, seandainya kedua rata-ratanya memang sama. Dua ekor menggandakan luas di luar |t|; alternatif lebih besar dan lebih kecil masing-masing mengambil satu ekor. Di sini ia dilaporkan sebagai persentase, jadi 5% adalah 0,05 yang akrab, dan ia pernyataan tentang datanya dengan syarat hipotesisnya, bukan tentang hipotesisnya dengan syarat datanya

Pakai kalkulator ini ketika Anda punya rata-rata dan simpangan baku dari sebuah sampel dan ingin tahu apakah selisihnya dari sebuah target, atau dari kelompok lain, lebih besar daripada yang bisa dijelaskan oleh derau pengambilan sampel. Mode satu sampel menangani kasus ketika nilai pembandingnya adalah angka tetap — mesin yang disetel untuk mengisi 500 gram, spesifikasi 5 mm, rata-rata tahun lalu — sedangkan mode dua sampel menangani kasus ketika kedua besarannya diukur dan tidak ada yang diistimewakan. Dua hal layak diputuskan sebelum membaca jawabannya. Yang pertama adalah satu ekor atau dua: uji dua ekor menanyakan apakah kedua kelompoknya berbeda ke arah mana pun dan merupakan nilai bawaan yang tepat, sementara uji satu ekor menanyakan pertanyaan yang berarah dan sebaiknya dipilih karena arahnya sudah ditetapkan di muka, bukan karena jawabannya akan lebih menguntungkan. Yang kedua adalah andaian kesamaan varians, yang dibuat oleh mode dua sampel dan tidak bisa diperiksa untuk Anda. Tandanya ada di panel: kalau kedua simpangan baku yang Anda ketik berdekatan, menggabungkannya hampir tidak berbiaya, dan kalau keduanya berbeda dengan faktor dua atau lebih, uji Welch-lah yang Anda inginkan. Halaman ini mengerjakan uji dengan varians gabungan, yaitu yang dimaksud oleh sebagian besar buku teks dan sebagian besar statistikawan ketika mereka menyebut uji t pada kasus varians yang sama, dan ia melaporkan kedua simpangan baku yang Anda masukkan supaya andaiannya bisa dinilai alih-alih diandaikan.

Contoh hitungan

  1. Nilai bawaan: rata-rata sampel 6 terhadap target 5

    1. Galat baku: s / √n = 3 / 3 = 1
    2. Statistik t: (6 − 5) / 1 = 1 — rata-rata sampelnya berada satu galat baku di atas targetnya
    3. Derajat kebebasan: n − 1 = 8
    4. Nilai p dua ekor: luas di luar ±1 pada distribusi t dengan 8 derajat kebebasan, yaitu 34,66%

    Selisih satu satuan penuh terdengar besar sampai galat bakunya diletakkan di sebelahnya: satu galat baku masih jauh di dalam rentang yang dihasilkan derau pengambilan sampel, dan nilai p-nya mengatakan hal itu. Perbandingan dengan kurva normalnya mengajar juga — t sebesar 1 yang sama akan memberi 31,7% seandainya distribusinya normal, dan tiga poin tambahannya adalah harga karena simpangan bakunya diestimasi dari sembilan pengamatan alih-alih diketahui.

  2. Statistik t 2,306 memberi tepat 5%

    1. Galat baku: 3 / √9 = 1, jadi statistik t-nya adalah rata-ratanya sendiri
    2. Statistik t: (2,306 − 0) / 1 = 2,306
    3. Batas t dua ekor pada 95% dengan 8 derajat kebebasan adalah 2,306
    4. Berada tepat di batasnya berarti nilai p dua ekornya tepat 5%

    Ini pasangan yang dihasilkan halaman nilai kritis dari arah sebaliknya, dan menaruh keduanya berdampingan adalah peragaan paling jelas bahwa keduanya adalah satu fakta yang dibaca dari dua ujung. Mintalah batas t dua ekor pada 95% dengan 8 derajat kebebasan di halaman itu dan ia mengembalikan 2,306; masukkan 2,306 ke halaman ini dan nilai p-nya keluar tepat 5%. Tidak ada yang dibulatkan di antaranya — angkanya dipilih karena simpangan baku 3 dan ukuran sampel 9 membuat galat bakunya tepat 1, sehingga statistiknya dan batasnya adalah angka yang sama. Statistik yang sedikit di bawahnya akan mendarat di atas 5%, dan yang sedikit di atasnya di bawah 5%.

  3. Dua kelompok berisi sepuluh dengan sebaran yang sama

    1. Varians gabungan: ((9 × 4) + (9 × 4)) / 18 = 72 / 18 = 4, jadi simpangan baku gabungannya 2
    2. Galat baku: √(4 × (1/10 + 1/10)) = √0,8 = 0,8944
    3. Statistik t: (5 − 4) / 0,8944 = 1,118
    4. Derajat kebebasan: 10 + 10 − 2 = 18, yang memberi nilai p dua ekor 27,83%

    Ketika kedua variansnya sama, penggabungannya tidak mengubah apa pun — varians gabungannya keluar 4, tepat nilai yang dipasok kedua kelompoknya — dan galat bakunya lebih kecil daripada simpangan baku masing-masing kelompok dibagi √n-nya sendiri. Membandingkan dua rata-rata berisi sepuluh pengamatan lebih tidak presisi daripada mengestimasi satu rata-rata berisi sepuluh pengamatan — galat baku 0,8944 melawan 0,6325 — karena ada dua besaran yang tidak pasti yang sedang dikurangkan alih-alih satu yang sedang diukur, dan biaya itu baru layak dibayar ketika perbandingannya menjawab pertanyaan yang tidak bisa dijawab satu sampel. Perhatikan bahwa kolom rata-rata populasinya ada di layar dan tidak terpakai pada mode ini; kedua besarannya diukur, jadi tidak ada yang menjadi target tetap.

  4. Sebaran dan ukuran yang tidak sama, tempat penggabungannya harus diawasi

    1. Varians gabungan: ((9 × 4,41) + (11 × 3,24)) / 20 = (39,69 + 35,64) / 20 = 3,7665
    2. Galat baku: √(3,7665 × (1/10 + 1/12)) = √0,6905 = 0,831
    3. Statistik t: (5,2 − 4,1) / 0,831 = 1,3237
    4. Derajat kebebasan: 10 + 12 − 2 = 20

    Varians gabungannya 3,7665, dan itu bukan titik tengah antara 4,41 dan 3,24 — kelompok berisi dua belas orang dibobot lebih berat karena ia menyumbang sebelas derajat kebebasan sementara kelompok sepuluh orang hanya menyumbang sembilan. Pembobotan itulah seluruh isi kata gabungan, dan itulah sebabnya jawabannya tidak bisa direproduksi dengan merata-ratakan kedua simpangan bakunya. Kedua sebaran di sini cukup berdekatan sehingga andaian kesamaan variansnya nyaman; pasangan seperti 2,1 dan 0,6 dengan ukuran kelompok ini tidak akan nyaman, dan uji Welch akan memberi nilai p yang terlihat berbeda.

  5. t sebesar 1,96 dari 900 pengamatan, tempat t dan z sudah bertemu

    1. Galat baku: 3 / √900 = 3 / 30 = 0,1
    2. Statistik t: (5,196 − 5) / 0,1 = 1,96
    3. Derajat kebebasan: 899
    4. Nilai p dua ekor: 5,0304% — sedikit di atas 5, bukan tepat di 5

    Angka terkenal 1,96 memberi 5% pada kurva normal dan 5,0304% di sini, dan jarak itulah inti contohnya. Dengan 899 derajat kebebasan distribusi t nyaris tidak bisa dibedakan dari normal, tetapi tidak persis — ekornya masih sedikit lebih berat, jadi statistik yang sama berada sedikit lebih jauh. Itu juga sebabnya t sebesar 1,96 tidak otomatis signifikan pada taraf 5% dalam sampel besar, dan sebabnya perangkat lunak yang melaporkan 0,0499 dan perangkat lunak yang melaporkan 0,0501 bisa berbeda pendapat tentang penelitian yang sama pada angka desimal ketiga.

Batasan

Mode dua sampel mengandaikan kedua kelompoknya berbagi satu varians, dan andaian itu benar-benar bekerja dan bukan sekadar merapikan notasi. Ketika ukuran kelompoknya sama, uji gabungan ini cukup tegar meski variansnya berbeda, tetapi ketika ukurannya tidak sama dan variansnya juga berbeda, ujinya bisa salah cukup parah ke arah mana pun — inilah masalah Behrens–Fisher, dan uji Welch ada untuk menyelesaikannya. Kedua simpangan bakunya ada di panel karena alasan itu: bandingkan keduanya sebelum mempercayai nilai p-nya, dan kalau yang satu lebih dari kira-kira dua kali yang lain sementara ukuran kelompoknya berbeda, uji kesamaan varians bukanlah uji yang Anda inginkan. Mode satu sampel tidak punya persoalan itu tetapi mengandaikan pengamatan saling bebas, dan andaian itu runtuh pada pengukuran berulang atas satu subjek serta pada data berpasangan atau berkelompok, yang menuntut model berpasangan atau model campuran. Kedua mode mengandaikan datanya kurang lebih normal, dan keduanya menjadi kurang peka terhadap andaian itu seiring sampelnya membesar — teorema limit pusat itulah yang membuat uji t atas 900 pengamatan yang miring menjadi wajar dan uji t atas 9 pengamatan yang miring menjadi patut dipertanyakan. Terakhir, halaman ini melaporkan statistik dan nilai p tanpa kesimpulan apa pun. Ia tidak punya taraf signifikansi untuk dibandingkan, dan angka 0,05 adalah kesepakatan yang lazim dan bukan sebuah hasil, jadi keputusannya dikembalikan ke tempat yang seharusnya.

Pertanyaan yang sering diajukan

Apakah halaman ini memakai uji t dua sampel gabungan atau uji Welch?
Yang gabungan — uji kesamaan varians, dengan n₁ + n₂ − 2 derajat kebebasan. Uji Welch adalah pilihan yang lebih baik ketika kedua kelompoknya berbeda sebaran dan berbeda ukuran, dan kedua kolom simpangan bakunya ada di panel justru supaya Anda bisa memeriksanya: kalau yang satu lebih dari kira-kira dua kali yang lain sementara ukuran sampelnya berbeda, Welch-lah yang Anda inginkan dan halaman ini akan memberi nilai p yang meleset, kadang cukup jauh. Versi kesamaan varians diterapkan di sini karena itulah uji yang ada di buku teks, karena itulah yang disebut buku rujukan sebagai uji t dua sampel untuk rata-rata yang sama, dan karena derajat kebebasannya bilangan bulat sehingga aritmetika di halaman ini tetap eksak alih-alih dihampiri.
Sebaiknya saya memakai uji satu ekor atau dua ekor?
Dua ekor kecuali arahnya sudah ditetapkan sebelum datanya dilihat. Uji dua ekor menanyakan apakah kedua kelompoknya berbeda sama sekali dan membagi taraf signifikansinya ke kedua ujungnya; uji satu ekor menanyakan apakah salah satu kelompoknya lebih besar dan menaruh seluruh tarafnya di ekor itu, sehingga lebih mudah mencapai signifikansi — tepat dua kali lebih mudah pada taraf yang sama, karena 1,96 menjadi 1,645. Itu pilihan yang sah ketika pertanyaannya memang berarah, dan merupakan salah satu bentuk mengejar hasil ketika arahnya dipilih setelah melihat ke mana selisihnya bergerak.
Apa bedanya statistik t dengan nilai p?
Statistik t mengukur selisihnya dalam satuan galat baku dan membawa ukuran sampelnya di dalamnya, sedangkan nilai p mengubah angka itu menjadi peluang dengan memakai distribusi t pada derajat kebebasan yang sesuai. Jadi t menjawab "berapa galat baku jarak keduanya?" dan nilai p menjawab "seberapa sering pengambilan sampel semata akan menghasilkan jarak sebesar ini?" Keduanya dilaporkan karena yang pertama bisa dibandingkan antarpenelitian dengan rancangan yang sama dan yang kedua adalah yang dibandingkan dengan taraf signifikansi. Tidak ada dari keduanya yang merupakan ukuran besarnya pengaruh — sampel yang besar bisa membuat perbedaan sepele menghasilkan t yang besar dan nilai p yang sangat kecil.
Mengapa statistik t 1,96 tidak memberi tepat 5%?
Karena 1,96 adalah batas 5% pada kurva normal, sedangkan distribusi t sedikit lebih berat ekornya pada derajat kebebasan berhingga berapa pun. Dengan 899 derajat kebebasan, t sebesar 1,96 memberi 5,0304%, sedikit di atas garisnya; pada 8 derajat kebebasan statistik yang sama memberi 8,57%. Distribusi t memusat ke normal seiring derajat kebebasannya bertambah, dan kurvanya adalah kurva yang sama sepanjang itu — hanya bobot ekornya yang berubah. Itulah sebabnya perangkat lunak bisa melaporkan nilai p 0,0499 di tempat hitungan tangan terhadap 1,96 menyatakan signifikan, dan tidak ada yang salah dari keduanya.
Apa arti statistik t yang negatif?
Bahwa rata-rata sampelnya keluar di bawah nilai yang diujikan, atau di bawah rata-rata kelompok kedua pada mode dua sampel. Tandanya adalah informasi arah dan tidak lebih — besar relatifnya terhadap distribusinya itulah yang dipakai menghitung nilai p-nya. Pada uji dua ekor tandanya dibuang karena kedua ujungnya sama-sama dihitung. Pada uji satu ekor ia penting dan bisa informatif: t sebesar −2,5 terhadap alternatif lebih besar memberi nilai p mendekati 99%, dan itu bukan hasil nul melainkan bukti yang menunjuk ke arah sebaliknya, dan melaporkannya sebagai "tidak signifikan" akan membuang informasi itu.
Berapa banyak pengamatan yang saya butuhkan untuk uji t?
Halaman ini menuntut sekurang-kurangnya dua per kelompok, karena simpangan baku dari satu pengamatan tidak terdefinisi. Itu lantai matematis dan bukan anjuran praktis — uji t atas dua pengamatan per kelompok hanya punya satu derajat kebebasan dan nyaris tidak berdaya mendeteksi apa pun selain perbedaan yang sangat besar, dan nilai p-nya akan besar kecuali kedua kelompoknya hampir tidak bertumpang tindih. Pertanyaan yang berguna bukanlah batas minimum yang diizinkan rumusnya, melainkan ukuran sampel yang diperlukan untuk mendeteksi perbedaan yang Anda pedulikan, dan itu bergantung pada sebaran datanya serta besarnya pengaruh yang ingin Anda sadari; halaman ukuran sampel adalah tempat perhitungan itu berada, dan halaman itu bekerja mundur dari sebuah margin galat alih-alih maju dari sebuah kumpulan data.
Di mana tabel nilai kritis t?
Di halaman nilai kritis, dan hanya di sana dalam kumpulan ini — halaman ini tidak mencetaknya karena tabel itu harus diindeks oleh derajat kebebasan sekaligus oleh taraf signifikansi, yang berarti satu halaman buku untuk setiap taraf dan bukan sebuah tabel. Itu juga sebabnya jawabannya dihitung di sini alih-alih dicari: tabel hanya bisa memuat derajat kebebasan yang dipilih seseorang untuk dicetak, dan derajat kebebasan yang dihasilkan uji dua sampel, n₁ + n₂ − 2, hampir tidak pernah termasuk di antaranya. Satu batas yang layak diingat adalah bahwa nilai t memusat ke 1,96 seiring sampelnya membesar, jadi tabel yang Anda cari adalah tabel normal dengan denda yang menyusut seiring derajat kebebasannya bertambah.

Referensi

Kalkulator terkait