16 Hipotez Testlerine Giriş
Aralık tahmininde bir parametrenin hangi değerler arasında olabileceğini sorduk (Ortalama İçin Aralık Tahmini). Çoğu zaman ise soru bir evet–hayır sorusudur: Dolum makinesi paketleri eksik mi dolduruyor? Yeni gübre fidelerin boyunu artırıyor mu? Tabletlerdeki etken madde miktarı etikette yazana uyuyor mu? Hipotez testi, bir örneklemden elde edilen bilgiyle böyle bir iddiayı kabul etmek ya da reddetmek için kurulmuş bir karar kuralıdır. Örneklem rastgele olduğundan her kararın bir yanılma payı vardır; bu bölümde bu payı nasıl ölçüp denetim altında tuttuğumuzu göreceğiz.
16.1 Hipotezler
Her test, kitle hakkında birbirine rakip iki iddia arasında seçim yapar. Önce bu iddiaları adlandıralım.
Tanım 16.1 (İstatistiksel Hipotez) Bir kitlenin dağılımı ya da bu dağılımın parametreleri hakkında ileri sürülen bir iddiaya istatistiksel hipotez denir.
Yani hipotez, doğruluğunu kesin olarak bilmediğimiz ve örneklemle sınayacağımız bir önermedir. “Paketlerin ortalama ağırlığı \(500\) gramdır”, “kitle normal dağılımlıdır” birer hipotezdir.
Tanım 16.2 (Basit Hipotez) Kitlenin dağılımını tümüyle belirleyen hipoteze basit hipotez denir.
Tanım 16.3 (Bileşik Hipotez) Basit olmayan, yani kitlenin dağılımını birden fazla olasılığa açık bırakan hipoteze bileşik hipotez denir.
Yani kitlenin \(N(\mu, \sigma^2)\) dağılımlı ve \(\sigma\)’nın bilindiğini varsayalım. \(\mu = 50\) hipotezi dağılımı \(N(50, \sigma^2)\) olarak tek türlü belirler; basittir. \(\mu > 50\) ise sonsuz sayıda dağılıma izin verir; bileşiktir. \(\sigma\) bilinmiyorsa \(\mu = 50\) bile bileşiktir, çünkü varyans açıkta kalır.
Tanım 16.4 (Sıfır Hipotezi ve Karşı Hipotez) Test edilen, reddedilmediği sürece doğru kabul edilen hipoteze sıfır hipotezi denir ve \(H_0\) ile gösterilir. \(H_0\) reddedildiğinde kabul edilecek rakip hipoteze karşı hipotez denir ve \(H_1\) ile gösterilir.
Yani \(H_0\) genellikle “değişiklik yok”, “etki yok”, “etiketteki değer doğru” türünden bir iddiadır; araştırmacının kanıtlamak istediği şey ise \(H_1\)’e yazılır. \(H_0\) ancak veriler ona karşı güçlü bir kanıt sunduğunda reddedilir. Mahkemedeki “suçu kanıtlanana kadar masumdur” ilkesine benzer: \(H_0\)’ı reddetmemek onun doğru olduğunu kanıtlamaz, yalnız ona karşı yeterli kanıt bulunamadığını söyler.
Ortalama \(\mu\) için sıfır hipotezi çoğunlukla \(H_0 : \mu = \mu_0\) biçimindedir; burada \(\mu_0\) verilmiş bir sayıdır. Karşı hipotez ise iki biçimden birinde olur.
Tanım 16.5 (Tek Yönlü Karşı Hipotez) \(H_1 : \mu > \mu_0\) ya da \(H_1 : \mu < \mu_0\) biçimindeki karşı hipoteze tek yönlü karşı hipotez denir.
Tanım 16.6 (İki Yönlü Karşı Hipotez) \(H_1 : \mu \ne \mu_0\) biçimindeki karşı hipoteze iki yönlü karşı hipotez denir.
Yani karşı hipotezin yönü sorunun kendisinden gelir. Tüketici derneği paketlerin eksik doldurulduğundan şüpheleniyorsa \(H_0 : \mu = 500\), \(H_1 : \mu < 500\) kurulur; çünkü fazla doldurma derneğin derdi değildir. Tabletlerin etikete uyup uymadığını denetleyen biri için ise iki yöndeki sapma da sorundur: \(H_1 : \mu \ne 12\). İki durumda da \(H_0\) basit, \(H_1\) bileşiktir.
16.2 Test İstatistiği ve Kritik Bölge
Karar örneklemden hesaplanan tek bir sayıya dayanır; örneklem uzayı da bu sayıya göre iki parçaya ayrılır.
Tanım 16.7 (Test İstatistiği) Değerine bakılarak \(H_0\) hakkında karar verilen istatistiğe test istatistiği denir.
Yani test istatistiği, verideki bütün bilgiyi karar için tek bir sayıya indirir. Ortalama testlerinde bu sayı \(\bar X\) ya da \(\bar X\)’in standartlaştırılmış hâlidir: \(\bar X\), \(\mu_0\)’dan çok uzaksa \(H_0 : \mu = \mu_0\)’dan şüphelenmek için nedenimiz olur.
Tanım 16.8 (Kritik Bölge ve Kabul Bölgesi) Test istatistiğinin alabileceği değerlerin, \(H_0\)’ın reddedilmesine yol açan kümesine kritik bölge ya da ret bölgesi, geri kalan kümesine kabul bölgesi denir. İki bölgeyi ayıran sınır noktalarına kritik değer denir.
Yani bir test, kritik bölgesi verilince tümüyle belirlenir: istatistiğin gözlenen değeri kritik bölgedeyse \(H_0\) reddedilir, değilse reddedilmez. “Kabul bölgesi” adı yerleşmiştir; ama yukarıda söylediğimiz gibi oraya düşmek \(H_0\)’ı kanıtlamaz, yalnız reddetmemek demektir. \(H_1 : \mu > \mu_0\) için kritik bölge doğal olarak \(\bar X > c\) biçimindedir; \(H_1 : \mu < \mu_0\) için \(\bar X < c\), \(H_1 : \mu \ne \mu_0\) için de \(\bar X\)’in \(\mu_0\)’dan iki yönden birine fazla uzaklaştığı iki parçalı bir bölgedir.
16.3 İki Tür Hata ve Testin Gücü
Kararımız rastgele bir örnekleme dayandığından iki farklı biçimde yanılabiliriz. Gerçek durumla verilen karar dört biçimde eşleşir:
| \(H_0\) reddedilmez | \(H_0\) reddedilir | |
|---|---|---|
| \(H_0\) doğru | doğru karar | I. tip hata |
| \(H_0\) yanlış | II. tip hata | doğru karar |
Tanım 16.9 (I. ve II. Tip Hata) Doğru olan \(H_0\)’ı reddetmeye I. tip hata, yanlış olan \(H_0\)’ı reddetmemeye II. tip hata denir. II. tip hatanın olasılığı \(\beta\) ile gösterilir: \[ \beta = P(H_0 \text{ reddedilmez} \mid H_1 \text{ doğru}). \]
Yani I. tip hata “olmayan bir etkiyi var sanmak”, II. tip hata “var olan bir etkiyi gözden kaçırmak”tır. \(H_1\) bileşik olduğunda \(\beta\), gerçek parametre değerine bağlıdır; bu yüzden \(\beta\)’yı hep belli bir alternatif değer için hesaplarız.
Tanım 16.10 (Anlamlılık Düzeyi) I. tip hata olasılığına testin anlamlılık düzeyi denir ve \(\alpha\) ile gösterilir: \[ \alpha = P(H_0 \text{ reddedilir} \mid H_0 \text{ doğru}). \] \(H_0\) bileşikse \(\alpha\), \(H_0\)’ın izin verdiği parametre değerleri üzerinden bu olasılığın en büyük değeridir.
Yani \(\alpha\), haksız yere \(H_0\)’ı reddetme riskimizin üst sınırıdır. Uygulamada \(\alpha\) önceden seçilir; en sık kullanılan değerler \(0{,}10\), \(0{,}05\) ve \(0{,}01\)’dir. Kritik bölge de bu \(\alpha\)’yı verecek biçimde kurulur.
Tanım 16.11 (Güç Fonksiyonu) Parametrenin her \(\mu\) değeri için \[ \pi(\mu) = P(H_0 \text{ reddedilir} \mid \text{gerçek ortalama } \mu) \] fonksiyonuna testin güç fonksiyonu denir. \(H_1\)’deki bir \(\mu\) için \(\pi(\mu) = 1 - \beta\) sayısına testin o noktadaki gücü denir.
Yani güç, yanlış olan \(H_0\)’ı yakalama olasılığıdır; iyi bir testin gücü yüksektir. Güç fonksiyonu iki hata türünü tek bir eğride toplar: \(H_0\)’ın içindeki değerlerde \(\pi(\mu)\) I. tip hata olasılığıdır, \(H_1\)’in içindeki değerlerde ise \(1 - \pi(\mu)\) II. tip hata olasılığıdır.
Örnek 16.1 (Belli Bir Kritik Bölge İçin Alfa ve Beta) Bir makinenin ürettiği parçaların uzunluğu (mm) \(N(\mu, 16)\) dağılımlıdır. \(16\) parçalık bir rastgele örneklemle \(H_0 : \mu = 50\) hipotezi \(H_1 : \mu = 52\) hipotezine karşı test edilecek; \(\bar x > 51{,}5\) ise \(H_0\) reddedilecektir. Bu testin \(\alpha\) ve \(\beta\) olasılıklarını bulunuz.
Çözüm
Normal bir kitlede \(\bar X \sim N(\mu, \sigma^2/n)\)’dir; bunu Z testinin ispatında gerekçesiyle göreceğiz (Teorem 16.1). Burada \(\sigma = 4\) ve \(n = 16\) olduğundan \(\bar X\)’in standart sapması \(\sigma/\sqrt n = 4/4 = 1\)’dir.
\(\alpha\). \(H_0\) doğruyken \(\bar X \sim N(50, 1)\)’dir. Standart normal tablosundan \(P(0 \le Z \le 1{,}5) = 0{,}4332\) olduğundan \[ \begin{aligned} \alpha &= P(\bar X > 51{,}5 \mid \mu = 50) = P\Big(Z > \frac{51{,}5 - 50}{1}\Big)\\[1mm] &= P(Z > 1{,}5) = 0{,}5 - 0{,}4332 = 0{,}0668 . \end{aligned} \]
\(\beta\). \(H_1\) doğruyken \(\bar X \sim N(52, 1)\)’dir ve \(H_0\), \(\bar X \le 51{,}5\) olduğunda reddedilmez. Tablodan \(P(0 \le Z \le 0{,}5) = 0{,}1915\) olduğundan \[ \begin{aligned} \beta &= P(\bar X \le 51{,}5 \mid \mu = 52) = P\Big(Z \le \frac{51{,}5 - 52}{1}\Big)\\[1mm] &= P(Z \le -0{,}5) = 0{,}5 - 0{,}1915 = 0{,}3085 . \end{aligned} \]
Buna göre \(\mu = 52\) iken testin gücü \(1 - \beta = 0{,}6915\)’tir. Aşağıdaki şekilde iki alan birlikte görülüyor: \(\alpha\), \(H_0\) eğrisinin kritik bölgeye düşen kuyruğu; \(\beta\) ise \(H_1\) eğrisinin kabul bölgesine düşen kısmıdır.
\(\blacksquare\)
Şekilden bir takas da okunur. Kritik değeri sağa, örneğin \(c = 52\)’ye kaydırırsak \(\alpha = P(Z > 2) = 0{,}5 - 0{,}4772 = 0{,}0228\)’e düşer, ama \(\beta = P(Z \le 0) = 0{,}5\)’e çıkar. Sabit bir örneklem büyüklüğünde birini küçültmek ötekini büyütür. İkisini birden küçültmenin yolu örneklemi büyütmektir: \(n = 64\) alınırsa \(\sigma/\sqrt n = 0{,}5\) olur ve aynı \(c = 51{,}5\) ile \[ \begin{aligned} \alpha &= P\Big(Z > \frac{51{,}5 - 50}{0{,}5}\Big) = P(Z > 3) = 0{,}5 - 0{,}4987 = 0{,}0013,\\[1mm] \beta &= P\Big(Z \le \frac{51{,}5 - 52}{0{,}5}\Big) = P(Z \le -1) = 0{,}5 - 0{,}3413 = 0{,}1587 \end{aligned} \] bulunur. Eğriler daralınca üst üste binen kısımları küçülür. Uygulamada önce \(\alpha\) sabitlenir, kritik bölge ona göre kurulur ve \(\beta\) bu testin sonucu olarak hesaplanır.
16.4 Normal Kitlenin Ortalaması İçin Z Testi
Standart sapması bilinen normal bir kitlenin ortalamasını test etmek, bütün bu kavramların en temiz örneğidir; çünkü test istatistiğinin dağılımı tam olarak bilinir. Kantiller için kitabın genel gösterimini kullanıyoruz: \(P(Z \le z_p) = p\); örneğin \(z_{0{,}95} = 1{,}645\) ve \(z_{0{,}975} = 1{,}96\) (kantil tanımı).
Teorem 16.1 (Ortalama İçin Z Testi) \(X_1, \ldots, X_n\), \(\sigma\)’sı bilinen bir \(N(\mu, \sigma^2)\) kitlesinden alınmış bir rastgele örneklem ve \(0 < \alpha < 1\) olsun. \[ Z = \frac{\bar X - \mu_0}{\sigma/\sqrt n} \] test istatistiği \(H_0 : \mu = \mu_0\) doğruyken \(N(0, 1)\) dağılımlıdır. \(H_0 : \mu = \mu_0\) hipotezinin \(\alpha\) anlamlılık düzeyindeki testinin kritik bölgesi, karşı hipoteze göre şöyledir:
1. \(H_1 : \mu > \mu_0\) için \(Z > z_{1-\alpha}\), yani \[ \bar X > \mu_0 + z_{1-\alpha}\,\frac{\sigma}{\sqrt n}. \]
2. \(H_1 : \mu < \mu_0\) için \(Z < -z_{1-\alpha}\), yani \[ \bar X < \mu_0 - z_{1-\alpha}\,\frac{\sigma}{\sqrt n}. \]
3. \(H_1 : \mu \ne \mu_0\) için \(|Z| > z_{1-\alpha/2}\), yani \[ \bar X < \mu_0 - z_{1-\alpha/2}\,\frac{\sigma}{\sqrt n} \quad\text{ya da}\quad \bar X > \mu_0 + z_{1-\alpha/2}\,\frac{\sigma}{\sqrt n}. \]
İspat
\(\bar X\)’in dağılımı. \(X_i\)’ler bağımsız ve \(N(\mu, \sigma^2)\) dağılımlıdır. Bağımsız normallerin doğrusal birleşimi için verilen sonucu (Sonuç 5.1) bütün katsayılar \(a_i = 1/n\) olacak biçimde uygularsak \(\bar X = \frac{1}{n}X_1 + \cdots + \frac{1}{n}X_n\) için ortalama \(n \cdot \frac{1}{n}\mu = \mu\), varyans \(n \cdot \frac{1}{n^2}\sigma^2 = \frac{\sigma^2}{n}\) çıkar: \[ \bar X \sim N\Big(\mu, \frac{\sigma^2}{n}\Big). \] \(H_0\) doğruyken \(\mu = \mu_0\)’dır; \(\bar X\)’ten ortalamasını çıkarıp standart sapmasına bölmek onu standartlaştırır (standartlaştırma teoremi). Demek ki \(Z \sim N(0, 1)\).
Kritik bölgeler. \(\sigma/\sqrt n > 0\) olduğundan her eşitsizliğin iki yanını \(\sigma/\sqrt n\) ile çarpıp \(\mu_0\) eklemek yönü değiştirmez; bu yüzden \(Z\) cinsinden ve \(\bar X\) cinsinden yazılan bölgeler aynı olaylardır. I. tip hata olasılıklarını \(Z \sim N(0,1)\) ile hesaplayalım.
1. Kantilin tanımından \(P(Z > z_{1-\alpha}) = 1 - (1 - \alpha) = \alpha\).
2. Simetriden \(-z_{1-\alpha} = z_{\alpha}\) olduğundan \(P(Z < -z_{1-\alpha}) = P(Z < z_\alpha) = \alpha\).
3. İki kuyruğun her biri \(\alpha/2\)’dir: \[ P(|Z| > z_{1-\alpha/2}) = P(Z < -z_{1-\alpha/2}) + P(Z > z_{1-\alpha/2}) = \frac{\alpha}{2} + \frac{\alpha}{2} = \alpha . \]
Üç durumda da \(H_0\) doğruyken reddetme olasılığı tam \(\alpha\)’dır.
\(\blacksquare\)
Yani kritik bölge karşı hipotezin gösterdiği yöne konur: \(H_1\) büyük değerleri söylüyorsa sağ kuyruğa, küçük değerleri söylüyorsa sol kuyruğa, iki yönü de söylüyorsa iki kuyruğa \(\alpha/2\)’şer. Büyüklüğü \(\alpha\) ile, yeri \(H_1\) ile belirlenir.
Aynı hesabı \(H_0\) yanlışken yaparsak testin gücünü elde ederiz.
Teorem 16.2 (Z Testinin Güç Fonksiyonu) Z testinin (Teorem 16.1) varsayımları altında \(\delta = \dfrac{(\mu - \mu_0)\sqrt n}{\sigma}\) olsun. Gerçek ortalama \(\mu\) iken üç testin gücü, \(Z \sim N(0, 1)\) olmak üzere şöyledir:
1. \(H_1 : \mu > \mu_0\) için \[ \pi(\mu) = P(Z > z_{1-\alpha} - \delta). \]
2. \(H_1 : \mu < \mu_0\) için \[ \pi(\mu) = P(Z < -z_{1-\alpha} - \delta). \]
3. \(H_1 : \mu \ne \mu_0\) için \[ \pi(\mu) = P(Z < -z_{1-\alpha/2} - \delta) + P(Z > z_{1-\alpha/2} - \delta). \]
Her üç durumda \(\pi(\mu_0) = \alpha\)’dır. Sağa yönlü testte \(\pi\) artan, sola yönlü testte azalandır.
İspat
Gerçek ortalama \(\mu\) iken \(\bar X \sim N(\mu, \sigma^2/n)\) olduğundan \(Z' = \dfrac{\bar X - \mu}{\sigma/\sqrt n} \sim N(0, 1)\)’dir. Test istatistiğini \(Z'\) cinsinden yazalım: \[ \frac{\bar X - \mu_0}{\sigma/\sqrt n} = \frac{\bar X - \mu}{\sigma/\sqrt n} + \frac{\mu - \mu_0}{\sigma/\sqrt n} = Z' + \delta . \] Sağa yönlü testte \(H_0\), \(Z' + \delta > z_{1-\alpha}\), yani \(Z' > z_{1-\alpha} - \delta\) olduğunda reddedilir; bunun olasılığı ilk formüldür. Sola yönlü testte ret olayı \(Z' + \delta < -z_{1-\alpha}\), yani \(Z' < -z_{1-\alpha} - \delta\)’dır. İki yönlü testte ret olayı iki ayrık olayın birleşimidir: \(Z' + \delta < -z_{1-\alpha/2}\) ya da \(Z' + \delta > z_{1-\alpha/2}\); olasılıkları toplanır.
\(\mu = \mu_0\) iken \(\delta = 0\) olur ve formüller Z testinin ispatındaki \(\alpha\) hesabına döner. Sağa yönlü testte \(\mu\) büyüdükçe \(\delta\) büyür, eşik \(z_{1-\alpha} - \delta\) küçülür ve eşiğin sağındaki alan büyür; demek ki \(\pi\) artandır. Sola yönlü test için aynı akıl yürütme ters yönde işler.
\(\blacksquare\)
Teoremin iki önemli sonucu var. Birincisi, sağa yönlü testte \(\pi\) artan olduğundan her \(\mu \le \mu_0\) için \(\pi(\mu) \le \pi(\mu_0) = \alpha\)’dır. Demek ki aynı kritik bölge, bileşik \(H_0 : \mu \le \mu_0\) hipotezi için de \(\alpha\) düzeyli bir testtir (sola yönlü testte \(H_0 : \mu \ge \mu_0\) için aynı şey geçerlidir). İkincisi, \(\mu \ne \mu_0\) sabitken \(n\) büyüdükçe \(|\delta|\) sınırsız büyür ve güç \(1\)’e yaklaşır: yeterince büyük bir örneklem, \(H_0\)’dan en küçük sapmayı bile yakalar.
1. Hipotezleri kur. \(H_0 : \mu = \mu_0\); \(H_1\)’in yönünü sorudan oku.
2. Anlamlılık düzeyini seç. Verilmemişse genellikle \(\alpha = 0{,}05\) alınır.
3. Test istatistiğini belirle. \(\sigma\) biliniyorsa \(Z = \dfrac{\bar X - \mu_0}{\sigma/\sqrt n}\).
4. Kritik bölgeyi yaz. \(H_1\)’in yönüne göre sağ, sol ya da iki kuyruk; kantili tablodan oku.
5. Hesapla ve karar ver. Gözlenen değer kritik bölgedeyse \(H_0\)’ı reddet; değilse reddetme. Sonucu sorunun diliyle yaz.
Örnek 16.2 (Paketler Eksik mi Dolduruluyor) Bir dolum makinesinin doldurduğu paketlerin ağırlığı (gram) \(\sigma = 6\) ile normal dağılımlıdır ve paketlerin üzerinde \(500\) gram yazmaktadır. Rastgele seçilen \(36\) paketin ortalama ağırlığı \(\bar x = 498{,}1\) gram bulunuyor. \(\alpha = 0{,}05\) anlamlılık düzeyinde paketlerin ortalamada eksik doldurulduğu söylenebilir mi?
Çözüm
Hipotezler. Şüphe eksik doldurma yönünde olduğundan \[ H_0 : \mu = 500, \qquad H_1 : \mu < 500 . \]
Test istatistiği. \(\sigma\) bilinir ve \(\sigma/\sqrt n = 6/6 = 1\)’dir; \(Z = \dfrac{\bar X - 500}{1}\).
Kritik bölge. Sola yönlü test olduğundan \(\alpha = 0{,}05\)’in tamamı sol kuyruğa konur. \(z_{0{,}95} = 1{,}645\) olduğundan \(H_0\), \(Z < -1{,}645\) olduğunda, yani \[ \bar X < 500 - 1{,}645 \cdot 1 = 498{,}355 \] olduğunda reddedilir.
Karar. Gözlenen değer \(\bar x = 498{,}1 < 498{,}355\)’tir; aynı şeyi \(Z\) ölçeğinde söylersek \[ z = \frac{498{,}1 - 500}{1} = -1{,}9 < -1{,}645 . \] Buna göre \(H_0\) reddedilir: \(\%5\) anlamlılık düzeyinde paketlerin ortalamada eksik doldurulduğu sonucuna varılır.
\(\blacksquare\)
Örnek 16.3 (İki Yönlü Testin Gücü) Parça uzunlukları (mm) \(N(\mu, 16)\) dağılımlıdır. \(16\) parçalık bir rastgele örneklemle \(H_0 : \mu = 50\) hipotezi \(H_1 : \mu \ne 50\) hipotezine karşı \(\alpha = 0{,}05\) düzeyinde test ediliyor. Gerçek ortalama \(\mu = 52\) ise testin gücü nedir?
Çözüm
Kritik bölge. \(\sigma/\sqrt n = 4/4 = 1\) ve iki yönlü test olduğundan her kuyrukta \(0{,}025\) kalır; \(z_{0{,}975} = 1{,}96\). Z testine (Teorem 16.1) göre \(H_0\), \[ \bar X < 50 - 1{,}96 = 48{,}04 \quad\text{ya da}\quad \bar X > 50 + 1{,}96 = 51{,}96 \] olduğunda reddedilir.
Güç. \(\mu = 52\) iken \(\bar X \sim N(52, 1)\)’dir. Ret olasılığını bu dağılımla hesaplayalım: \[ \begin{aligned} \pi(52) &= P(\bar X < 48{,}04) + P(\bar X > 51{,}96)\\ &= P\Big(Z < \frac{48{,}04 - 52}{1}\Big) + P\Big(Z > \frac{51{,}96 - 52}{1}\Big)\\ &= P(Z < -3{,}96) + P(Z > -0{,}04). \end{aligned} \] Tabloda \(3{,}96\)’nın karşılığı \(0{,}5000\)’dır; yani \(P(Z < -3{,}96) \approx 0{,}0000\). İkinci terimde simetriden \[ P(Z > -0{,}04) = 0{,}5 + P(0 \le Z \le 0{,}04) = 0{,}5 + 0{,}0160 = 0{,}5160 . \] Buna göre \[ \pi(52) \approx 0{,}5160, \qquad \beta = 1 - \pi(52) \approx 0{,}4840 . \] Yani ortalama gerçekte \(2\) mm kaymışken test bunu ancak yarı yarıya fark eder. Aynı hesap \(\mu = 53\) için \[ \pi(53) \approx P(Z > -1{,}04) = 0{,}5 + 0{,}3508 = 0{,}8508 \] verir. Örneklemi \(n = 64\)’e çıkarırsak \(\sigma/\sqrt n = 0{,}5\) ve \(\delta = (52 - 50)/0{,}5 = 4\) olur; güç fonksiyonu formülünden (Teorem 16.2) \[ \pi(52) \approx P(Z > 1{,}96 - 4) = P(Z > -2{,}04) = 0{,}5 + 0{,}4793 = 0{,}9793 \] bulunur. Aşağıdaki güç eğrileri bu değerleri bir arada gösteriyor.
\(\blacksquare\)
16.5 Varyans Bilinmediğinde t Testi
Uygulamada kitlenin standart sapması çoğu zaman bilinmez. O zaman \(\sigma\) yerine örneklem standart sapması \(S\) konur ve standart normal yerine \(t\) dağılımı kullanılır; güven aralığında yaptığımız değişikliğin aynısı.
Teorem 16.3 (Ortalama İçin t Testi) \(X_1, \ldots, X_n\), \(\mu\) ve \(\sigma\)’sı bilinmeyen bir \(N(\mu, \sigma^2)\) kitlesinden alınmış bir rastgele örneklem ve \(S\) örneklem standart sapması olsun. \[ T = \frac{\bar X - \mu_0}{S/\sqrt n} \] istatistiği \(H_0 : \mu = \mu_0\) doğruyken \(t_{n-1}\) dağılımlıdır. \(\alpha\) düzeyli testlerin kritik bölgeleri, Z testindeki (Teorem 16.1) \(z\) kantilleri yerine \(t_{n-1}\) kantilleri konarak elde edilir: \(H_1 : \mu > \mu_0\) için \(T > t_{n-1,\,1-\alpha}\), \(H_1 : \mu < \mu_0\) için \(T < -t_{n-1,\,1-\alpha}\), \(H_1 : \mu \ne \mu_0\) için \(|T| > t_{n-1,\,1-\alpha/2}\).
İspat
Normal bir örneklemde \(\dfrac{\bar X - \mu}{S/\sqrt n}\) istatistiğinin \(t_{n-1}\) dağılımlı olduğu örneklem dağılımları bölümünde gösterildi; \(H_0\) doğruyken \(\mu = \mu_0\) olduğundan bu istatistik \(T\)’dir. \(t\) dağılımı \(0\)’a göre simetrik olduğundan \(-t_{n-1,\,1-\alpha} = t_{n-1,\,\alpha}\)’dır. Geri kalan hesap Z testinin ispatının aynısıdır: kantilin tanımından \(P(T > t_{n-1,\,1-\alpha}) = \alpha\), \(P(T < -t_{n-1,\,1-\alpha}) = \alpha\) ve iki kuyruğun her biri \(\alpha/2\) olduğundan \(P(|T| > t_{n-1,\,1-\alpha/2}) = \alpha\).
\(\blacksquare\)
Örnek 16.4 (Yeni Gübre Fidelerin Boyunu Artırıyor mu) Eski gübreyle yetiştirilen fidelerin ortalama boyu \(20\) cm’dir. Yeni gübreyle yetiştirilen \(9\) fidenin boyları ölçülüyor ve \(\bar x = 21{,}8\) cm, \(s = 2{,}4\) cm bulunuyor. Boyların normal dağıldığını varsayarak, \(\alpha = 0{,}05\) düzeyinde yeni gübrenin ortalama boyu artırdığı söylenebilir mi?
Çözüm
Hipotezler. Araştırılan iddia artış olduğundan \[ H_0 : \mu = 20, \qquad H_1 : \mu > 20 . \]
Test istatistiği. \(\sigma\) bilinmediğinden \(t\) testi kullanılır. \(S/\sqrt n = 2{,}4/3 = 0{,}8\) ve serbestlik derecesi \(n - 1 = 8\)’dir.
Kritik bölge. Sağa yönlü testte \(H_0\), \(T > t_{8,\,0{,}95}\) olduğunda reddedilir. \(t\) tablosundan \(t_{8,\,0{,}95} = 1{,}860\) okunur. \(\bar X\) cinsinden kritik bölge \[ \bar X > 20 + 1{,}860 \cdot 0{,}8 = 21{,}488 \] olur; burada \(S\)’nin de rastgele olduğunu unutmayalım, bu sınır gözlenen \(s = 2{,}4\) ile hesaplanmıştır.
Karar. Gözlenen değer \[ t = \frac{21{,}8 - 20}{0{,}8} = \frac{1{,}8}{0{,}8} = 2{,}25 > 1{,}860 \] olduğundan \(H_0\) reddedilir: \(\%5\) düzeyinde yeni gübrenin fidelerin ortalama boyunu artırdığı sonucuna varılır.
\(\blacksquare\)
16.6 p Değeri
Kritik bölgeyle verilen karar yalnız “reddet” ya da “reddetme” der; verinin \(H_0\)’a karşı ne kadar güçlü bir kanıt olduğunu söylemez. Paket örneğinde \(z = -1{,}9\) bulduk; \(z = -1{,}7\) ya da \(z = -4\) bulsaydık da aynı karara varırdık. Bu farkı ölçen sayı \(p\) değeridir.
Tanım 16.12 (p Değeri) Test istatistiğinin gözlenen değeri verilmiş olsun. \(H_0\) doğruyken test istatistiğinin, karşı hipotez yönünde gözlenen değer kadar ya da ondan daha aşırı bir değer alma olasılığına \(p\) değeri denir. \(Z\) testinde gözlenen değer \(z\) ise:
- \(H_1 : \mu > \mu_0\) için \(p = P(Z \ge z)\),
- \(H_1 : \mu < \mu_0\) için \(p = P(Z \le z)\),
- \(H_1 : \mu \ne \mu_0\) için \(p = P(|Z| \ge |z|) = 2\,P(Z \ge |z|)\).
Yani \(p\) değeri şu soruyu yanıtlar: \(H_0\) doğru olsaydı, en az bu kadar aykırı bir sonuç görmek ne kadar olası olurdu? Küçük bir \(p\) değeri, gözlenen verinin \(H_0\) altında pek beklenmedik olduğunu, dolayısıyla \(H_0\)’a karşı güçlü bir kanıt olduğunu söyler.
\(p\) değeri ile kritik bölge aynı kararı verir. Örneğin sağa yönlü \(Z\) testinde \(z > z_{1-\alpha}\) olması, \(z\)’nin sağında \(\alpha\)’dan az alan kalması, yani \(p < \alpha\) olması demektir. Öteki iki durum da aynı biçimde görülür. Kısaca: \(p < \alpha\) ise \(H_0\) reddedilir, \(p \ge \alpha\) ise reddedilmez. \(p\) değeri bu yüzden, verinin \(H_0\)’ı reddettiği en küçük anlamlılık düzeyi olarak da düşünülebilir; önceden seçilmiş bir \(\alpha\)’ya bağlı kalmadan bildirilebilir.
Örnek 16.5 (Paket Örneğinde p Değeri) Paket örneğinde (Örnek 16.2) \(H_0 : \mu = 500\) hipotezi \(H_1 : \mu < 500\)’e karşı test edilmiş, gözlenen test istatistiği \(z = -1{,}9\) bulunmuştu. Bu testin \(p\) değerini bulup \(\alpha = 0{,}05\) ve \(\alpha = 0{,}01\) düzeylerindeki kararı belirleyiniz.
Çözüm
Sola yönlü test olduğundan \(p\) değeri, \(-1{,}9\)’un solundaki alandır. Simetriden ve tablodan \(P(0 \le Z \le 1{,}9) = 0{,}4713\) ile \[ p = P(Z \le -1{,}9) = P(Z \ge 1{,}9) = 0{,}5 - 0{,}4713 = 0{,}0287 . \]
\(p = 0{,}0287 < 0{,}05\) olduğundan \(\%5\) düzeyinde \(H_0\) reddedilir; bu, kritik bölgeyle verilen kararla (Örnek 16.2) aynıdır. Öte yandan \(p = 0{,}0287 > 0{,}01\) olduğundan \(\%1\) düzeyinde \(H_0\) reddedilmez: veri eksik doldurmaya işaret ediyor, ama bu kadar katı bir düzeyde yeterince güçlü bir kanıt değil.
\(\blacksquare\)
\(t\) testinde de \(p\) değeri aynı biçimde tanımlanır; yalnız alanlar \(t_{n-1}\) eğrisinin altından alınır. Tablo yalnız bazı kantilleri verdiğinden \(p\) çoğu zaman iki değer arasına sıkıştırılır. Örneğin gübre örneğinde (Örnek 16.4) gözlenen \(t = 2{,}25\), \(t\) tablosundaki \(t_{8,\,0{,}95} = 1{,}860\) ile \(t_{8,\,0{,}975} = 2{,}306\) arasında kalır; demek ki \(0{,}025 < p < 0{,}05\)’tir.
Örnek 16.6 (Tabletlerde Etken Madde) Bir ilacın tabletlerindeki etken madde miktarı (mg) \(\sigma = 1{,}5\) ile normal dağılımlıdır ve etikette \(12\) mg yazmaktadır. Rastgele seçilen \(25\) tabletin ortalaması \(\bar x = 12{,}5\) mg bulunuyor. \(H_0 : \mu = 12\) hipotezini \(H_1 : \mu \ne 12\) hipotezine karşı test eden \(Z\) testinin \(p\) değerini bulup \(\alpha = 0{,}05\) ve \(\alpha = 0{,}10\) düzeylerindeki kararı belirleyiniz.
Çözüm
\(\sigma/\sqrt n = 1{,}5/5 = 0{,}3\) olduğundan gözlenen test istatistiği \[ z = \frac{12{,}5 - 12}{0{,}3} = \frac{0{,}5}{0{,}3} \approx 1{,}67 \] olur. İki yönlü testte iki kuyruk birlikte sayılır. Tablodan \(P(0 \le Z \le 1{,}67) = 0{,}4525\) ile \[ p = 2\,P(Z \ge 1{,}67) = 2\,(0{,}5 - 0{,}4525) = 2 \cdot 0{,}0475 = 0{,}095 . \]
\(p = 0{,}095 > 0{,}05\) olduğundan \(\%5\) düzeyinde \(H_0\) reddedilmez; gerçekten de \(|z| = 1{,}67 < z_{0{,}975} = 1{,}96\)’dır. \(p = 0{,}095 < 0{,}10\) olduğundan \(\%10\) düzeyinde ise \(H_0\) reddedilir; bu da \(|z| = 1{,}67 > z_{0{,}95} = 1{,}645\) olmasıyla uyumludur. Yani veri etiketten bir sapmaya zayıf bir işaret veriyor; kararın seçilen \(\alpha\)’ya bağlı olduğu bir sınır durumudur.
\(\blacksquare\)
16.7 Güven Aralığı ile İki Yönlü Test
İki yönlü test ile güven aralığı aynı madalyonun iki yüzüdür: biri tek bir \(\mu_0\) değerini sınar, öteki verilerle uyumlu bütün değerleri listeler.
Teorem 16.4 (Güven Aralığı ile İki Yönlü Test) \(X_1, \ldots, X_n\), \(\sigma\)’sı bilinen bir \(N(\mu, \sigma^2)\) kitlesinden alınmış bir rastgele örneklem olsun. \(H_0 : \mu = \mu_0\) hipotezinin \(H_1 : \mu \ne \mu_0\)’a karşı \(\alpha\) düzeyli \(Z\) testi, ancak ve ancak \(\mu_0\), \[ \bar X - z_{1-\alpha/2}\,\frac{\sigma}{\sqrt n} \le \mu \le \bar X + z_{1-\alpha/2}\,\frac{\sigma}{\sqrt n} \] \(\%100(1-\alpha)\) güven aralığının dışında kaldığında \(H_0\)’ı reddeder. \(\sigma\) bilinmediğinde \(\sigma\) yerine \(S\), \(z_{1-\alpha/2}\) yerine \(t_{n-1,\,1-\alpha/2}\) konarak aynı sonuç \(t\) testi için geçerlidir.
İspat
Kısalık için \(h = z_{1-\alpha/2}\,\sigma/\sqrt n\) diyelim. Z testine (Teorem 16.1) göre \(H_0\), \(|\bar X - \mu_0| > h\) olduğunda reddedilir; yani \(|\bar X - \mu_0| \le h\) olduğunda reddedilmez. Mutlak değer eşitsizliğini açalım: \[ |\bar X - \mu_0| \le h \iff -h \le \mu_0 - \bar X \le h \iff \bar X - h \le \mu_0 \le \bar X + h . \] Sağdaki koşul, \(\mu_0\)’ın güven aralığının içinde olmasıdır. Demek ki \(H_0\) reddedilmez ancak ve ancak \(\mu_0\) aralığın içindedir; eşdeğer olarak \(H_0\) reddedilir ancak ve ancak \(\mu_0\) aralığın dışındadır. \(t\) testi için aynı hesap \(h = t_{n-1,\,1-\alpha/2}\,S/\sqrt n\) ile yapılır.
\(\blacksquare\)
Yani \(\%95\) güven aralığı, \(\%5\) düzeyindeki iki yönlü testte reddedilmeyen \(\mu_0\) değerlerinin kümesidir. Bir güven aralığı elde, hiç yeni hesap yapmadan her \(\mu_0\) için test sonucunu okuyabiliriz.
Örnek 16.7 (Güven Aralığından Test Kararı) Tablet örneğindeki (Örnek 16.6) verilerde (\(\sigma = 1{,}5\), \(n = 25\), \(\bar x = 12{,}5\)) \(\mu\) için \(\%95\) güven aralığını kurup \(H_0 : \mu = 12\) hipotezinin \(\alpha = 0{,}05\) düzeyindeki iki yönlü test kararını bu aralıktan okuyunuz.
Çözüm
\(z_{0{,}975} = 1{,}96\) ve \(\sigma/\sqrt n = 0{,}3\) olduğundan aralığın yarı genişliği \(1{,}96 \cdot 0{,}3 = 0{,}588\)’dir. \(\%95\) güven aralığı \[ 12{,}5 - 0{,}588 \le \mu \le 12{,}5 + 0{,}588, \qquad\text{yani}\qquad 11{,}912 \le \mu \le 13{,}088 \] olur. \(\mu_0 = 12\) bu aralığın içindedir; bu yüzden (Teorem 16.4) \(\%5\) düzeyinde \(H_0\) reddedilmez. Bu, \(p = 0{,}095 > 0{,}05\) ile bulunan kararın (Örnek 16.6) aynısıdır.
Aynı aralıktan başka hipotezlerin kararı da okunur: örneğin \(H_0 : \mu = 13\) de reddedilmez (\(13\) aralıktadır), ama \(H_0 : \mu = 11{,}8\) reddedilir (\(11{,}8 < 11{,}912\)).
\(\blacksquare\)
Hipotez testinin temel dilini kurduk: hipotezler, kritik bölge, iki tür hata, güç, \(p\) değeri ve güven aralığıyla bağlantı. Bu araçlar kitabın sonundaki Alıştırmalar bölümünde, özellikle normal ortalama testi ve testin gücü alıştırmasında iki yönlü bir testin kritik bölgesini ve gücünü hesaplarken kullanılıyor.