15  Oran için Aralık Tahmini

Bir seçim anketinde adayı destekleyenlerin oranı, bir üretim hattında kusurlu parçaların oranı, bir tedaviyle iyileşen hastaların oranı… İstatistikte en sık tahmin edilen büyüklüklerden biri bir kitledeki “başarıların” oranıdır. Önceki iki bölümde normal kitlelerin ortalaması ve varyansı için güven aralığı (Tanım 13.1) kurduk (Ortalama için Aralık Tahmini, Varyans ve İki Kitle için Aralık Tahmini). Bu bölümde aynı fikri binom dağılımına uyguluyoruz: önce tek bir oran \(p\) için, sonra iki oranın farkı \(p_1 - p_2\) için güven aralığı kuracağız. Bölümün sonunda da bütün aralık türlerini bir arada kullanan çözümlü örnekler var.

15.1 Binom Parametresi \(p\) için Aralık Tahmini

Bir kitledeki bireylerin bir kısmı belli bir özelliğe sahip olsun ve bu özelliğe sahip olanların oranı \(p\) bilinmesin. Kitleden bağımsız olarak \(n\) birey seçip özelliğe sahip olanları sayarsak, bu sayı \(X \sim \operatorname{Binom}(n, p)\) dağılımına sahiptir (Olasılık Teorisi’ndeki tanım). Burada \(n\) bilinir, \(p\) tahmin edilecek parametredir.

Tanım 15.1 (Örneklem Oranı) \(X \sim \operatorname{Binom}(n, p)\) olsun.

\[ \hat p = \frac{X}{n} \]

istatistiğine örneklem oranı denir. Ayrıca \(\hat q = 1 - \hat p\) yazılır.

Yani \(\hat p\), örneklemdeki başarıların oranıdır. \(X\) rastgele bir değişken olduğundan \(\hat p\) de rastgele bir değişkendir: başka bir örneklem seçilse başka bir değer alır. \(X\)’in olanaklı değerleri \(0, 1, \ldots, n\) olduğundan \(\hat p\)’nin olanaklı değerleri

\[ 0, \ \frac{1}{n}, \ \frac{2}{n}, \ \ldots, \ \frac{n-1}{n}, \ 1 \]

olur. Aralık kurmak için \(\hat p\)’nin dağılımı hakkında üç şey bilmemiz yeter.

Önerme 15.1 (Örneklem Oranının Dağılımı) \(0 < p < 1\), \(X \sim \operatorname{Binom}(n, p)\), \(q = 1 - p\) ve \(\hat p = X/n\) olsun.

1. \(E(\hat p) = p\); yani \(\hat p\), \(p\)’nin yansız bir tahmin edicisidir.

2. \(\operatorname{Var}(\hat p) = \dfrac{pq}{n}\).

3. \(n\) büyükken

\[ Z = \frac{\hat p - p}{\sqrt{pq/n}} \]

yaklaşık olarak \(N(0,1)\) dağılımına sahiptir.

Aşağıdaki şekil \(n = 40\), \(p = 0{,}3\) için \(\hat p\)’nin olasılıklarını ve bunları yaklaşık olarak veren \(N(p, pq/n)\) eğrisini gösteriyor.

p = 0,3 0 0,1 0,2 0,3 0,4 0,5 0,6 x/n 1 2 3 4 5 6 olasılık / genişlik N(0,3; 0,00525)
n = 40 ve p = 0,3 iken p̂ = X/n oranının olasılıkları: k/40 değerinin olasılığı, genişliği 1/40 olan bir dikdörtgenin alanıdır. Üstteki eğri N(p, pq/n) = N(0,3; 0,00525) yoğunluğudur; dikdörtgenler eğriyi yakından izler ve p = 0,3 çevresinde toplanır.
İspat

Binom dağılımında \(E(X) = np\) ve \(\operatorname{Var}(X) = npq\)’dur (Olasılık Teorisi’ndeki binom momentleri).

1. Beklenen değer doğrusal olduğundan

\[ E(\hat p) = E\Big(\frac{X}{n}\Big) = \frac{1}{n}\,E(X) = \frac{np}{n} = p. \]

2. Bir sabitle çarpılan değişkenin varyansı, sabitin karesiyle çarpılır:

\[ \operatorname{Var}(\hat p) = \operatorname{Var}\Big(\frac{X}{n}\Big) = \frac{1}{n^2}\operatorname{Var}(X) = \frac{npq}{n^2} = \frac{pq}{n}. \]

3. \(Z\)’nin payını ve paydasını \(n\) ile çarpalım:

\[ Z = \frac{\hat p - p}{\sqrt{pq/n}} = \frac{n\hat p - np}{n\sqrt{pq/n}} = \frac{X - np}{\sqrt{npq}}. \]

Son ifade binom değişkeninin standartlaştırılmış hâlidir. De Moivre-Laplace teoremine (Teorem 5.1) göre \(n\) büyükken bu ifade yaklaşık olarak \(N(0,1)\) dağılımına sahiptir.

\(\blacksquare\)

Yani \(\hat p\) ortalamada \(p\)’yi tutturur ve varyansı \(pq/n\), \(n\) büyüdükçe sıfıra gider: büyük örneklemde \(\hat p\) değerleri \(p\)’nin çevresinde toplanır. Ayrıca \(\hat p\), \(n\) tane Bernoulli gözleminin ortalamasıdır; bu yüzden \(p\)’nin doğrusal yansız tahmin edicileri arasında varyansı en küçük olanıdır (Teorem 11.3). Bu yüzden \(p\) için aralığı \(\hat p\)’nin çevresinde kuracağız.

Aşağıda \(z_{1-\alpha/2}\), standart normal dağılımın \(1 - \alpha/2\) kantilidir (Tanım 5.1): \(P(Z \le z_{1-\alpha/2}) = 1 - \alpha/2\). Örneğin \(z_{0{,}975} = 1{,}96\).

Teorem 15.1 (Binom Parametresi için Güven Aralığı) \(0 < p < 1\), \(X \sim \operatorname{Binom}(n, p)\), \(\hat p = X/n\), \(\hat q = 1 - \hat p\) ve \(0 < \alpha < 1\) olsun. \(n\) büyükken

\[ \hat p - z_{1-\alpha/2}\sqrt{\frac{\hat p\hat q}{n}} \ < \ p \ < \ \hat p + z_{1-\alpha/2}\sqrt{\frac{\hat p\hat q}{n}} \]

aralığı \(p\) için yaklaşık \(\%100(1-\alpha)\) düzeyli bir güven aralığıdır.

İspat

Kısalık için \(z = z_{1-\alpha/2}\) yazalım.

Olasılık ifadesi. Standart normal dağılım \(0\)’a göre simetrik olduğundan \(P(Z < -z) = P(Z > z) = \alpha/2\)’dir. İki kuyruk çıkarılınca ortada \(1 - \alpha\) alan kalır. Önerme 15.1 gereğince \(n\) büyükken \((\hat p - p)/\sqrt{pq/n}\) yaklaşık standart normal olduğundan

\[ P\bigg(-z < \frac{\hat p - p}{\sqrt{pq/n}} < z\bigg) \approx 1 - \alpha. \]

\(p\)’yi yalnız bırakma. Eşitsizliğin her tarafını pozitif \(\sqrt{pq/n}\) sayısıyla çarpalım:

\[ -z\sqrt{\frac{pq}{n}} < \hat p - p < z\sqrt{\frac{pq}{n}}. \]

Her taraftan \(\hat p\) çıkarıp \(-1\) ile çarparsak eşitsizlikler yön değiştirir:

\[ P\bigg(\hat p - z\sqrt{\frac{pq}{n}} < p < \hat p + z\sqrt{\frac{pq}{n}}\bigg) \approx 1 - \alpha. \]

Sınırları hesaplanabilir yapma. Bulduğumuz sınırlar bilinmeyen \(p\)’yi (ve \(q = 1 - p\)’yi) içerir; bu yüzden istatistik değildir ve örneklemden hesaplanamaz. Bu sorunu \(p\) yerine yansız tahmin edicisi \(\hat p\)’yi koyarak çözeriz. Bu değişiklik yaklaşımı bozmaz. Büyük sayılar yasasına göre (Sonuç 8.1) \(n\) büyüdükçe \(\hat p\), \(p\)’ye olasılıkta yakınsar; \(0 < p < 1\) olduğundan \(c_n = \sqrt{pq/(\hat p\hat q)}\) çarpanı da \(1\)’e olasılıkta yakınsar. Dağılımda standart normale yakınsayan bir değişken, olasılıkta \(1\)’e yakınsayan bir çarpanla çarpılınca limit dağılımı değişmez (Slutsky teoremi; bu derste ispatsız kullanıyoruz). Bu yüzden

\[ \frac{\hat p - p}{\sqrt{\hat p\hat q/n}} = c_n \cdot \frac{\hat p - p}{\sqrt{pq/n}} = \frac{X/n - p}{\sqrt{\frac{1}{n}\cdot\frac{X}{n}\big(1 - \frac{X}{n}\big)}} \]

de büyük \(n\) için yaklaşık \(N(0,1)\) dağılımına sahip olur. Yukarıdaki adımlar bu değişkenle tekrarlanınca, sınırlarında yalnız \(\hat p\) bulunan aralık elde edilir.

\(\blacksquare\)

Yani \(p\) için güven aralığı “tahmin \(\pm\) hata payı” biçimindedir:

\[ \hat p \mp E, \qquad E = z_{1-\alpha/2}\sqrt{\frac{\hat p\hat q}{n}}. \]

Aralığın merkezi örneklem oranı \(\hat p\), yarı genişliği \(E\)’dir; \(E\)’ye tahminin hata payı da denir. Güven düzeyi büyüdükçe \(z_{1-\alpha/2}\) büyür ve aralık genişler; örneklem büyüdükçe \(\sqrt n\) paydada olduğundan aralık daralır. Aralık bir normal yaklaşıma dayandığından \(n\)’nin yeterince büyük olması gerekir; binoma normal yaklaşımdaki kural burada da kullanılır: \(n\hat p \ge 5\) ve \(n\hat q \ge 5\) olmalıdır.

NotGüven düzeyi ne anlatır?

\(p\) sabit bir sayıdır; rastgele olan aralıktır. Aynı kitleden çok sayıda örneklem alıp her birinden \(\%95\)’lik bir aralık hesaplarsak, bu aralıkların yaklaşık \(\%95\)’i \(p\)’yi içerir. Aşağıdaki şekilde \(p = 0{,}4\) olan bir kitleden alınmış \(20\) örneklemin aralıkları görülüyor: biri \(p\)’yi kaçırıyor. Tek bir örneklemden hesaplanan somut aralık ise \(p\)’yi ya içerir ya içermez; “\(\%95\) güven”, bu aralığı üreten yöntemin uzun vadedeki başarısıdır.

gerçek p = 0,4 p'yi kaçıran aralık 0,1 0,2 0,3 0,4 0,5 0,6 0,7 p 1 5 10 15 20 örneklem
Aynı kitleden (p = 0,4) alınmış 20 ayrı n = 50 hacimli örneklemden hesaplanan %95'lik güven aralıkları; noktalar p̂ değerleridir. Aralıklar örneklemden örnekleme değişir, p ise sabittir. Burada 20 aralığın 19'u p'yi içeriyor; uzun vadede aralıkların yaklaşık %95'i içerir.
İpucuOran için güven aralığı dört adımda

1. \(\hat p = x/n\) ve \(\hat q = 1 - \hat p\) değerlerini hesaplayın; \(n\hat p \ge 5\) ve \(n\hat q \ge 5\) olduğunu kontrol edin.

2. Güven düzeyinden \(\alpha\)’yı ve \(z_{1-\alpha/2}\) kantilini bulun (standart normal tablosu).

3. Hata payını hesaplayın: \(E = z_{1-\alpha/2}\sqrt{\hat p\hat q/n}\).

4. Aralığı \((\hat p - E; \ \hat p + E)\) olarak yazın ve soru bağlamında yorumlayın.

Örnek 15.1 (Seçim Anketinde Yüzde Doksan Beş Güven) Rastgele seçilen \(1500\) seçmenin \(\%42\)’si bir adayı desteklediğini söylüyor. Adayı destekleyen seçmenlerin kitledeki oranı \(p\) için \(\%95\) güven düzeyinde bir güven aralığı bulunuz.

Çözüm

1. Örneklem oranı. \(n = 1500\) ve \(\hat p = 0{,}42\), dolayısıyla \(\hat q = 0{,}58\). Ayrıca \(n\hat p = 630\) ve \(n\hat q = 870\) sayıları \(5\)’ten çok büyük olduğundan normal yaklaşım rahatça kullanılabilir.

2. Kantil. \(1 - \alpha = 0{,}95\) ise \(\alpha/2 = 0{,}025\) ve \(1 - \alpha/2 = 0{,}975\)’tir. Standart normal tablosunda \(0{,}975 - 0{,}5 = 0{,}4750\) değeri \(1{,}96\)’ya karşılık gelir: \(z_{0{,}975} = 1{,}96\).

3. Hata payı.

\[ \begin{aligned} \frac{\hat p\hat q}{n} &= \frac{0{,}42 \cdot 0{,}58}{1500} = \frac{0{,}2436}{1500} = 0{,}0001624, \\[1mm] E &= 1{,}96\sqrt{0{,}0001624} \approx 1{,}96 \cdot 0{,}012744 \approx 0{,}0250. \end{aligned} \]

4. Aralık.

\[ 0{,}42 - 0{,}0250 < p < 0{,}42 + 0{,}0250 \quad\Longrightarrow\quad 0{,}3950 < p < 0{,}4450. \]

Yani adayın kitledeki desteği \(\%95\) güvenle yaklaşık \(\%39{,}5\) ile \(\%44{,}5\) arasındadır. Anket sonuçlarında sık görülen “hata payı \(\pm 2{,}5\) puan” ifadesi tam olarak bu \(E\) sayısıdır.

\(\blacksquare\)

Örnek 15.2 (Seçim Anketinde Yüzde Doksan Dokuz Güven) Rastgele seçilen \(1500\) seçmenin \(\%42\)’si bir adayı desteklediğini söylüyor. Adayı destekleyenlerin kitledeki oranı \(p\) için \(\%99\) güven düzeyinde bir güven aralığı bulunuz ve \(\%95\)’lik aralıkla karşılaştırınız.

Çözüm

Örneklem aynı olduğundan \(\hat p = 0{,}42\), \(\hat q = 0{,}58\) ve \(\sqrt{\hat p\hat q/n} \approx 0{,}012744\) değişmez.

\(1 - \alpha = 0{,}99\) ise \(1 - \alpha/2 = 0{,}995\)’tir. Standart normal tablosunda \(0{,}4950\) değeri \(2{,}57\) (\(0{,}4949\)) ile \(2{,}58\) (\(0{,}4951\)) arasının tam ortasına düşer; daha kesin değer \(z_{0{,}995} = 2{,}576\)’dır. Hata payı

\[ E = 2{,}576 \cdot 0{,}012744 \approx 0{,}0328 \]

ve aralık

\[ 0{,}42 - 0{,}0328 < p < 0{,}42 + 0{,}0328 \quad\Longrightarrow\quad 0{,}3872 < p < 0{,}4528 \]

olur. Aynı veriyle daha yüksek güven istediğimizde \(z\) kantili \(1{,}96\)’dan \(2{,}576\)’ya çıktı ve aralık \(0{,}0500\) genişlikten \(0{,}0656\) genişliğe büyüdü. Daha emin olmanın bedeli daha geniş, yani daha az bilgi veren bir aralıktır.

\(\blacksquare\)

Hata payı formülü tersinden de kullanılabilir: istenen bir hata payına ulaşmak için örneklemin ne kadar büyük olması gerektiğini, veri toplanmadan önce hesaplayabiliriz.

Örnek 15.3 (Gereken Örneklem Hacmi) Bir oranı \(\%95\) güven düzeyinde en çok \(0{,}03\) hata payıyla tahmin etmek istiyoruz. \(p\) hakkında hiçbir ön bilgi yoksa en az kaç birimlik örneklem alınmalıdır?

Çözüm

Hata payının \(0{,}03\)’ü aşmaması için

\[ 1{,}96\sqrt{\frac{\hat p\hat q}{n}} \le 0{,}03 \]

olmalıdır. Sorun şu: \(\hat p\) ancak veri toplandıktan sonra bilinir. Ama \(\hat p\hat q\) çarpımının alabileceği en büyük değeri biliyoruz. \(0 \le t \le 1\) için

\[ t(1 - t) = \frac{1}{4} - \Big(t - \frac{1}{2}\Big)^2 \le \frac{1}{4} \]

ve eşitlik yalnız \(t = \frac{1}{2}\)’de sağlanır. Yani hata payı \(\hat p = \frac{1}{2}\) iken en büyüktür. Aşağıdaki şekil bunu üç farklı \(n\) için gösteriyor.

n = 100 n = 400 n = 1068 0,03 0 0,1 0,2 0,3 0,4 0,5 0,6 0,7 0,8 0,9 1 p 0,02 0,04 0,06 0,08 0,10 hata payı
%95 güven düzeyinde hata payı 1,96·√(p(1 − p)/n), p'nin fonksiyonu olarak. Her n için en büyük değer p = 1/2'de alınır; n = 1068 iken bu en büyük değer bile 0,03'ün altında kalır.

En kötü durumda bile hata payının \(0{,}03\)’ü aşmaması için \(\hat p\hat q\) yerine \(\frac{1}{4}\) koyalım:

\[ 1{,}96\sqrt{\frac{1}{4n}} \le 0{,}03 \iff \sqrt{n} \ge \frac{1{,}96}{2 \cdot 0{,}03} \iff n \ge \Big(\frac{1{,}96}{0{,}06}\Big)^2 \approx 1067{,}1. \]

\(n\) tam sayı olduğundan en az \(1068\) birim seçilmelidir. Bu hacimle, \(\hat p\) ne çıkarsa çıksın, hata payı \(0{,}03\)’ü aşmaz.

\(\blacksquare\)

15.2 İki Binom Parametresinin Farkı için Aralık Tahmini

Çoğu zaman tek bir oranı değil, iki oranı karşılaştırmak isteriz: iki makinenin kusur oranı, aşılı ve aşısız gruplarda hastalanma oranı. İki kitleden birbirinden bağımsız iki örneklem alalım: birinci kitleden \(n_1\) birimde \(X_1\) başarı, ikinci kitleden \(n_2\) birimde \(X_2\) başarı gözlensin. \(X_1 \sim \operatorname{Binom}(n_1, p_1)\) ve \(X_2 \sim \operatorname{Binom}(n_2, p_2)\) bağımsızdır; tahmin edilecek büyüklük \(p_1 - p_2\) farkıdır. Doğal nokta tahmini, örneklem oranlarının farkıdır:

\[ \hat p_1 - \hat p_2 = \frac{X_1}{n_1} - \frac{X_2}{n_2}. \]

Önerme 15.2 (İki Örneklem Oranının Farkı) \(0 < p_1, p_2 < 1\) olmak üzere \(X_1 \sim \operatorname{Binom}(n_1, p_1)\) ve \(X_2 \sim \operatorname{Binom}(n_2, p_2)\) bağımsız, \(q_i = 1 - p_i\) ve \(\hat p_i = X_i/n_i\) olsun.

1. \(E(\hat p_1 - \hat p_2) = p_1 - p_2\).

2. \(\operatorname{Var}(\hat p_1 - \hat p_2) = \dfrac{p_1q_1}{n_1} + \dfrac{p_2q_2}{n_2}\).

3. \(n_1\) ve \(n_2\) büyükken

\[ Z = \frac{(\hat p_1 - \hat p_2) - (p_1 - p_2)}{\sqrt{\dfrac{p_1q_1}{n_1} + \dfrac{p_2q_2}{n_2}}} \]

yaklaşık olarak \(N(0,1)\) dağılımına sahiptir.

İspat

1. Beklenen değerin doğrusallığı ve Önerme 15.1 kullanılarak

\[ E(\hat p_1 - \hat p_2) = E(\hat p_1) - E(\hat p_2) = p_1 - p_2. \]

2. \(\hat p_1\) ile \(\hat p_2\) bağımsız olduğundan kovaryansları \(0\)’dır ve farkın varyansı varyansların toplamıdır:

\[ \operatorname{Var}(\hat p_1 - \hat p_2) = \operatorname{Var}(\hat p_1) + \operatorname{Var}(\hat p_2) = \frac{p_1q_1}{n_1} + \frac{p_2q_2}{n_2}. \]

3. Önerme 15.1 gereğince \(\hat p_1\) yaklaşık \(N(p_1, p_1q_1/n_1)\), \(\hat p_2\) yaklaşık \(N(p_2, p_2q_2/n_2)\) dağılımına sahiptir ve ikisi bağımsızdır. Bağımsız normal değişkenlerin farkı da normaldir (Sonuç 5.1); dolayısıyla \(\hat p_1 - \hat p_2\) yaklaşık olarak 1. ve 2. maddelerdeki ortalama ve varyansla normal dağılır. Bu değişkeni standartlaştırınca \(Z\) elde edilir.

\(\blacksquare\)

Tek oranda olduğu gibi, bu olasılık ifadesini \(p_1 - p_2\) için çözüp bilinmeyen varyansı tahminiyle değiştiririz.

Teorem 15.2 (İki Binom Parametresinin Farkı için Güven Aralığı) Önerme 15.2 içindeki varsayımlar altında \(\hat q_i = 1 - \hat p_i\) olsun. \(n_1\) ve \(n_2\) büyükken \(p_1 - p_2\) için yaklaşık \(\%100(1-\alpha)\) düzeyli güven aralığının sınırları

\[ (\hat p_1 - \hat p_2) \mp z_{1-\alpha/2}\sqrt{\frac{\hat p_1\hat q_1}{n_1} + \frac{\hat p_2\hat q_2}{n_2}} \]

dir.

İspat

\(z = z_{1-\alpha/2}\) ve \(\sigma_D = \sqrt{p_1q_1/n_1 + p_2q_2/n_2}\) yazalım. Önerme 15.2 gereğince

\[ P\bigg(-z < \frac{(\hat p_1 - \hat p_2) - (p_1 - p_2)}{\sigma_D} < z\bigg) \approx 1 - \alpha. \]

Eşitsizliği pozitif \(\sigma_D\) ile çarpıp tek oranda yaptığımız gibi düzenleyelim:

\[ P\Big((\hat p_1 - \hat p_2) - z\sigma_D < p_1 - p_2 < (\hat p_1 - \hat p_2) + z\sigma_D\Big) \approx 1 - \alpha. \]

Bu sınırlar bilinmeyen \(p_1\) ve \(p_2\)’yi içerdiğinden istatistik değildir. Parametreleri nokta tahmin edicileri \(\hat p_1 = X_1/n_1\) ve \(\hat p_2 = X_2/n_2\) ile değiştiririz. Büyük sayılar yasasına göre (Sonuç 8.1) \(\hat p_i\), \(p_i\)’ye olasılıkta yakınsadığından tahmin edilmiş standart sapmanın \(\sigma_D\)’ye oranı olasılıkta \(1\)’e yakınsar; tek oranın ispatındaki gibi Slutsky teoremiyle standartlaştırılmış fark yine yaklaşık \(N(0,1)\) dağılır ve olasılık yaklaşık \(1 - \alpha\) kalır. Böylece teoremdeki sınırlar bulunur.

\(\blacksquare\)

Yani iki oranın farkı için aralık da “tahmin \(\pm\) hata payı” biçimindedir; iki örneklem bağımsız olduğundan hata payının karekökü altında iki örneklemin varyans tahminleri toplanır. Aralığın yorumunda \(0\) önemlidir: aralık \(0\)’ı içeriyorsa veriler \(p_1 = p_2\) ile çelişmez; aralığın tamamı \(0\)’ın bir tarafındaysa oranlardan biri öbüründen belirgin biçimde büyüktür.

Örnek 15.4 (İki Makinenin Kusur Oranları) Birinci makinenin ürettiği parçalardan rastgele seçilen \(200\) parçanın \(18\)’i, ikinci makinenin ürettiklerinden rastgele seçilen \(250\) parçanın \(15\)’i kusurlu çıkıyor. Kusur oranlarının farkı \(p_1 - p_2\) için \(\%95\)’lik bir güven aralığı bulunuz.

Çözüm

Örneklem oranları.

\[ \hat p_1 = \frac{18}{200} = 0{,}09, \qquad \hat p_2 = \frac{15}{250} = 0{,}06, \qquad \hat p_1 - \hat p_2 = 0{,}03. \]

Başarı ve başarısızlık sayıları (\(18\), \(182\), \(15\), \(235\)) \(5\)’ten büyük olduğundan normal yaklaşım kullanılabilir.

Standart sapma tahmini.

\[ \begin{aligned} \frac{\hat p_1\hat q_1}{n_1} &= \frac{0{,}09 \cdot 0{,}91}{200} = 0{,}0004095, \\[1mm] \frac{\hat p_2\hat q_2}{n_2} &= \frac{0{,}06 \cdot 0{,}94}{250} = 0{,}0002256, \\[1mm] \sqrt{0{,}0004095 + 0{,}0002256} &= \sqrt{0{,}0006351} \approx 0{,}02520. \end{aligned} \]

Aralık. \(z_{0{,}975} = 1{,}96\) (standart normal tablosu) olduğundan hata payı \(E = 1{,}96 \cdot 0{,}02520 \approx 0{,}0494\)’tür ve

\[ 0{,}03 - 0{,}0494 < p_1 - p_2 < 0{,}03 + 0{,}0494 \quad\Longrightarrow\quad -0{,}0194 < p_1 - p_2 < 0{,}0794. \]

Aralık \(0\)’ı içerir. Örneklemde birinci makinenin kusur oranı daha yüksek çıksa da bu fark, örneklemden örnekleme doğal olarak oluşabilecek bir farktır; verilere göre iki makinenin kusur oranları eşit olabilir.

\(\blacksquare\)

15.3 Aralık Tahmini Örnekleri

Buraya kadar ortalama, varyans ve oran için ayrı ayrı güven aralıkları kurduk. Bir soruda asıl iş, hangi aralığın kullanılacağına karar vermektir. Aşağıdaki reçete ve tablo bu kararı verir; ardından gelen örnekler her aralık türünü en az bir kez uygular.

İpucuGüven aralığı sorusu üç adımda

1. Parametreyi belirleyin: tek kitlenin ortalaması mı, varyansı mı, oranı mı; yoksa iki kitlenin ortalamaları farkı, varyansları oranı ya da oranları farkı mı?

2. Durumu belirleyin ve dağılımı seçin: kitle varyansı biliniyor mu, örneklem büyük mü, kitleler normal mi, iki varyans eşit kabul ediliyor mu?

Parametre Durum Dağılım Bölüm
\(\mu\) \(\sigma\) biliniyor ya da \(n\) büyük \(Z\) Ortalama
\(\mu\) normal kitle, \(\sigma\) bilinmiyor \(t_{n-1}\) Ortalama
\(\sigma^2\) normal kitle \(\chi^2_{n-1}\) Varyans
\(\sigma_1^2/\sigma_2^2\) iki normal kitle \(F_{n_1-1,\,n_2-1}\) Varyans
\(\mu_1 - \mu_2\) varyanslar biliniyor \(Z\) İki kitle
\(\mu_1 - \mu_2\) bilinmiyor, eşit \(t_{n_1+n_2-2}\) İki kitle
\(\mu_1 - \mu_2\) bilinmiyor, farklı \(t_\nu\) İki kitle
\(p\) \(n\) büyük \(Z\) Teorem 15.1
\(p_1 - p_2\) \(n_1\), \(n_2\) büyük \(Z\) Teorem 15.2

3. Hesaplayıp yorumlayın: tablodan kantili okuyun (Tablolar), sınırları hesaplayın ve aralığın ne söylediğini soru bağlamında yazın.

Örnek 15.5 (Kitle Ortalaması: Parça Uzunluğu) Bir üretim sürecinde üretilen parçaların uzunluklarının standart sapması \(0{,}45\) mm olarak biliniyor. Bir kalite kontrol uzmanı her sabah rastgele seçtiği \(40\) parçayı ölçüyor. Bir gün ölçülen ortalama uzunluk \(35{,}62\) mm olduğuna göre, kitle ortalaması \(\mu\) için \(\%95\) güven düzeyinde bir güven aralığı bulunuz.

Çözüm

Durum. Parametre tek kitlenin ortalaması \(\mu\)’dür ve kitle standart sapması \(\sigma = 0{,}45\) bilinmektedir. Bu durumda \(\bar X\)’in standartlaştırılmışı standart normal dağılıma sahip olduğundan ortalama için \(Z\) aralığı kullanılır:

\[ \bar x - z_{1-\alpha/2}\frac{\sigma}{\sqrt n} < \mu < \bar x + z_{1-\alpha/2}\frac{\sigma}{\sqrt n}. \]

Veriler. \(n = 40\), \(\bar x = 35{,}62\), \(\sigma = 0{,}45\), \(1 - \alpha = 0{,}95\). Buradan \(\alpha/2 = 0{,}025\) ve \(z_{0{,}975} = 1{,}96\) (standart normal tablosu).

Hesap.

\[ \frac{\sigma}{\sqrt n} = \frac{0{,}45}{\sqrt{40}} \approx \frac{0{,}45}{6{,}3246} \approx 0{,}07115, \qquad E = 1{,}96 \cdot 0{,}07115 \approx 0{,}1395. \]

\[ 35{,}62 - 0{,}1395 < \mu < 35{,}62 + 0{,}1395 \quad\Longrightarrow\quad 35{,}48 < \mu < 35{,}76. \]

Yani parçaların ortalama uzunluğu \(\%95\) güvenle \(35{,}48\) mm ile \(35{,}76\) mm arasındadır.

\(\blacksquare\)

Örnek 15.6 (Kitle Ortalaması: İyileşme Süresi) Bir hastalığın tedavisi için yeni bir yöntem geliştiriliyor. Rastgele seçilen \(12\) hasta bu yöntemle tedavi ediliyor ve iyileşinceye kadar geçen süreler (gün) şöyle ölçülüyor:

\[ 10, \ 12, \ 8, \ 9, \ 9, \ 17, \ 9, \ 14, \ 3, \ 7, \ 12, \ 10. \]

İyileşme sürelerinin normal dağıldığını varsayarak ortalama iyileşme süresi \(\mu\) için \(\%95\) güven düzeyinde bir güven aralığı bulunuz.

Çözüm

Durum. Kitle varyansı bilinmiyor ve örneklem küçük; kitle normal olduğundan \(\sigma\) yerine örneklem standart sapması \(S\) kullanılır ve ortalama için \(t\) aralığı kurulur:

\[ \bar x - t_{n-1,\,1-\alpha/2}\frac{s}{\sqrt n} < \mu < \bar x + t_{n-1,\,1-\alpha/2}\frac{s}{\sqrt n}. \]

Örneklem ortalaması. Gözlemlerin toplamı \(120\) olduğundan \(\bar x = 120/12 = 10\).

Örneklem varyansı. Her gözlemin ortalamadan farkının karesi sırasıyla

\[ 0, \ 4, \ 4, \ 1, \ 1, \ 49, \ 1, \ 16, \ 49, \ 9, \ 4, \ 0 \]

ve bunların toplamı \(138\)’dir. Buradan

\[ s^2 = \frac{1}{n-1}\sum_{i=1}^{12}(x_i - \bar x)^2 = \frac{138}{11} \approx 12{,}545, \qquad s \approx 3{,}542. \]

Kantil. Serbestlik derecesi \(n - 1 = 11\)’dir. \(t\) tablosundan \(t_{11,\,0{,}975} = 2{,}201\).

Aralık.

\[ \frac{s}{\sqrt n} = \sqrt{\frac{12{,}545}{12}} \approx 1{,}0225, \qquad E = 2{,}201 \cdot 1{,}0225 \approx 2{,}250. \]

\[ 10 - 2{,}250 < \mu < 10 + 2{,}250 \quad\Longrightarrow\quad 7{,}75 < \mu < 12{,}25. \]

Yani bu yöntemle ortalama iyileşme süresi \(\%95\) güvenle yaklaşık \(7{,}75\) ile \(12{,}25\) gün arasındadır.

\(\blacksquare\)

Örnek 15.7 (Kitle Ortalaması: Tansiyon Ölçümleri) Yeni bir ilaç \(8\) kalp hastası üzerinde deneniyor. Hastaların tansiyonlarının ortalaması \(11\), örneklem standart sapması \(3{,}207\) olarak bulunuyor. Tansiyonların normal dağıldığını varsayarak kitle ortalaması \(\mu\) için \(\%95\) güven düzeyinde bir güven aralığı bulunuz.

Çözüm

Durum. \(\sigma\) bilinmiyor; verilen \(3{,}207\) örneklemden hesaplanmış standart sapma \(s\)’dir. Örneklem küçük ve kitle normal olduğundan \(t\) aralığı kullanılır.

Veriler. \(n = 8\), \(\bar x = 11\), \(s = 3{,}207\), \(1 - \alpha = 0{,}95\). Serbestlik derecesi \(7\) ve \(t\) tablosundan \(t_{7,\,0{,}975} = 2{,}365\).

Hesap.

\[ \frac{s}{\sqrt n} = \frac{3{,}207}{\sqrt 8} \approx \frac{3{,}207}{2{,}8284} \approx 1{,}1339, \qquad E = 2{,}365 \cdot 1{,}1339 \approx 2{,}682. \]

\[ 11 - 2{,}682 < \mu < 11 + 2{,}682 \quad\Longrightarrow\quad 8{,}32 < \mu < 13{,}68. \]

\(\blacksquare\)

Örnek 15.8 (Kitle Ortalaması: Büyük Örneklemde Normal Yaklaşım) Bir önceki örnekteki ilaç \(8\) yerine \(136\) kalp hastası üzerinde denenseydi ve yine ortalama \(11\), örneklem standart sapması \(3{,}207\) bulunsaydı, \(\mu\) için \(\%95\)’lik güven aralığı ne olurdu?

Çözüm

Durum. \(\sigma\) yine bilinmiyor, ama bu kez \(n = 136\) büyüktür. Serbestlik derecesi \(135\) olan \(t\) dağılımı standart normale çok yakındır: \(t_{135,\,0{,}975}\) değeri \(t\) tablosunda \(\nu = 120\) satırındaki \(1{,}980\) ile \(\nu = \infty\) satırındaki \(1{,}960\) arasındadır. Bu yüzden genel kural olarak \(n > 30\) iken \(t\) kantili yerine \(z\) kantili kullanılır (ortalama için aralık tahmini): \(z_{0{,}975} = 1{,}96\).

Hesap.

\[ \frac{s}{\sqrt n} = \frac{3{,}207}{\sqrt{136}} \approx \frac{3{,}207}{11{,}6619} \approx 0{,}2750, \qquad E = 1{,}96 \cdot 0{,}2750 \approx 0{,}539. \]

\[ 11 - 0{,}539 < \mu < 11 + 0{,}539 \quad\Longrightarrow\quad 10{,}46 < \mu < 11{,}54. \]

Kesin \(t_{135,\,0{,}975} \approx 1{,}978\) değeriyle hesaplansa da iki ondalıkta aynı aralık çıkar. Örneklem \(17\) katına çıkınca aralığın genişliği \(5{,}36\)’dan \(1{,}08\)’e düştü: hem \(\sqrt n\) büyüdü hem de kantil \(2{,}365\)’ten \(1{,}96\)’ya indi.

\(\blacksquare\)

Örnek 15.9 (Ortalamalar Farkı: Varyanslar Biliniyor) Uçak kanatlarında kullanılan iki tür alüminyum direğin dayanıklılığı test ediliyor. Sonuçlar aşağıdadır:

Direk Denek sayısı Örneklem ortalaması Kitle varyansı
A \(n_1 = 18\) \(\bar x_1 = 200\) \(\sigma_1^2 = 15\)
B \(n_2 = 20\) \(\bar x_2 = 190\) \(\sigma_2^2 = 12\)

Dayanıklılıkların normal dağıldığını varsayarak kitle ortalamaları farkı \(\mu_1 - \mu_2\) için \(\%90\) güven düzeyinde bir güven aralığı bulunuz.

Çözüm

Durum. İki bağımsız normal kitlenin ortalamaları karşılaştırılıyor ve kitle varyansları biliniyor. Bu durumda \(\bar X_1 - \bar X_2\), ortalaması \(\mu_1 - \mu_2\) ve varyansı \(\sigma_1^2/n_1 + \sigma_2^2/n_2\) olan bir normal dağılıma sahip olduğundan iki ortalamanın farkı için \(Z\) aralığı kullanılır:

\[ (\bar x_1 - \bar x_2) \mp z_{1-\alpha/2}\sqrt{\frac{\sigma_1^2}{n_1} + \frac{\sigma_2^2}{n_2}}. \]

Kantil. \(1 - \alpha = 0{,}90\) ise \(1 - \alpha/2 = 0{,}95\)’tir. Standart normal tablosunda \(0{,}4500\) değeri \(1{,}64\) (\(0{,}4495\)) ile \(1{,}65\) (\(0{,}4505\)) arasının tam ortasındadır: \(z_{0{,}95} = 1{,}645\).

Hesap.

\[ \begin{aligned} \sqrt{\frac{15}{18} + \frac{12}{20}} &= \sqrt{0{,}8333 + 0{,}6} = \sqrt{1{,}4333} \approx 1{,}1972, \\[1mm] E &= 1{,}645 \cdot 1{,}1972 \approx 1{,}969. \end{aligned} \]

\(\bar x_1 - \bar x_2 = 10\) olduğundan

\[ 10 - 1{,}969 < \mu_1 - \mu_2 < 10 + 1{,}969 \quad\Longrightarrow\quad 8{,}03 < \mu_1 - \mu_2 < 11{,}97. \]

Aralığın tamamı pozitiftir: \(\%90\) güvenle A direklerinin ortalama dayanıklılığı B direklerininkinden \(8\) ile \(12\) birim kadar fazladır.

\(\blacksquare\)

Örnek 15.10 (Ortalamalar Farkı: Varyanslar Eşit Kabul Ediliyor) A markası otomobil lastiklerinden \(7\), B markasından \(10\) lastik seçilip aynı iklim ve yol koşullarında dayanma süreleri ölçülüyor:

\[ \begin{aligned} \text{A:}&\quad 10, \ 27, \ 7, \ 15, \ 18, \ 20, \ 8, \\ \text{B:}&\quad 14, \ 12, \ 16, \ 14, \ 15, \ 13, \ 17, \ 11, \ 16, \ 12. \end{aligned} \]

Dayanma sürelerinin iki marka için de normal dağıldığı ve koşullar aynı olduğundan kitle varyanslarının eşit olduğu kabul ediliyor. \(\mu_1 - \mu_2\) için \(\%90\) güven düzeyinde bir güven aralığı bulunuz.

Çözüm

Durum. Kitle varyansları bilinmiyor fakat eşit kabul ediliyor. Bu durumda iki örneklemin varyansları birleştirilerek ortak varyans tahmini

\[ s_p^2 = \frac{(n_1 - 1)s_1^2 + (n_2 - 1)s_2^2}{n_1 + n_2 - 2} \]

hesaplanır ve birleştirilmiş \(t\) aralığı kullanılır:

\[ (\bar x_1 - \bar x_2) \mp t_{n_1+n_2-2,\,1-\alpha/2}\; s_p\sqrt{\frac{1}{n_1} + \frac{1}{n_2}}. \]

A markası. Toplam \(105\), \(\bar x_1 = 105/7 = 15\). Ortalamadan farkların kareleri \(25, 144, 64, 0, 9, 25, 49\) ve toplamları \(316\); \(s_1^2 = 316/6 \approx 52{,}67\).

B markası. Toplam \(140\), \(\bar x_2 = 140/10 = 14\). Farkların kareleri \(0, 4, 4, 0, 1, 1, 9, 9, 4, 4\) ve toplamları \(36\); \(s_2^2 = 36/9 = 4\).

Ortak varyans.

\[ s_p^2 = \frac{6 \cdot \frac{316}{6} + 9 \cdot 4}{7 + 10 - 2} = \frac{316 + 36}{15} = \frac{352}{15} \approx 23{,}467, \qquad s_p \approx 4{,}844. \]

Kantil. Serbestlik derecesi \(7 + 10 - 2 = 15\) ve \(1 - \alpha/2 = 0{,}95\); \(t\) tablosundan \(t_{15,\,0{,}95} = 1{,}753\).

Aralık.

\[ \begin{aligned} E &= 1{,}753 \cdot 4{,}844 \cdot \sqrt{\frac{1}{7} + \frac{1}{10}} = 1{,}753 \cdot 4{,}844 \cdot \sqrt{\frac{17}{70}} \\[1mm] &\approx 1{,}753 \cdot 4{,}844 \cdot 0{,}4928 \approx 4{,}185. \end{aligned} \]

\(\bar x_1 - \bar x_2 = 1\) olduğundan

\[ 1 - 4{,}185 < \mu_1 - \mu_2 < 1 + 4{,}185 \quad\Longrightarrow\quad -3{,}18 < \mu_1 - \mu_2 < 5{,}18. \]

Aralık \(0\)’ı içerir; verilere göre iki markanın ortalama dayanma süreleri eşit olabilir.

Aşağıdaki şekil verilere bir kez daha bakmanın yararını gösteriyor: ortalamalar yakın, ama A markasının gözlemleri çok daha geniş bir alana yayılmış.

ort. 15 A markası ort. 14 B markası 5 10 15 20 25 gün
İki lastik markasının dayanma süreleri. Ortalamalar (15 ve 14) birbirine yakın, fakat A markasının gözlemleri B markasınınkilerden çok daha geniş bir alana yayılmış.

Örneklem varyanslarının oranı \(s_1^2/s_2^2 \approx 13{,}2\) gibi büyük bir sayıdır ve eşit varyans varsayımını kuşkulu kılar. Varsayım bırakılırsa bir sonraki örnekteki gibi farklı varyanslar için \(t\) aralığı kullanılır. Bu veride o aralığın serbestlik derecesi \(\nu \approx 6{,}64\), yani \(6\) çıkar; \(t_{6,\,0{,}95} = 1{,}943\) ve \(\sqrt{s_1^2/7 + s_2^2/10} \approx 2{,}815\) ile aralık \(-4{,}47 < \mu_1 - \mu_2 < 6{,}47\) olur. Varsayım değişince aralık genişledi, ama sonuç aynı kaldı: aralık yine \(0\)’ı içeriyor.

\(\blacksquare\)

Örnek 15.11 (Ortalamalar Farkı: Tedavi Yöntemleri, Eşit Varyanslar) Bir hastalığa yakalanmış hastalardan rastgele seçilen \(8\)’i cerrahi yöntemle, \(9\)’u ilaçla tedavi ediliyor. İyileşme süreleri (gün) şöyledir:

\[ \begin{aligned} \text{cerrahi:}&\quad 15, \ 15, \ 20, \ 18, \ 20, \ 17, \ 22, \ 17, \\ \text{ilaç:}&\quad 12, \ 15, \ 7, \ 10, \ 9, \ 18, \ 12, \ 16, \ 9. \end{aligned} \]

İki kitlede iyileşme sürelerinin normal dağıldığını ve kitle varyanslarının eşit olduğunu varsayarak \(\mu_1 - \mu_2\) için \(\%99\) güven düzeyinde bir güven aralığı bulunuz.

Çözüm

Örneklem ortalamaları. Cerrahi grubun toplamı \(144\), ilaç grubunun toplamı \(108\)’dir:

\[ \bar x_1 = \frac{144}{8} = 18, \qquad \bar x_2 = \frac{108}{9} = 12, \qquad \bar x_1 - \bar x_2 = 6. \]

Örneklem varyansları. Cerrahi grupta ortalamadan farkların kareleri \(9, 9, 4, 0, 4, 1, 16, 1\) ve toplamları \(44\); ilaç grubunda \(0, 9, 25, 4, 9, 36, 0, 16, 9\) ve toplamları \(108\)’dir:

\[ s_1^2 = \frac{44}{7} \approx 6{,}286, \qquad s_2^2 = \frac{108}{8} = 13{,}5. \]

Ortak varyans. Varyanslar eşit kabul edildiğinden (birleştirilmiş \(t\) aralığı)

\[ s_p^2 = \frac{7 \cdot \frac{44}{7} + 8 \cdot 13{,}5}{8 + 9 - 2} = \frac{44 + 108}{15} = \frac{152}{15} \approx 10{,}133, \qquad s_p \approx 3{,}183. \]

Kantil. \(1 - \alpha = 0{,}99\) ise \(1 - \alpha/2 = 0{,}995\); serbestlik derecesi \(15\) ve \(t\) tablosundan \(t_{15,\,0{,}995} = 2{,}947\).

Aralık.

\[ E = 2{,}947 \cdot 3{,}183 \cdot \sqrt{\frac{1}{8} + \frac{1}{9}} \approx 2{,}947 \cdot 3{,}183 \cdot 0{,}4859 \approx 4{,}558, \]

\[ 6 - 4{,}558 < \mu_1 - \mu_2 < 6 + 4{,}558 \quad\Longrightarrow\quad 1{,}44 < \mu_1 - \mu_2 < 10{,}56. \]

Aralığın tamamı pozitiftir: \(\%99\) güvenle cerrahi tedavide iyileşme ilaç tedavisine göre ortalama \(1{,}44\) ile \(10{,}56\) gün daha uzun sürer.

\(\blacksquare\)

Örnek 15.12 (Ortalamalar Farkı: Tedavi Yöntemleri, Farklı Varyanslar) Bir önceki örnekteki iyileşme süreleri için (\(8\) cerrahi, \(9\) ilaç hastası) kitle varyanslarının eşit olduğu varsayılmasın. Kitleler yine normal olmak üzere \(\mu_1 - \mu_2\) için \(\%99\) güven düzeyinde bir güven aralığı bulunuz.

Çözüm

Durum. Varyanslar bilinmiyor ve farklı kabul ediliyor. Bu durumda her örneklemin kendi varyansı kullanılır ve farklı varyanslar için \(t\) aralığı kurulur:

\[ (\bar x_1 - \bar x_2) \mp t_{\nu,\,1-\alpha/2}\sqrt{\frac{s_1^2}{n_1} + \frac{s_2^2}{n_2}}, \qquad \nu = \frac{\Big(\dfrac{s_1^2}{n_1} + \dfrac{s_2^2}{n_2}\Big)^2}{\dfrac{(s_1^2/n_1)^2}{n_1 - 1} + \dfrac{(s_2^2/n_2)^2}{n_2 - 1}}. \]

Serbestlik derecesi tam sayı çıkmazsa aşağı yuvarlanır; bu, kantili biraz büyütür ve aralığı güvenli tarafta tutar.

Bileşenler. Önceki örnekten \(\bar x_1 - \bar x_2 = 6\), \(s_1^2 = 44/7\) ve \(s_2^2 = 13{,}5\):

\[ \frac{s_1^2}{n_1} = \frac{44/7}{8} = \frac{11}{14} \approx 0{,}7857, \qquad \frac{s_2^2}{n_2} = \frac{13{,}5}{9} = 1{,}5, \qquad \text{toplam } \frac{16}{7} \approx 2{,}2857. \]

Serbestlik derecesi.

\[ \nu = \frac{2{,}2857^2}{\dfrac{0{,}7857^2}{7} + \dfrac{1{,}5^2}{8}} \approx \frac{5{,}2245}{0{,}0882 + 0{,}2813} \approx \frac{5{,}2245}{0{,}3694} \approx 14{,}14, \]

aşağı yuvarlanınca \(\nu = 14\). \(t\) tablosundan \(t_{14,\,0{,}995} = 2{,}977\).

Aralık.

\[ E = 2{,}977\sqrt{2{,}2857} \approx 2{,}977 \cdot 1{,}5119 \approx 4{,}501, \]

\[ 6 - 4{,}501 < \mu_1 - \mu_2 < 6 + 4{,}501 \quad\Longrightarrow\quad 1{,}50 < \mu_1 - \mu_2 < 10{,}50. \]

Eşit varyans varsayımıyla bulunan \((1{,}44; \ 10{,}56)\) aralığına çok yakın bir sonuç çıktı. Burada örneklem varyansları (\(6{,}29\) ve \(13{,}5\)) birbirinden çok uzak olmadığından iki yöntem neredeyse aynı sonucu verir; sonuç yine cerrahi tedavide iyileşmenin daha uzun sürdüğüdür.

\(\blacksquare\)

Örnek 15.13 (Kitle Varyansı: Yaş Dağılımı) Bir sosyolog bisiklet hırsızlığı üzerine bir araştırmada \(8\) çocuğu inceliyor. Çocukların yaş ortalaması \(16{,}9\), örneklem standart sapması \(5{,}2\) bulunuyor. Yaşların normal dağıldığını varsayarak kitle varyansı \(\sigma^2\) için \(\%95\) güven düzeyinde bir güven aralığı bulunuz.

Çözüm

Durum. Soru ortalamayı değil, yaşların değişkenliğini, yani \(\sigma^2\)’yi soruyor; örneklem ortalaması bu hesapta kullanılmaz. Normal kitlede \((n-1)S^2/\sigma^2 \sim \chi^2_{n-1}\) olduğundan varyans için \(\chi^2\) aralığı kullanılır:

\[ P\bigg(\chi^2_{n-1,\,\alpha/2} < \frac{(n-1)S^2}{\sigma^2} < \chi^2_{n-1,\,1-\alpha/2}\bigg) = 1 - \alpha \]

eşitsizliği \(\sigma^2\) için çözülünce (terslerini alırken eşitsizlikler yön değiştirir)

\[ \frac{(n-1)s^2}{\chi^2_{n-1,\,1-\alpha/2}} < \sigma^2 < \frac{(n-1)s^2}{\chi^2_{n-1,\,\alpha/2}}. \]

Kantiller. \(n - 1 = 7\), \(\alpha/2 = 0{,}025\). \(\chi^2\) tablosundan \(\chi^2_{7,\,0{,}025} = 1{,}69\) ve \(\chi^2_{7,\,0{,}975} = 16{,}01\). \(\chi^2\) dağılımı simetrik olmadığından iki kantil ayrı ayrı okunur:

0 5 10 20 x 1,69 16,01 0,95 0,025 0,025 χ², 7 serbestlik derecesi
7 serbestlik dereceli χ² yoğunluğu. Solunda 0,025 alan bırakan nokta 1,69, solunda 0,975 alan bırakan nokta 16,01'dir; ikisinin arasında 0,95 alan kalır. Eğri simetrik olmadığından iki nokta ortalama 7'ye eşit uzaklıkta değildir.

Hesap. \(s^2 = 5{,}2^2 = 27{,}04\) ve \((n-1)s^2 = 7 \cdot 27{,}04 = 189{,}28\). Buradan

\[ \frac{189{,}28}{16{,}01} < \sigma^2 < \frac{189{,}28}{1{,}69} \quad\Longrightarrow\quad 11{,}82 < \sigma^2 < 112{,}00. \]

Karekök alınırsa standart sapma için \(3{,}44 < \sigma < 10{,}58\) bulunur. Yalnız \(8\) gözlemle varyans çok belirsiz tahmin edilir; aralığın üst ucu alt ucunun yaklaşık \(9{,}5\) katıdır.

\(\blacksquare\)

Örnek 15.14 (Varyanslar Oranı: Yetenek Testi) Liseyi bitirmiş \(13\) erkek ve \(16\) kız öğrenciye bir genel yetenek testi uygulanıyor. Erkeklerin not ortalaması \(82\), örneklem standart sapması \(8\); kızların not ortalaması \(78\), örneklem standart sapması \(7\)’dir. \(\sigma_1^2\) ve \(\sigma_2^2\) sırasıyla erkek ve kız öğrenci kitlelerinin varyansları olmak üzere, notların normal dağıldığını varsayarak \(\sigma_1^2/\sigma_2^2\) için \(\%90\)’lık bir güven aralığı bulunuz.

Çözüm

Durum. İki normal kitlenin varyansları karşılaştırılıyor. \(\nu_1 = n_1 - 1\) ve \(\nu_2 = n_2 - 1\) olmak üzere

\[ F = \frac{S_1^2/\sigma_1^2}{S_2^2/\sigma_2^2} \sim F_{\nu_1,\nu_2} \]

olduğundan varyanslar oranı için \(F\) aralığı kullanılır.

\[ P\big(F_{\nu_1,\nu_2,\,\alpha/2} < F < F_{\nu_1,\nu_2,\,1-\alpha/2}\big) = 1 - \alpha \]

eşitsizliği \(\sigma_1^2/\sigma_2^2\) için çözülür ve \(F_{\nu_1,\nu_2,\,\alpha/2} = 1/F_{\nu_2,\nu_1,\,1-\alpha/2}\) kullanılırsa

\[ \frac{s_1^2}{s_2^2}\cdot\frac{1}{F_{\nu_1,\nu_2,\,1-\alpha/2}} < \frac{\sigma_1^2}{\sigma_2^2} < \frac{s_1^2}{s_2^2}\cdot F_{\nu_2,\nu_1,\,1-\alpha/2} \]

bulunur.

Veriler. \(n_1 = 13\), \(n_2 = 16\), dolayısıyla \(\nu_1 = 12\), \(\nu_2 = 15\). \(s_1^2 = 64\), \(s_2^2 = 49\) ve \(s_1^2/s_2^2 = 64/49 \approx 1{,}3061\).

Kantiller. \(1 - \alpha = 0{,}90\) ise \(1 - \alpha/2 = 0{,}95\). \(F\) tablosundan \(F_{12,15,\,0{,}95} = 2{,}48\) ve \(F_{15,12,\,0{,}95} = 2{,}62\). Sol kuyruk kantili \(F_{12,15,\,0{,}05} = 1/2{,}62 \approx 0{,}382\) olur:

0 1 2 3 x 0,382 2,48 0,90 0,05 0,05 F(12, 15)
(12, 15) serbestlik dereceli F yoğunluğu. Solunda 0,95 alan bırakan nokta 2,48, solunda 0,05 alan bırakan nokta 1/2,62 ≈ 0,382'dir (2,62, serbestlik dereceleri yer değiştirmiş F(15, 12) dağılımının 0,95 kantilidir); aralarında 0,90 alan kalır.

Aralık.

\[ \frac{1{,}3061}{2{,}48} < \frac{\sigma_1^2}{\sigma_2^2} < 1{,}3061 \cdot 2{,}62 \quad\Longrightarrow\quad 0{,}527 < \frac{\sigma_1^2}{\sigma_2^2} < 3{,}422. \]

Aralık \(1\)’i içerir; verilere göre iki kitlenin not varyansları eşit olabilir.

\(\blacksquare\)

Örnek 15.15 (Varyanslar Oranı: Mısır Verimi) İki çeşit mısır aynı büyüme koşullarında sırasıyla \(7\) ve \(13\) dönümlük alanlara ekiliyor. Dönüm başına verimlerin (kg) örneklem varyansı birinci çeşit için \(6{,}5\), ikinci çeşit için \(14{,}4\) bulunuyor. \(\sigma_1^2\) ve \(\sigma_2^2\) çeşitlerin kitle varyansları olmak üzere, verimlerin normal dağıldığını varsayarak \(\sigma_1^2/\sigma_2^2\) için \(\%98\)’lik bir güven aralığı bulunuz.

Çözüm

Durum. Bir önceki örnekteki gibi varyanslar oranı için \(F\) aralığı kullanılır:

\[ \frac{s_1^2}{s_2^2}\cdot\frac{1}{F_{\nu_1,\nu_2,\,1-\alpha/2}} < \frac{\sigma_1^2}{\sigma_2^2} < \frac{s_1^2}{s_2^2}\cdot F_{\nu_2,\nu_1,\,1-\alpha/2}. \]

Veriler. \(n_1 = 7\), \(n_2 = 13\), dolayısıyla \(\nu_1 = 6\), \(\nu_2 = 12\). Oran \(s_1^2/s_2^2 = 6{,}5/14{,}4 \approx 0{,}4514\).

Kantiller. \(1 - \alpha = 0{,}98\) ise \(\alpha/2 = 0{,}01\) ve \(1 - \alpha/2 = 0{,}99\). \(F\) tablosundan \(F_{6,12,\,0{,}99} = 4{,}82\) ve \(F_{12,6,\,0{,}99} = 7{,}72\).

Aralık.

\[ \frac{0{,}4514}{4{,}82} < \frac{\sigma_1^2}{\sigma_2^2} < 0{,}4514 \cdot 7{,}72 \quad\Longrightarrow\quad 0{,}094 < \frac{\sigma_1^2}{\sigma_2^2} < 3{,}485. \]

Aralık \(1\)’i içerdiğinden verimlerin değişkenliği iki çeşitte eşit olabilir. Örneklemler küçük ve güven düzeyi yüksek olduğundan aralık çok geniştir.

\(\blacksquare\)

Örnek 15.16 (Tek Oran: Ölüm Oranı) Akciğer kanseri olan \(1000\) hasta rastgele seçiliyor ve bunların \(823\)’ünün öldüğü görülüyor. Akciğer kanserli hastalarda ölüm oranı \(p\) için \(\%95\) güven düzeyinde bir güven aralığı bulunuz.

Çözüm

Durum. Her hasta için “öldü” ya da “ölmedi” sonucu olduğundan ölenlerin sayısı binom dağılımına sahiptir ve tek bir oran tahmin ediliyor: Teorem 15.1 kullanılır.

Örneklem oranı. \(\hat p = 823/1000 = 0{,}823\) ve \(\hat q = 0{,}177\). \(n\hat p = 823\) ve \(n\hat q = 177\) olduğundan normal yaklaşım uygundur.

Kantil. \(z_{0{,}975} = 1{,}96\) (standart normal tablosu).

Hesap.

\[ \begin{aligned} \sqrt{\frac{\hat p\hat q}{n}} &= \sqrt{\frac{0{,}823 \cdot 0{,}177}{1000}} = \sqrt{0{,}000145671} \approx 0{,}012069, \\[1mm] E &= 1{,}96 \cdot 0{,}012069 \approx 0{,}0237. \end{aligned} \]

\[ 0{,}823 - 0{,}0237 < p < 0{,}823 + 0{,}0237 \quad\Longrightarrow\quad 0{,}7993 < p < 0{,}8467. \]

Yani akciğer kanserli hastalarda ölüm oranı \(\%95\) güvenle yaklaşık \(\%79{,}9\) ile \(\%84{,}7\) arasındadır.

\(\blacksquare\)

Örnek 15.17 (Oranlar Farkı: Grip Aşısı) Grip aşısının etkisini görmek için rastgele seçilen \(3000\) kişiye aşı yapılıyor ve sonradan bunlardan \(130\)’unun grip olduğu görülüyor. Kontrol grubu olarak seçilen ve aşı yapılmayan \(2500\) kişiden \(170\)’i grip oluyor. \(p_1\) aşılananların, \(p_2\) aşılanmayanların grip olma oranı olmak üzere \(p_1 - p_2\) için \(\%95\) güven düzeyinde bir güven aralığı bulunuz.

Çözüm

Durum. İki bağımsız örneklemde iki oran karşılaştırılıyor: Teorem 15.2 kullanılır.

Örneklem oranları.

\[ \hat p_1 = \frac{130}{3000} \approx 0{,}04333, \qquad \hat p_2 = \frac{170}{2500} = 0{,}068, \qquad \hat p_1 - \hat p_2 \approx -0{,}02467. \]

Standart sapma tahmini.

\[ \begin{aligned} \frac{\hat p_1\hat q_1}{n_1} &= \frac{0{,}04333 \cdot 0{,}95667}{3000} \approx 0{,}00001382, \\[1mm] \frac{\hat p_2\hat q_2}{n_2} &= \frac{0{,}068 \cdot 0{,}932}{2500} \approx 0{,}00002535, \\[1mm] \sqrt{0{,}00001382 + 0{,}00002535} &= \sqrt{0{,}00003917} \approx 0{,}006259. \end{aligned} \]

Aralık. \(z_{0{,}975} = 1{,}96\) ile \(E = 1{,}96 \cdot 0{,}006259 \approx 0{,}01227\) ve

\[ -0{,}02467 - 0{,}01227 < p_1 - p_2 < -0{,}02467 + 0{,}01227, \]

yani \(-0{,}0369 < p_1 - p_2 < -0{,}0124\).

Aralığın tamamı \(0\)’ın solundadır, yani \(p_1 < p_2\): \(\%95\) güvenle aşılananlarda grip oranı aşılanmayanlardakinden \(1{,}2\) ile \(3{,}7\) puan kadar düşüktür. Aşağıdaki şekil bu aralığı, \(0\)’ı içeren iki makine örneğindeki aralıkla karşılaştırıyor.

0 −0,0194 0,0794 iki makine −0,0369 −0,0124 grip aşısı −0,04 −0,02 0 0,02 0,04 0,06 0,08 p1p2
p₁ − p₂ için iki %95'lik güven aralığı. İki makine örneğindeki aralık 0'ı içerir: verilere göre kusur oranları eşit olabilir. Grip aşısı örneğindeki aralığın tamamı 0'ın solundadır: aşılananlarda grip oranı belirgin biçimde daha düşüktür.

\(\blacksquare\)

Örnek 15.18 (Varyanslar Oranı: Ücretlerdeki Değişkenlik) A ve B firmalarında çalışanların ücretlerinin normal dağıldığı kabul ediliyor. A firmasından \(10\), B firmasından \(8\) işçi seçiliyor ve ücretlerin örneklem varyansları sırasıyla \(25\) ve \(20\) birim bulunuyor. \(\alpha = 0{,}10\) olmak üzere iki firmadaki ücretlerin değişkenliğinin farklı olup olmadığına nasıl karar verirsiniz?

Çözüm

Yol. \(\sigma_1^2\) ve \(\sigma_2^2\), A ve B firmalarındaki ücretlerin kitle varyansları olsun. Değişkenliği varyans ölçer; soru \(\sigma_1^2 = \sigma_2^2\) olup olmadığıdır, yani \(\sigma_1^2/\sigma_2^2\) oranının \(1\) olup olmadığı. Bu oran için \(\%100(1-\alpha) = \%90\)’lık bir güven aralığı kurarız. Aralık \(1\)’i içeriyorsa veriler varyansların eşitliğiyle çelişmez; içermiyorsa değişkenlikler farklıdır deriz. (Güven aralığıyla verilen bu karar, Hipotez Testlerine Giriş bölümünde bir teste dönüşecek.)

Aralık. Varyanslar oranı için \(F\) aralığı:

\[ \frac{s_1^2}{s_2^2}\cdot\frac{1}{F_{\nu_1,\nu_2,\,1-\alpha/2}} < \frac{\sigma_1^2}{\sigma_2^2} < \frac{s_1^2}{s_2^2}\cdot F_{\nu_2,\nu_1,\,1-\alpha/2}. \]

\(n_1 = 10\), \(n_2 = 8\) olduğundan \(\nu_1 = 9\), \(\nu_2 = 7\); oran \(s_1^2/s_2^2 = 25/20 = 1{,}25\). \(1 - \alpha/2 = 0{,}95\) için \(F\) tablosundan \(F_{9,7,\,0{,}95} = 3{,}68\) ve \(F_{7,9,\,0{,}95} = 3{,}29\):

\[ \frac{1{,}25}{3{,}68} < \frac{\sigma_1^2}{\sigma_2^2} < 1{,}25 \cdot 3{,}29 \quad\Longrightarrow\quad 0{,}340 < \frac{\sigma_1^2}{\sigma_2^2} < 4{,}113. \]

Karar. Aralık \(1\)’i içerir:

1 0,340 4,113 1,25 0 1 2 3 4 σ1² / σ2²
σ₁²/σ₂² oranı (A ve B firmaları) için %90'lık güven aralığı (0,340; 4,113) ve nokta tahmini 1,25. Aralık 1'i içerdiğinden iki firmanın ücret varyanslarının eşit olması verilerle çelişmez.

Dolayısıyla \(\alpha = 0{,}10\) düzeyinde iki firmadaki ücretlerin değişkenliğinin farklı olduğunu söyleyemeyiz; örneklem varyanslarındaki \(25\) ile \(20\) farkı, bu kadar küçük örneklemlerde tesadüfen oluşabilecek bir farktır.

\(\blacksquare\)

Tek bir oran ve iki oranın farkı için güven aralıklarıyla birlikte ortalama, varyans ve oran için bütün temel aralıkları görmüş olduk. Son örnekte bir aralığın \(1\)’i içerip içermediğine bakarak bir soruya evet ya da hayır yanıtı verdik. Bu fikri sistemli hâle getiren araç hipotez testidir; sıradaki bölüm Hipotez Testlerine Giriş.