13  Ortalama için Aralık Tahmini

Bir parametrenin en iyi tahmin edicisini bulsak bile, bir örneklemden hesaplanan tahmin gerçek değere neredeyse hiçbir zaman tam olarak eşit olmaz. \(\theta\) yerine \(\hat\theta\) kullanmakla yaptığımız \(|\hat\theta - \theta|\) hatasını bilemeyiz, ama yüksek bir olasılıkla ne kadar büyük olabileceğini söyleyebiliriz. Bu yüzden çoğu zaman tek bir sayı yerine, parametreyi yüksek bir olasılıkla kapsayan bir aralık vermek daha kullanışlıdır. Bu yönteme parametrenin aralık tahmini denir. Bu bölümde aralık tahmininin temel kavramlarını tanıyacak ve Örneklem Dağılımları bölümündeki sonuçlarla kitle ortalaması için güven aralıkları kuracağız.

13.1 Güven Aralığı ve Güven Düzeyi

Aralığın uçları örneklemden hesaplanır; dolayısıyla uçlar birer istatistiktir ve örneklemden örnekleme değişir. Tanım bu rastgele aralığın parametreyi kapsama olasılığı üzerine kuruludur.

Tanım 13.1 (Güven Aralığı ve Güven Düzeyi) \(X_1, \ldots, X_n\), \(\theta\) parametreli bir kitleden alınmış bir örneklem ve \(0 < \alpha < 1\) olsun. \(L_1 = L_1(X_1, \ldots, X_n)\) ve \(L_2 = L_2(X_1, \ldots, X_n)\) istatistikleri her \(\theta\) için

\[ P\big(L_1 \le \theta \le L_2\big) = 1 - \alpha \]

koşulunu sağlıyorsa \([L_1, L_2]\) aralığına \(\theta\) için %\(100(1-\alpha)\) düzeyli güven aralığı denir. \(1 - \alpha\) sayısına güven düzeyi (güven katsayısı), \(\alpha\)’ya da hata miktarı denir.

Yani güven düzeyi, aralığı kurma yönteminin parametreyi yakalama olasılığıdır. \(\alpha\) genellikle \(0{,}01\), \(0{,}05\) ya da \(0{,}10\) gibi küçük bir sayı seçilir ve güven düzeyi yüzde olarak söylenir: \(\alpha = 0{,}05\) için %95 güven aralığı. Aralıkta rastgele olan şey uçlardır, \(\theta\) değil: \(\theta\) bilinmeyen ama sabit bir sayıdır. Aynı kitleden çok sayıda örneklem çekip her birinden bir %95 güven aralığı kursaydık, bu aralıkların uzun vadede yaklaşık %95’i \(\theta\)’yı içerirdi. Örneğin %99 güven düzeyinde, \(100\) örneklemden kurulan \(100\) aralığın yaklaşık \(99\)’u \(\theta\)’yı içerir.

μ = 50 45 46 47 48 49 50 51 52 53 54 55 ve güven aralığı
N(50, 16) kitlesinden çekilen 25 ayrı örneklemin (her biri n = 10) her birinden kurulan %95 güven aralığı. Nokta örneklem ortalamasını gösterir. Aralıkların 23 tanesi μ = 50'yi içeriyor, 2 tanesi (turuncu) içermiyor. Uzun vadede aralıkların yaklaşık %95'i μ'yü yakalar.

İyi bir aralık tahmininde iki istek çatışır: aralığın olabildiğince dar olmasını (bilgi verici olsun diye) ve parametreyi kapsama olasılığının olabildiğince yüksek olmasını isteriz. Güven düzeyini artırmak aralığı genişletir; aynı güven düzeyinde aralığı daraltmanın yolu ise daha çok gözlem toplamaktır. Bu dengeyi aşağıdaki formüllerde açıkça göreceğiz.

Örnek 13.1 (Bir Güven Aralığının Doğru Yorumu) Bir paketleme makinesinin doldurduğu paketlerin ortalama ağırlığı \(\mu\) için bir örneklemden %95 güven aralığı \([494{,}38;\ 502{,}22]\) gram bulunuyor. “\(\mu\)’nün \(494{,}38\) ile \(502{,}22\) arasında olma olasılığı \(0{,}95\)’tir” cümlesi doğru mudur? Doğru yorum nedir?

Çözüm

Cümle, tanımın söylediği şey değildir. \(\mu\) sabit bir sayıdır; \(494{,}38\) ve \(502{,}22\) de artık sabit sayılardır. Sabit bir sayının sabit bir aralıkta olup olmaması rastgele bir olay değildir: \(\mu\) ya bu aralıktadır ya da değildir, ama hangisinin doğru olduğunu bilmiyoruz.

\(0{,}95\) olasılığı, veri toplanmadan önceki rastgele aralık \([L_1, L_2]\) hakkındadır: \(P(L_1 \le \mu \le L_2) = 0{,}95\). Doğru yorum şöyledir: “Bu aralık, kullanıldığı her 100 durumdan yaklaşık 95’inde \(\mu\)’yü yakalayan bir yöntemle kurulmuştur.” Yukarıdaki şekilde 25 aralığın 23’ü \(\mu\)’yü içeriyor; tek bir aralığa bakarak onun o 23’ten biri mi, yoksa ıskalayan 2’den biri mi olduğunu söyleyemeyiz. Güvenimiz tek aralığa değil, yönteme duyulan güvendir.

\(\blacksquare\)

Güven aralığı kurmanın genel yolu hep aynıdır: içinde bilinmeyen parametreyi taşıyan ve dağılımı parametreye bağlı olmayan bir büyüklük bulunur, bu büyüklük dağılımının iki kantili arasına sıkıştırılır, sonra eşitsizlikler parametre için çözülür. Bu bölümde yöntemi kitle ortalaması \(\mu\)’ye, önce kitle varyansı \(\sigma^2\) bilinirken, sonra bilinmezken uygulayacağız. Aynı yöntemle Varyans ve İki Kitle İçin Aralık Tahmini bölümünde \(\sigma^2\), iki varyansın oranı \(\sigma_1^2/\sigma_2^2\) ve iki ortalamanın farkı \(\mu_1 - \mu_2\) için, Oran için Aralık Tahmini bölümünde de oran \(p\) ve iki oranın farkı \(p_1 - p_2\) için aralıklar kuracağız.

13.2 Varyans Bilindiğinde Kitle Ortalaması İçin Güven Aralığı

Kitle ortalamasının doğal tahmin edicisi örneklem ortalaması \(\bar X\)’tir; güven aralığını onun dağılımı üzerine kuracağız. Kitle \(N(\mu, \sigma^2)\) dağılımlıysa her \(n\) için tam olarak

\[ \bar X \sim N\left(\mu, \frac{\sigma^2}{n}\right) \]

dir (Teorem 7.4). Kitle normal değilse ama merkezi limit teoreminin (Teorem 8.5) koşullarını sağlıyorsa (varyansı sonlu ve pozitif, moment üreten fonksiyonu \(0\)’ın bir komşuluğunda var), bu teorem aynı sonucun büyük \(n\) için yaklaşık olarak geçerli olduğunu söyler. Her iki durumda da standartlaştırılmış ortalama

\[ Z = \frac{\bar X - \mu}{\sigma/\sqrt n} \]

(tam ya da yaklaşık olarak) standart normal dağılımlıdır. \(Z\) bilinmeyen \(\mu\)’yü içerir ama dağılımı \(\mu\)’ye bağlı değildir; aradığımız büyüklük budur. Kantiller için standart normal kantil gösterimini kullanacağız (Tanım 5.1): \(z_p\), solunda \(p\) alan kalan noktadır ve simetri nedeniyle \(z_{1-p} = -z_p\)’dir. Özel olarak \(z_{\alpha/2} = -z_{1-\alpha/2}\).

Teorem 13.1 (Varyans Bilindiğinde Ortalama İçin Güven Aralığı) \(X_1, \ldots, X_n\), \(N(\mu, \sigma^2)\) dağılımlı bir kitleden alınmış bir örneklem ve \(\sigma\) bilinen bir sayı olsun. \(0 < \alpha < 1\) için

\[ \left[\bar X - z_{1-\alpha/2}\,\frac{\sigma}{\sqrt n},\ \ \bar X + z_{1-\alpha/2}\,\frac{\sigma}{\sqrt n}\right] \]

aralığı \(\mu\) için %\(100(1-\alpha)\) düzeyli bir güven aralığıdır. Kitle normal değilse ama Teorem 8.5 koşullarını sağlıyorsa aralık, büyük \(n\) için yaklaşık olarak %\(100(1-\alpha)\) düzeylidir.

0 z z1−α/2 z1−α/2 1 − α α/2 α/2
Standart normal eğrisinin ortasında 1 − α alan bırakan iki nokta: −z(1−α/2) ve z(1−α/2). Her kuyrukta α/2 alan kalır. Z = (X̄ − μ)/(σ/√n) bu iki nokta arasına 1 − α olasılıkla düşer.
İspat

Kısaltma için \(c = z_{1-\alpha/2}\) diyelim. \(Z = \frac{\bar X - \mu}{\sigma/\sqrt n} \sim N(0,1)\) olduğundan ve \(Z\) sürekli olduğundan

\[ P(-c \le Z \le c) = \Phi(c) - \Phi(-c) = \left(1 - \frac{\alpha}{2}\right) - \frac{\alpha}{2} = 1 - \alpha; \]

burada \(\Phi(-c) = \Phi(z_{\alpha/2}) = \frac{\alpha}{2}\) kullanıldı. Şimdi olayı \(\mu\) için çözelim. \(\frac{\sigma}{\sqrt n} > 0\) ile çarpmak eşitsizlikleri korur:

\[ -c \le \frac{\bar X - \mu}{\sigma/\sqrt n} \le c \iff -c\,\frac{\sigma}{\sqrt n} \le \bar X - \mu \le c\,\frac{\sigma}{\sqrt n}. \]

Her tarafı \(-1\) ile çarpıp (eşitsizlikler yön değiştirir) \(\bar X\) ekleyelim:

\[ -c\,\frac{\sigma}{\sqrt n} \le \bar X - \mu \le c\,\frac{\sigma}{\sqrt n} \iff \bar X - c\,\frac{\sigma}{\sqrt n} \le \mu \le \bar X + c\,\frac{\sigma}{\sqrt n}. \]

İki olay aynı olduğundan olasılıkları da aynıdır:

\[ P\left(\bar X - z_{1-\alpha/2}\,\frac{\sigma}{\sqrt n} \le \mu \le \bar X + z_{1-\alpha/2}\,\frac{\sigma}{\sqrt n}\right) = 1 - \alpha. \]

Uçlar yalnız örneklemden ve bilinen \(\sigma\)’dan hesaplanan istatistiklerdir; Tanım 13.1 gereği aralık %\(100(1-\alpha)\) düzeyli bir güven aralığıdır. Kitle normal değilse \(P(-c \le Z \le c)\), merkezi limit teoremi gereği \(n \to \infty\) iken \(1 - \alpha\)’ya yakınsar; aynı çözüm adımları yaklaşık sonucu verir.

\(\blacksquare\)

Yani aralık, \(\bar X\)’in iki yanına \(z_{1-\alpha/2}\) tane standart hata (\(\sigma_{\bar X} = \sigma/\sqrt n\), Tanım 7.10) eklenerek kurulur ve \(\bar X\)’e göre simetriktir. Sık kullanılan güven düzeylerinin kantilleri standart normal tablosundan okunur:

Güven düzeyi \(1 - \alpha\) \(\alpha/2\) \(z_{1-\alpha/2}\)
%90 \(0{,}05\) \(1{,}645\)
%95 \(0{,}025\) \(1{,}96\)
%99 \(0{,}005\) \(2{,}576\)

Örneğin %95 için tabloda \(P(0 \le Z \le z) = 0{,}4750\) aranır ve \(z = 1{,}96\)’da bulunur, çünkü \(P(Z \le 1{,}96) = 0{,}5 + 0{,}4750 = 0{,}975\)’tir.

Aralığın uzunluğu, hangi büyüklüğün aralığı nasıl etkilediğini açıkça gösterir.

Önerme 13.1 (Güven Aralığının Uzunluğu) Teorem 13.1 içindeki aralığın uzunluğu

\[ L = 2\,z_{1-\alpha/2}\,\frac{\sigma}{\sqrt n} \]

dir. Buna göre, öteki büyüklükler sabitken:

1. \(\sigma\) küçüldükçe aralık daralır; \(L\), \(\sigma\) ile doğru orantılıdır.

2. \(n\) büyüdükçe aralık daralır; \(L\), \(\sqrt n\) ile ters orantılıdır.

3. Güven düzeyi \(1 - \alpha\) arttıkça aralık genişler.

İspat

Uzunluk üst uç eksi alt uçtur:

\[ L = \left(\bar X + z_{1-\alpha/2}\frac{\sigma}{\sqrt n}\right) - \left(\bar X - z_{1-\alpha/2}\frac{\sigma}{\sqrt n}\right) = 2\,z_{1-\alpha/2}\,\frac{\sigma}{\sqrt n}. \]

İlk iki iddia formülden doğrudan okunur. Üçüncüsü için: \(1 - \alpha\) artarsa \(\alpha\) azalır ve \(1 - \frac{\alpha}{2}\) artar. \(\Phi\) kesin artan olduğundan kantil \(z_{1-\alpha/2}\) de artar ve \(L\) büyür.

\(\blacksquare\)

Uzunluk \(\bar X\)’e bağlı değildir; yani aralığın ne kadar geniş olacağı, veri toplanmadan önce bilinir. Bu, istenen bir kesinliği sağlamak için kaç gözlem gerektiğini önceden hesaplamamızı sağlar. Bunun için aralığın yarısına bir ad verelim.

Tanım 13.2 (Hata Payı) Bir güven aralığı \(\bar X \mp E\) biçimindeyse, aralığın yarı uzunluğu olan \(E\) sayısına aralığın hata payı denir. Teorem 13.1 içindeki aralık için

\[ E = z_{1-\alpha/2}\,\frac{\sigma}{\sqrt n}. \]

Yani hata payı, belirtilen güven düzeyinde \(\bar X\)’in \(\mu\)’den en çok ne kadar uzaklaşabileceğini söyler: \(|\bar X - \mu| \le E\) olayının olasılığı \(1 - \alpha\)’dır. İstenen bir \(E_0\) sınırı için \(E \le E_0\) koşulu \(\sqrt n \ge \frac{z_{1-\alpha/2}\,\sigma}{E_0}\), yani

\[ n \ge \left(\frac{z_{1-\alpha/2}\,\sigma}{E_0}\right)^2 \]

demektir; \(n\) bu koşulu sağlayan en küçük tam sayı seçilir.

İpucuVaryans bilindiğinde güven aralığı üç adımda

1. Kantili bul. Güven düzeyinden \(\alpha\)’yı belirleyin ve standart normal tablosundan \(z_{1-\alpha/2}\)’yi okuyun.

2. Standart hatayı hesapla. \(\sigma_{\bar X} = \dfrac{\sigma}{\sqrt n}\).

3. Aralığı yaz. \(\bar x \mp z_{1-\alpha/2}\,\sigma_{\bar X}\); sınırları verinin duyarlığına uygun yuvarlayın.

Sıradaki üç örnek aynı veriyi kullanır: bir makinenin doldurduğu paketlerin ağırlığı standart sapması \(\sigma = 10\) gram olan normal dağılıma uyuyor. Rastgele seçilen \(n = 25\) paketin ortalama ağırlığı \(\bar x = 498{,}3\) gram bulunuyor. Standart hata

\[ \sigma_{\bar X} = \frac{\sigma}{\sqrt n} = \frac{10}{\sqrt{25}} = 2 \text{ gram}. \]

Örnek 13.2 (Paket Ağırlığı için Yüzde Doksan Beş Güven Aralığı) Paket ağırlıkları \(N(\mu, 10^2)\) dağılımlı, \(n = 25\) ve \(\bar x = 498{,}3\) gram ise \(\mu\) için %95 güven aralığını bulunuz.

Çözüm

Kantil. \(1 - \alpha = 0{,}95\) için \(\alpha = 0{,}05\), \(1 - \frac{\alpha}{2} = 0{,}975\) ve tablodan \(z_{0{,}975} = 1{,}96\).

Standart hata. \(\sigma_{\bar X} = 2\).

Aralık. Hata payı \(1{,}96 \cdot 2 = 3{,}92\) olduğundan

\[ \big[498{,}3 - 3{,}92;\ 498{,}3 + 3{,}92\big] = \big[494{,}38;\ 502{,}22\big]. \]

Paketlerin ortalama ağırlığı %95 güvenle \(494{,}38\) ile \(502{,}22\) gram arasındadır. Hedef ağırlık \(500\) gram ise bu veri, makinenin hedeften saptığına işaret etmez: \(500\) aralığın içindedir.

\(\blacksquare\)

Örnek 13.3 (Paket Ağırlığı için Yüzde Doksan Güven Aralığı) Paket ağırlıkları \(N(\mu, 10^2)\) dağılımlı, \(n = 25\) ve \(\bar x = 498{,}3\) gram ise \(\mu\) için %90 güven aralığını bulunuz.

Çözüm

\(1 - \alpha = 0{,}90\) için \(1 - \frac{\alpha}{2} = 0{,}95\) ve tablodan \(z_{0{,}95} = 1{,}645\). Standart hata \(2\) olduğundan hata payı \(1{,}645 \cdot 2 = 3{,}29\)’dur:

\[ \big[498{,}3 - 3{,}29;\ 498{,}3 + 3{,}29\big] = \big[495{,}01;\ 501{,}59\big]. \]

Aralık %95 aralığından dardır: daha az güven karşılığında daha kesin bir sonuç elde ettik.

\(\blacksquare\)

Örnek 13.4 (Paket Ağırlığı için Yüzde Doksan Dokuz Güven Aralığı) Paket ağırlıkları \(N(\mu, 10^2)\) dağılımlı, \(n = 25\) ve \(\bar x = 498{,}3\) gram ise \(\mu\) için %99 güven aralığını bulunuz ve üç güven düzeyinin aralıklarını karşılaştırınız.

Çözüm

\(1 - \alpha = 0{,}99\) için \(1 - \frac{\alpha}{2} = 0{,}995\) ve tablodan \(z_{0{,}995} = 2{,}576\). Hata payı \(2{,}576 \cdot 2 = 5{,}152\)’dir:

\[ \big[498{,}3 - 5{,}152;\ 498{,}3 + 5{,}152\big] \approx \big[493{,}15;\ 503{,}45\big]. \]

Üç aralığın uzunlukları \(2 \cdot 3{,}29 = 6{,}58\), \(2 \cdot 3{,}92 = 7{,}84\) ve \(2 \cdot 5{,}152 \approx 10{,}30\) gramdır. Güveni %95’ten %99’a çıkarmak aralığı \(\frac{2{,}576}{1{,}96} \approx 1{,}31\) kat uzatır (Önerme 13.1).

%90 495,01 501,59 %95 494,38 502,22 %99 493,15 503,45 492 494 496 498 500 502 504 = 498,3
Aynı örneklemden (n = 25, σ = 10, x̄ = 498,3) kurulan %90, %95 ve %99 güven aralıkları. Güven düzeyi arttıkça aralık genişler; üçü de x̄'nin çevresinde simetriktir.

\(\blacksquare\)

Örnek 13.5 (İstenen Kesinlik için Gereken Örneklem Hacmi) Paket ağırlıklarının standart sapması \(\sigma = 10\) gramdır. \(\mu\) için %95 güven aralığının yarı uzunluğunun en çok \(2\) gram olması için en az kaç paket tartılmalıdır?

Çözüm

Yarı uzunluk \(E = z_{0{,}975}\,\frac{\sigma}{\sqrt n} = 1{,}96 \cdot \frac{10}{\sqrt n}\)’dir. \(E \le 2\) koşulu

\[ \sqrt n \ge \frac{1{,}96 \cdot 10}{2} = 9{,}8 \quad \Longrightarrow \quad n \ge 9{,}8^2 = 96{,}04 \]

demektir. \(n\) tam sayı olduğundan en az \(n = 97\) paket tartılmalıdır.

Karşılaştırma için: \(25\) paketle yarı uzunluk \(3{,}92\) gramdı (Örnek 13.2). Yarı uzunluğu yaklaşık yarıya indirmek için örneklemi yaklaşık dört katına çıkarmak gerekti; çünkü uzunluk \(\sqrt n\) ile ters orantılıdır. Aynı kesinliği %99 güvenle istersek \(n \ge \big(\frac{2{,}576 \cdot 10}{2}\big)^2 \approx 165{,}9\), yani \(n = 166\) gerekir.

\(\blacksquare\)

Kitle normal olmadığında da, örneklem büyükse aynı aralık yaklaşık olarak kullanılır.

Örnek 13.6 (Ampul Ömrü için Büyük Örneklem Aralığı) Bir fabrikanın ürettiği ampullerin ömrünün dağılımı bilinmiyor, ancak standart sapmasının \(\sigma = 40\) saat olduğu önceki üretimlerden biliniyor. Rastgele seçilen \(64\) ampulün ortalama ömrü \(\bar x = 780\) saat bulunuyor. Ortalama ömür \(\mu\) için %95 güven aralığını bulunuz.

Çözüm

Kitlenin dağılımı normal olmayabilir; ama \(n = 64\) büyük olduğundan merkezi limit teoremi gereği \(\bar X\) yaklaşık \(N\big(\mu, \frac{40^2}{64}\big)\) dağılımlıdır ve Teorem 13.1 içindeki aralık yaklaşık olarak kullanılabilir. Standart hata

\[ \sigma_{\bar X} = \frac{40}{\sqrt{64}} = \frac{40}{8} = 5 \text{ saat}, \]

hata payı \(1{,}96 \cdot 5 = 9{,}8\) saattir. Buna göre yaklaşık %95 güven aralığı

\[ \big[780 - 9{,}8;\ 780 + 9{,}8\big] = \big[770{,}2;\ 789{,}8\big] \text{ saattir.} \]

\(\blacksquare\)

13.3 Varyans Bilinmediğinde Kitle Ortalaması İçin Güven Aralığı

Uygulamada kitle varyansı çoğu zaman bilinmez. Doğal çözüm, \(\sigma^2\) yerine onun yansız tahmin edicisi \(S^2\)’yi, \(\sigma\) yerine de \(S\)’yi kullanmaktır. Ancak \(Z\)’deki \(\sigma\) yerine \(S\) konunca elde edilen

\[ T = \frac{\bar X - \mu}{S/\sqrt n} \]

artık standart normal dağılımlı değildir. Normal bir kitlede \(T \sim t_{n-1}\)’dir (Teorem 12.9). \(T\) de bilinmeyen \(\mu\)’yü içerir ve dağılımı ne \(\mu\)’ye ne de \(\sigma\)’ya bağlıdır; güven aralığını bu kez onunla kuracağız. Kantiller için \(t\) kantil gösterimini kullanacağız (Tanım 12.4): \(P(T \le t_{\nu,\,p}) = p\) ve simetri nedeniyle \(t_{\nu,\,\alpha/2} = -t_{\nu,\,1-\alpha/2}\).

Teorem 13.2 (Varyans Bilinmediğinde Ortalama İçin Güven Aralığı) \(X_1, \ldots, X_n\), \(N(\mu, \sigma^2)\) dağılımlı bir kitleden alınmış bir örneklem (\(n \ge 2\)) ve \(\sigma\) bilinmiyor olsun. \(0 < \alpha < 1\) için

\[ \left[\bar X - t_{n-1,\,1-\alpha/2}\,\frac{S}{\sqrt n},\ \ \bar X + t_{n-1,\,1-\alpha/2}\,\frac{S}{\sqrt n}\right] \]

aralığı \(\mu\) için %\(100(1-\alpha)\) düzeyli bir güven aralığıdır.

İspat

Kısaltma için \(c = t_{n-1,\,1-\alpha/2}\) diyelim. \(T \sim t_{n-1}\) sürekli ve \(0\)’a göre simetrik olduğundan

\[ P(-c \le T \le c) = P(T \le c) - P(T < -c) = \left(1 - \frac{\alpha}{2}\right) - \frac{\alpha}{2} = 1 - \alpha. \]

\(S > 0\) olasılık \(1\) ile doğrudur, dolayısıyla \(\frac{S}{\sqrt n} > 0\) ile çarpmak eşitsizlikleri korur. Teorem 13.1 ispatındaki adımlar \(\sigma\) yerine \(S\) ile aynen tekrarlanır:

\[ -c \le \frac{\bar X - \mu}{S/\sqrt n} \le c \iff \bar X - c\,\frac{S}{\sqrt n} \le \mu \le \bar X + c\,\frac{S}{\sqrt n}. \]

İki olayın olasılıkları eşittir ve uçlar yalnız örneklemden hesaplanır; aralık %\(100(1-\alpha)\) düzeyli bir güven aralığıdır.

\(\blacksquare\)

Yani biçim aynıdır, yalnız iki şey değişir: \(\sigma\) yerine \(S\), \(z\) kantili yerine \(t_{n-1}\) kantili gelir. \(t\) dağılımının kuyrukları daha kalın olduğundan \(t_{n-1,\,1-\alpha/2} > z_{1-\alpha/2}\)’dir. Bu, \(\sigma\)’yı bilmemenin bedelidir: aynı güven düzeyi için aralık daha geniş olur.

Örnek 13.7 (Bardak Hacmi için t Aralığı) Bir kahve makinesinin doldurduğu bardakların hacmi normal dağılıma uyuyor; ortalaması da varyansı da bilinmiyor. Rastgele seçilen \(10\) bardağın hacimleri (mL) şöyle ölçülüyor:

\[ 198,\ 203,\ 201,\ 197,\ 205,\ 199,\ 202,\ 200,\ 196,\ 204. \]

Ortalama hacim \(\mu\) için %95 güven aralığını bulunuz.

Çözüm

Örneklem ortalaması. Gözlemlerin toplamı \(2005\) olduğundan \(\bar x = \frac{2005}{10} = 200{,}5\).

Örneklem varyansı. Ortalamadan sapmalar sırasıyla

\[ -2{,}5;\ 2{,}5;\ 0{,}5;\ -3{,}5;\ 4{,}5;\ -1{,}5;\ 1{,}5;\ -0{,}5;\ -4{,}5;\ 3{,}5 \]

dir (toplamları \(0\)). Karelerinin toplamı

\[ \begin{aligned} &6{,}25 + 6{,}25 + 0{,}25 + 12{,}25 + 20{,}25\\[1mm] &\quad + 2{,}25 + 2{,}25 + 0{,}25 + 20{,}25 + 12{,}25 = 82{,}5 \end{aligned} \]

olduğundan

\[ s^2 = \frac{82{,}5}{10 - 1} \approx 9{,}167, \qquad s \approx 3{,}028. \]

Kantil. \(\sigma\) bilinmediği ve kitle normal olduğu için Teorem 13.2 kullanılır. Serbestlik derecesi \(n - 1 = 9\)’dur ve \(t\) tablosundan \(t_{9,\,0{,}975} = 2{,}262\).

Aralık. Standart hatanın tahmini \(\frac{s}{\sqrt n} = \frac{3{,}028}{\sqrt{10}} \approx 0{,}9574\), hata payı \(2{,}262 \cdot 0{,}9574 \approx 2{,}17\)’dir:

\[ \big[200{,}5 - 2{,}17;\ 200{,}5 + 2{,}17\big] = \big[198{,}33;\ 202{,}67\big] \text{ mL}. \]

\(\sigma\)’nın \(3{,}028\) olduğu biliniyor olsaydı \(z_{0{,}975} = 1{,}96\) ile hata payı \(1{,}96 \cdot 0{,}9574 \approx 1{,}88\) olurdu. \(t\) aralığının daha geniş olmasının nedeni aşağıdaki şekilde görülüyor.

0 2,262 −2,262 1,96 −1,96 t9 N(0, 1)
t₉ yoğunluğu (düz) ve standart normal yoğunluk (kesikli). Her iki kuyrukta 0,025 alan bırakan noktalar t₉ için ±2,262, standart normal için ±1,96'dır. Kalın kuyruklar yüzünden t aralığı daha geniştir.

\(\blacksquare\)

Sıradaki iki örnek Örneklem Dağılımları bölümündeki veriyi kullanır (Örnek 12.20): normal bir kitleden alınan \(n = 16\) gözlemlik örneklemde \(\bar x = 53\) ve \(s = 5\) bulunmuştu. Standart hatanın tahmini \(\frac{s}{\sqrt n} = \frac{5}{4} = 1{,}25\)’tir ve serbestlik derecesi \(15\)’tir.

Örnek 13.8 (On Altı Gözlemle Yüzde Doksan Beş t Aralığı) Normal bir kitleden alınan \(n = 16\) gözlemlik örneklemde \(\bar x = 53\) ve \(s = 5\) ise \(\mu\) için %95 güven aralığını bulunuz. \(\mu = 50\) değeri bu aralıkta mıdır?

Çözüm

\(t\) tablosundan \(t_{15,\,0{,}975} = 2{,}131\). Hata payı \(2{,}131 \cdot 1{,}25 \approx 2{,}66\)’dır:

\[ \big[53 - 2{,}66;\ 53 + 2{,}66\big] = \big[50{,}34;\ 55{,}66\big]. \]

\(50\) bu aralığın dışındadır. Bu, Örnek 12.20 çözümünde bulduğumuz sonuçla uyumludur: \(\mu = 50\) iken \(T\)’nin \(2{,}4\) ya da daha büyük olma olasılığı \(0{,}025\)’ten küçüktü.

\(\blacksquare\)

Örnek 13.9 (On Altı Gözlemle Yüzde Doksan Dokuz t Aralığı) Normal bir kitleden alınan \(n = 16\) gözlemlik örneklemde \(\bar x = 53\) ve \(s = 5\) ise \(\mu\) için %99 güven aralığını bulunuz. \(\mu = 50\) değeri bu aralıkta mıdır?

Çözüm

\(t\) tablosundan \(t_{15,\,0{,}995} = 2{,}947\). Hata payı \(2{,}947 \cdot 1{,}25 \approx 3{,}68\)’dir:

\[ \big[53 - 3{,}68;\ 53 + 3{,}68\big] = \big[49{,}32;\ 56{,}68\big]. \]

Bu kez \(50\) aralığın içindedir. Aynı veri, %95 düzeyinde \(\mu = 50\) ile uyumsuz, %99 düzeyinde ise uyumlu görünüyor: daha yüksek güven, daha geniş ve dolayısıyla daha “hoşgörülü” bir aralık demektir.

\(\blacksquare\)

13.4 Büyük Örneklemlerde Aralık

Serbestlik derecesi büyüdükçe \(t\) dağılımı standart normale yaklaşır (Önerme 12.2). Bu, kantillerin de yaklaştığı anlamına gelir; dolayısıyla büyük örneklemlerde \(t\) kantili yerine \(z\) kantili kullanılabilir.

Önerme 13.2 (t Kantillerinin Normal Kantillere Yakınsaması) Her \(0 < p < 1\) için \(\nu \to \infty\) iken \(t_{\nu,\,p} \to z_p\)’dir.

ν = 9: 2,262 ν = 30: 2,042 ν = 2: 4,303 z0,975 = 1,96 0 10 20 30 40 50 60 ν 2,0 2,5 3,0 3,5 4,0
Serbestlik derecesine göre t(ν; 0,975) kantilleri. ν küçükken kantil 1,96'dan belirgin biçimde büyüktür; ν = 30 civarında fark 0,1'in altına iner ve ν büyüdükçe kantiller z(0,975) = 1,96'ya yaklaşır.
İspat

\(F_\nu\), \(t_\nu\) dağılımının dağılım fonksiyonu olsun. Önce her \(x\) için \(F_\nu(x) \to \Phi(x)\) olduğunu gösterelim. Önerme 12.2 (4) ispatında \(f_\nu(t) = c_\nu\,g_\nu(t)\), \(g_\nu(t) \to e^{-t^2/2}\), \(c_\nu \to \frac{1}{\sqrt{2\pi}}\) ve \(\nu \ge 2\) için \(g_\nu(t) \le \frac{1}{1 + t^2/2}\) bulunmuştu. \(c_\nu\) yakınsak olduğundan sınırlıdır; dolayısıyla \(f_\nu\), bütün doğru üzerinde integrali sonlu olan bir fonksiyonla sınırlanır ve \(f_\nu(t) \to \varphi(t)\)’dir. Baskın yakınsaklık teoremiyle

\[ F_\nu(x) = \int_{-\infty}^x f_\nu(t)\,dt \longrightarrow \int_{-\infty}^x \varphi(t)\,dt = \Phi(x). \]

Şimdi \(\varepsilon > 0\) verilsin. \(\Phi\) kesin artan olduğundan \(\Phi(z_p - \varepsilon) < p < \Phi(z_p + \varepsilon)\)’dir. Yukarıdaki yakınsaklık gereği bir \(\nu_0\)’dan sonra \(F_\nu(z_p - \varepsilon) < p < F_\nu(z_p + \varepsilon)\) olur. \(F_\nu\) sürekli ve kesin artan olduğundan \(F_\nu(t_{\nu,\,p}) = p\) eşitliği \(z_p - \varepsilon < t_{\nu,\,p} < z_p + \varepsilon\) verir. \(\varepsilon\) keyfi olduğundan \(t_{\nu,\,p} \to z_p\).

\(\blacksquare\)

Şekil, yakınsamanın ne kadar hızlı olduğunu gösteriyor: \(t_{30,\,0{,}975} = 2{,}042\) ile \(z_{0{,}975} = 1{,}96\) arasındaki fark yalnız \(0{,}08\)’dir; \(\nu = 100\) için \(t_{100,\,0{,}975} = 1{,}984\)’tür. Bu yüzden uygulamada genel kural şudur: örneklem hacmi \(n > 30\) ise \(\sigma\) bilinmese de \(t_{n-1,\,1-\alpha/2}\) yerine \(z_{1-\alpha/2}\) kullanılabilir ve yaklaşık güven aralığı

\[ \bar X \mp z_{1-\alpha/2}\,\frac{S}{\sqrt n} \]

olur. Büyük örneklemde kitlenin normal olması da gerekmez: merkezi limit teoremi \(\bar X\)’i yaklaşık normal yapar. Ayrıca \(S^2\), \(\sigma^2\)’nin tutarlı bir tahmin edicisidir (Tanım 11.6); büyük \(n\)’de \(S/\sigma\) oranı \(1\)’e yakın olduğundan \(\frac{\bar X - \mu}{S/\sqrt n}\) de yaklaşık \(N(0,1)\) dağılımlıdır. Bu, ispatını vermediğimiz bir yaklaşım kuralıdır.

Örnek 13.10 (Büyük Örneklemde Varyans Bilinmeden Aralık) Bir kitleden alınan \(n = 100\) gözlemlik örneklemde \(\bar x = 12{,}4\) ve \(s = 2{,}5\) bulunuyor. Kitle ortalaması için yaklaşık %95 güven aralığını bulunuz.

Çözüm

\(n = 100 > 30\) olduğundan \(z\) kantili kullanılabilir: \(z_{0{,}975} = 1{,}96\). Standart hatanın tahmini \(\frac{s}{\sqrt n} = \frac{2{,}5}{10} = 0{,}25\), hata payı \(1{,}96 \cdot 0{,}25 = 0{,}49\)’dur:

\[ \big[12{,}4 - 0{,}49;\ 12{,}4 + 0{,}49\big] = \big[11{,}91;\ 12{,}89\big]. \]

Kitle normal olsaydı ve \(t\) kantili kullanılsaydı, \(t_{99,\,0{,}975} \approx 1{,}984\) ile hata payı \(1{,}984 \cdot 0{,}25 \approx 0{,}496\) ve aralık yaklaşık \([11{,}90;\ 12{,}90]\) olurdu. Fark ikinci ondalık basamakta kalır.

\(\blacksquare\)

Hangi aralığın kullanılacağı iki soruya bağlıdır: \(\sigma\) biliniyor mu ve örneklem büyük mü?

Durum Güven aralığı Kantil
Kitle normal, \(\sigma\) biliniyor \(\bar X \mp z_{1-\alpha/2}\,\dfrac{\sigma}{\sqrt n}\) kesin
Kitle normal, \(\sigma\) bilinmiyor \(\bar X \mp t_{n-1,\,1-\alpha/2}\,\dfrac{S}{\sqrt n}\) kesin
Kitle herhangi, \(n > 30\), \(\sigma\) biliniyor \(\bar X \mp z_{1-\alpha/2}\,\dfrac{\sigma}{\sqrt n}\) yaklaşık
Kitle herhangi, \(n > 30\), \(\sigma\) bilinmiyor \(\bar X \mp z_{1-\alpha/2}\,\dfrac{S}{\sqrt n}\) yaklaşık

Kitle ortalaması için güven aralığını kurduk. Aynı yöntemi kitle varyansına ve iki kitlenin karşılaştırılmasına Varyans ve İki Kitle İçin Aralık Tahmini bölümünde uygulayacağız; orada ki-kare ve \(F\) dağılımları da devreye girecek.