Ana içeriğe geç

Orta14 dk

Hipotez testi mantığı

Önkoşul:Güven aralığı

Kanca

Eski öğretim yöntemiyle eğitilen sınıfların ortalaması hep 70 olmuş. Yeni bir yöntemle eğitilen 30 kişilik bir sınıfın ortalaması 73.2 çıktı. Bu, yeni yöntemin gerçekten işe yaradığının kanıtı mı, yoksa bu sınıf tesadüfen biraz şanslı mı çıktı? Hipotez testi, bu soruyu titiz bir şekilde cevaplamanın standart yoludur.

Sezgi

Hipotez testinin mantığı, mahkemedeki “masumiyet karinesine” benzer: önce “hiçbir şey değişmedi” diye varsayarsın (sıfır hipotezi, H0), sonra elindeki kanıtın bu varsayımla ne kadar uyumsuz olduğuna bakarsın. Kanıt yeterince uyumsuzsa, H0’ı reddedip alternatif hipotezi (H1) kabul edersin.

“Yeterince uyumsuz” olmanın ölçüsü p-değeridir: H0 doğru olsaydı, gördüğümüz kadar (veya daha) uç bir sonucu şans eseri görme olasılığı. p-değeri küçükse (“bu kadar uç bir sonuç, sadece şansla, çok nadir olurdu”), H0’a şüpheyle yaklaşırız.

-4-2024z
  • H0 dağılımı
  • Reddetme bölgesi (α)
  • p-değeri alanı
  • Gözlemlenen z

p-değeri = 0.0359, α = 0.05H0 reddedilir

Gözlemlenen z değerini kaydır: çizgi reddetme bölgesine (açık turuncu alan) girdiğinde H0 reddediliyor. α’yı küçültürsen reddetme bölgesi daralıyor — H0’ı reddetmek için daha güçlü kanıt gerekiyor.

Mekanizma

Somut sayılarla ilerleyelim. Eski yöntemin ortalaması 70, std sapması 10 (bilinen). Yeni yöntemle eğitilen 30 kişilik sınıfın ortalaması 73.2.

  1. Hipotezleri kur. H0: gerçek ortalama hâlâ 70 (yeni yöntemin etkisi yok). H1: gerçek ortalama 70’ten büyük (yeni yöntem işe yarıyor).
  2. Test istatistiğini hesapla. Gözlemlenen ortalamanın, H0’ın öngördüğü değerden kaç standart hata uzakta olduğunu ölç.

Test istatistiği

# Eski öğretim yöntemiyle sınıfların ortalaması hep 70, std sapması 10 olmuş (bilinen).
# Yeni bir yöntemle eğitilen 30 kişilik bir sınıfın ortalaması 73.2 çıktı. Bu gerçek bir
# iyileşme mi, yoksa şans eseri mi?
#
# H0 (sıfır hipotezi): yeni yöntemin gerçek etkisi yok, ortalama hâlâ 70.
# H1 (alternatif hipotez): yeni yöntem ortalamayı artırdı, ortalama > 70.
mu0 = 70
sigma = 10
n = 30
x_bar = 73.2

standart_hata = sigma / np.sqrt(n)
z = (x_bar - mu0) / standart_hata

print(f"Test istatistiği (z): {z:.2f}")
print("z ne kadar büyükse, gözlemlenen sonuç H0'ın öngördüğünden o kadar uzak demektir.")
Test istatistiği (z): 1.75
z ne kadar büyükse, gözlemlenen sonuç H0'ın öngördüğünden o kadar uzak demektir.

z=1.75 çıktı — gözlemlenen ortalama, H0’ın öngördüğü değerden 1.75 standart hata uzakta.

  1. p-değerini hesapla ve karar ver.

p-değeri ve karar

# p-değeri: H0 DOĞRUYKEN, en az bu kadar uç bir sonuç görme olasılığı.
p_degeri = 1 - stats.norm.cdf(z)
alfa = 0.05

print(f"p-değeri: {p_degeri:.4f}")
print(f"α (anlamlılık düzeyi): {alfa}")
print(f"Karar: {'H0 reddedilir — fark istatistiksel olarak anlamlı' if p_degeri < alfa else 'H0 reddedilemez'}")
p-değeri: 0.0398
α (anlamlılık düzeyi): 0.05
Karar: H0 reddedilir — fark istatistiksel olarak anlamlı

p=0.0398, α=0.05’ten küçük — H0 reddedilir. Yani: yeni yöntemin hiç etkisi olmasaydı, 73.2 veya daha yüksek bir ortalama görme olasılığımız sadece %3.98 olurdu. Bu, “şans eseri” açıklamasını inandırıcılığını zayıflatan yeterince küçük bir olasılık.

Çoğu kişi p-değerini “H0’ın doğru olma olasılığı” sanır. Değil, çünkü p-değeri, H0 doğru olduğu varsayılarak hesaplanan koşullu bir olasılıktır — H0’ın kendisinin ne kadar olası olduğu hakkında hiçbir şey söylemez.

Matematik

Hipotez testinin adımları
z=xˉμ0σ/nz = \frac{\bar{x} - \mu_0}{\sigma / \sqrt{n}}p=P(ZzH0 dog˘ru)p = P(Z \ge z \mid H_0 \text{ doğru})
SembolAnlamı
μ0\mu_0H0’ın öngördüğü değer (70)
xˉ\bar{x}Gözlemlenen örneklem ortalaması (73.2)
zzTest istatistiği — gözlemin H0’dan kaç standart hata uzakta olduğu
α\alphaAnlamlılık düzeyi — “ne kadar uç olursa uç sayılır” eşiği, genelde 0.05
ppH0 doğruyken, en az bu kadar uç bir sonuç görme olasılığı

Karar kuralı basit: p<αp < \alpha ise H0 reddedilir, değilse reddedilemez. “Reddedilemez” hiçbir zaman “H0 doğrudur” anlamına gelmez — sadece elimizdeki kanıtın H0’ı çürütmeye yetmediği anlamına gelir.

Nerede işe yarar

Hipotez testi mantığı, “bu fark gerçek mi şans mı?” sorusunun sorulduğu her yerde işler:

  • A/B testleri. Yeni bir buton rengi tıklama oranını gerçekten artırdı mı, yoksa günlük dalgalanma mı?
  • Tıbbi araştırmalar. Yeni bir ilaç, plasebodan gerçekten daha etkili mi?
  • Kalite kontrol. Yeni bir üretim süreci, hata oranını gerçekten düşürdü mü?

Bu 3 hatayı yaparsın:

  1. “p < 0.05, demek ki H0 kesinlikle yanlış” demek — p-değeri kesinlik değil, kanıtın gücü hakkında bir ölçüdür.
  2. “p > 0.05, demek ki H0 doğru ve hiçbir etki yok” demek — belki örneklem küçük olduğu için gerçek bir etkiyi tespit edemedik (bkz. 16. ders, istatistiksel güç).
  3. α’yı sonuçları gördükten sonra seçmek (“p=0.06 çıktı, α’yı 0.10 yapalım”) — bu, testin dürüstlüğünü baştan bozar; α, veriye bakmadan ÖNCE belirlenmelidir.

Kendini test et

1. p-değeri tam olarak neyi ölçer?
  1. H0'ın doğru olma olasılığını
  2. H0 doğru OLSAYDI, gözlemlenen kadar (veya daha) uç bir sonucu şans eseri görme olasılığını (doğru cevap)
  3. H1'in doğru olma olasılığını
  4. Örneklem büyüklüğünün yeterliliğini

Neden: p-değeri her zaman H0'ın doğru olduğu VARSAYIMI altında hesaplanan koşullu bir olasılıktır — H0'ın kendisinin olasılığı hakkında doğrudan bir şey söylemez.

2. p=0.04, α=0.05 olan bir testte karar nedir?
  1. H0 reddedilir (doğru cevap)
  2. H0 kabul edilir (kesin doğru)
  3. Test geçersizdir
  4. Daha fazla veri gerekir

Neden: p < α olduğu için H0 reddedilir. Ama bu "H1 kesinlikle doğru" anlamına gelmez — sadece kanıtın H0 lehine yeterince güçlü olmadığı anlamına gelir.

3. "H0 reddedilemedi" sonucunun doğru yorumu nedir?
  1. H0 kesinlikle doğrudur
  2. Hiçbir etki yoktur, kesin
  3. Elimizdeki kanıt H0'ı çürütmeye yetmedi — etki yok anlamına gelmez, tespit edilemedi anlamına da gelebilir (doğru cevap)
  4. Test hatalı yapılmıştır

Neden: "Reddedilemedi" pasif bir sonuçtur — H0'ın doğru olduğunu KANITLAMAZ, sadece elimizdeki verinin onu reddetmeye yetmediğini gösterir. Küçük örneklem, gerçek bir etkiyi gizleyebilir.

Özet

Özet

  • Hipotez testi, H0 (değişim yok) varsayımıyla başlar ve kanıtın bu varsayımla ne kadar uyumsuz olduğuna bakar.
  • Test istatistiği, gözlemlenen sonucun H0dan kaç standart hata uzakta olduğunu ölçer.
  • p-değeri, H0 doğruyken bu kadar uç bir sonucu şans eseri görme olasılığıdır — H0nın olasılığı DEĞİLDİR.
  • p < α ise H0 reddedilir; p ≥ α ise reddedilemez (bu, H0nın doğru olduğu anlamına gelmez).
  • α, veriye bakmadan önce belirlenmelidir — sonradan değiştirmek testin dürüstlüğünü bozar.
Sonraki adım: z-testi ve p-değeri →