Tip I ve Tip II Hata
Hipotez testi mükemmel değil — her zaman hata yapma riskimiz var. İki farklı hata türü ve aralarındaki denge istatistiğin temelidir.
🎯 Hata Yapma İhtimali
Bir hipotez testi yaptığında 4 olası sonuç var:
| H₀ Gerçekten Doğru | H₀ Gerçekten Yanlış | |
|---|---|---|
| H₀’ı reddetmedik | ✓ Doğru karar | ❌ Tip II Hata (β) |
| H₀’ı reddettik | ❌ Tip I Hata (α) | ✓ Doğru karar (Güç = 1 − β) |
⚖ Mahkeme Analojisi
H₀: Sanık masum (varsayılan)
H₁: Sanık suçlu
- Tip I Hata: Masum birini suçlu ilan etmek (yanlış pozitif)
- Tip II Hata: Suçlu birini serbest bırakmak (yanlış negatif)
Hangisi daha kötü? Tartışmalı! Bazı toplumlar Tip I’i daha kötü görür (“Bin suçlu serbest kalsın, bir masum cezalandırılmasın”), bazıları Tip II’yi.
🚨 Tip I Hata (α)
Gerçekte fark yokken, “fark var!” demek.
Olasılığı = α (alfa) = anlamlılık düzeyi = genelde 0.05
Anlamı: Yüzde 5 ihtimalle, gerçekte hiç olmayan bir farkı “anlamlı” diye rapor edersin.
Tıbbi örnek: Sağlıklı insanı “hasta” diye tanı koymak — gereksiz tedavi, stres, masraf.
Bilimsel örnek: Çalışmayan bir ilacı “çalışıyor” diye yayınlamak.
🚨 Tip II Hata (β)
Gerçekte fark varken, “fark yok!” demek.
Olasılığı = β (beta), genelde 0.20 (yani %80 güç)
Anlamı: Yüzde 20 ihtimalle, gerçek bir farkı kaçırırsın.
Tıbbi örnek: Kanseri olan hastayı “sağlıklı” diye gönderi — geç teşhis, geç tedavi.
Bilimsel örnek: Çalışan bir ilacı “çalışmıyor” diye reddetmek — toplum o tedaviyi kaçırır.
🎚 α ve β Arasındaki Denge
α’yı azaltmak (örn. 0.05 → 0.01) → Tip I daha az. AMA Tip II artar (gerçek farkları daha çok kaçırırsın).
α’yı artırmak (örn. 0.05 → 0.10) → Tip I daha çok. AMA Tip II azalır.
Bu denge, çalışmanın amacına bağlı:
- İlaç onayı (FDA): α çok düşük olmalı (0.025 veya daha az) — zararlı ilaç vermek istemeyiz
- Tarama testi (örn. kanser): β çok düşük olmalı — kanseri kaçırmak istemeyiz
💪 İstatistiksel Güç (Power)
Gerçek bir fark varsa, onu yakalama olasılığı.
- Güç = 0.80 (β = 0.20) → en yaygın hedef
- Güç = 0.90 (β = 0.10) → daha sıkı çalışmalar
- Güç = 0.95 (β = 0.05) → ilaç onay çalışmaları
Düşük güç = “yetersiz örneklem”. Sonuç p > 0.05 çıkarsa “fark yok” diyemezsin — “yeterli kanıt yok” denir.
🧮 Gücü Etkileyen Faktörler
| Faktör | Güce Etkisi |
|---|---|
| Örneklem büyüklüğü (n) ↑ | Güç ↑ (en büyük etki) |
| Etki büyüklüğü ↑ | Güç ↑ |
| α ↑ (örn. 0.05 → 0.10) | Güç ↑ |
| Standart sapma ↓ | Güç ↑ (gürültü az) |
📐 Örneklem Büyüklüğü Hesabı
Araştırma planlama aşamasında “kaç katılımcı yeter?” sorusu kritik:
- Beklediğin etki büyüklüğü ne kadar? (örn. Cohen’s d = 0.5)
- Hangi α’yı kullanacaksın? (örn. 0.05)
- Hangi gücü hedefliyorsun? (örn. 0.80)
Bu üç bilgi ile, MerQur’un Örneklem Hesaplayıcısı sana minimum n verir.
Örneğin: Cohen’s d = 0.5, α = 0.05, güç = 0.80 → n ≈ 64 (her grupta)
🌟 Çoklu Karşılaştırma Sorunu
20 farklı test yaparsan, hepsinde α = 0.05 ise, en az 1 tanesi yanlışlıkla anlamlı çıkar (toplam yanlış pozitif olasılığı yaklaşık %64!).
Bu yüzden çoklu test düzeltmesi gerekir:
- Bonferroni: α’yı test sayısına böl (örn. 20 test → α = 0.0025)
- Tukey HSD: ANOVA post-hoc için
- FDR (Benjamini-Hochberg): Genom çalışmaları için modern yöntem
🔗 İlgili Konular
- Neyman, J., & Pearson, E. S. (1933). On the problem of the most efficient tests of statistical hypotheses. Philosophical Transactions of the Royal Society A, 231, 289–337.
- Cohen, J. (1988). Statistical power analysis for the behavioral sciences (2nd ed.). Lawrence Erlbaum.
- Button, K. S., et al. (2013). Power failure: Why small sample size undermines the reliability of neuroscience. Nature Reviews Neuroscience, 14, 365–376.