Tip I ve Tip II Hata

⚖

Tip I ve Tip II Hata

Hipotez testi mükemmel değil — her zaman hata yapma riskimiz var. İki farklı hata türü ve aralarındaki denge istatistiğin temelidir.

🎯 Hata Yapma İhtimali

Bir hipotez testi yaptığında 4 olası sonuç var:

H₀ Gerçekten DoğruH₀ Gerçekten Yanlış
H₀’ı reddetmedik✓ Doğru karar❌ Tip II Hata (β)
H₀’ı reddettik❌ Tip I Hata (α)✓ Doğru karar (Güç = 1 − β)

⚖ Mahkeme Analojisi

🏛 Sanık Suçlu mu, Masum mu?

H₀: Sanık masum (varsayılan)

H₁: Sanık suçlu

  • Tip I Hata: Masum birini suçlu ilan etmek (yanlış pozitif)
  • Tip II Hata: Suçlu birini serbest bırakmak (yanlış negatif)

Hangisi daha kötü? Tartışmalı! Bazı toplumlar Tip I’i daha kötü görür (“Bin suçlu serbest kalsın, bir masum cezalandırılmasın”), bazıları Tip II’yi.

🚨 Tip I Hata (α)

Yanlış Pozitif — “Aslında yok, ama ‘var’ dedik”

Gerçekte fark yokken, “fark var!” demek.

Olasılığı = α (alfa) = anlamlılık düzeyi = genelde 0.05

Anlamı: Yüzde 5 ihtimalle, gerçekte hiç olmayan bir farkı “anlamlı” diye rapor edersin.

Tıbbi örnek: Sağlıklı insanı “hasta” diye tanı koymak — gereksiz tedavi, stres, masraf.

Bilimsel örnek: Çalışmayan bir ilacı “çalışıyor” diye yayınlamak.

🚨 Tip II Hata (β)

Yanlış Negatif — “Aslında var, ama ‘yok’ dedik”

Gerçekte fark varken, “fark yok!” demek.

Olasılığı = β (beta), genelde 0.20 (yani %80 güç)

Anlamı: Yüzde 20 ihtimalle, gerçek bir farkı kaçırırsın.

Tıbbi örnek: Kanseri olan hastayı “sağlıklı” diye gönderi — geç teşhis, geç tedavi.

Bilimsel örnek: Çalışan bir ilacı “çalışmıyor” diye reddetmek — toplum o tedaviyi kaçırır.

🎚 α ve β Arasındaki Denge

⚖ Birini Azaltırsan Diğeri Artar

α’yı azaltmak (örn. 0.05 → 0.01) → Tip I daha az. AMA Tip II artar (gerçek farkları daha çok kaçırırsın).

α’yı artırmak (örn. 0.05 → 0.10) → Tip I daha çok. AMA Tip II azalır.

Bu denge, çalışmanın amacına bağlı:

  • İlaç onayı (FDA): α çok düşük olmalı (0.025 veya daha az) — zararlı ilaç vermek istemeyiz
  • Tarama testi (örn. kanser): β çok düşük olmalı — kanseri kaçırmak istemeyiz

💪 İstatistiksel Güç (Power)

🎯 Güç = 1 − β

Gerçek bir fark varsa, onu yakalama olasılığı.

  • Güç = 0.80 (β = 0.20) → en yaygın hedef
  • Güç = 0.90 (β = 0.10) → daha sıkı çalışmalar
  • Güç = 0.95 (β = 0.05) → ilaç onay çalışmaları

Düşük güç = “yetersiz örneklem”. Sonuç p > 0.05 çıkarsa “fark yok” diyemezsin — “yeterli kanıt yok” denir.

🧮 Gücü Etkileyen Faktörler

FaktörGüce Etkisi
Örneklem büyüklüğü (n) ↑Güç ↑ (en büyük etki)
Etki büyüklüğü ↑Güç ↑
α ↑ (örn. 0.05 → 0.10)Güç ↑
Standart sapma ↓Güç ↑ (gürültü az)

📐 Örneklem Büyüklüğü Hesabı

📊 Önce Plan, Sonra Veri

Araştırma planlama aşamasında “kaç katılımcı yeter?” sorusu kritik:

  • Beklediğin etki büyüklüğü ne kadar? (örn. Cohen’s d = 0.5)
  • Hangi α’yı kullanacaksın? (örn. 0.05)
  • Hangi gücü hedefliyorsun? (örn. 0.80)

Bu üç bilgi ile, MerQur’un Örneklem Hesaplayıcısı sana minimum n verir.

Örneğin: Cohen’s d = 0.5, α = 0.05, güç = 0.80 → n ≈ 64 (her grupta)

🌟 Çoklu Karşılaştırma Sorunu

🎯 Birçok Test = Birçok Tip I Hata

20 farklı test yaparsan, hepsinde α = 0.05 ise, en az 1 tanesi yanlışlıkla anlamlı çıkar (toplam yanlış pozitif olasılığı yaklaşık %64!).

Bu yüzden çoklu test düzeltmesi gerekir:

  • Bonferroni: α’yı test sayısına böl (örn. 20 test → α = 0.0025)
  • Tukey HSD: ANOVA post-hoc için
  • FDR (Benjamini-Hochberg): Genom çalışmaları için modern yöntem

🔗 İlgili Konular

📚 Kaynaklar:
  1. Neyman, J., & Pearson, E. S. (1933). On the problem of the most efficient tests of statistical hypotheses. Philosophical Transactions of the Royal Society A, 231, 289–337.
  2. Cohen, J. (1988). Statistical power analysis for the behavioral sciences (2nd ed.). Lawrence Erlbaum.
  3. Button, K. S., et al. (2013). Power failure: Why small sample size undermines the reliability of neuroscience. Nature Reviews Neuroscience, 14, 365–376.