p-Değeri
Bilim dünyasının en yaygın yanlış anlaşılan kavramı! p-değeri ne söyler, ne söylemez — basit dilde öğrenelim.
🎯 p-Değeri Tam Olarak Nedir?
“Eğer gerçekten hiç fark yoksa (sıfır hipotezi doğruysa), bu kadar uç bir sonuç ne kadar şans eseri olur?”
Yani p-değeri bir “olasılık” — ama dikkat, hangisinin olasılığı?
🎲 Madeni Para Örneği
Diyelim ki bir madeni parayı 10 kez attın ve 9 tura geldi. “Bu para hileli mi?” sorusunu sormak istiyorsun.
- H₀: Para adil (yazı/tura olasılığı %50)
- H₁: Para hileli
Eğer para gerçekten adil olsaydı, 10 atışta 9 veya daha çok tura gelmesi şansı: %1.1
Bu, p-değeridir: p = 0.011
Anlamı: “Para adilse, böyle bir sonucu görme şansım %1.1 — çok düşük. Belki para hilelidir.”
📐 0.05 Eşiği Neden Var?
1925’te Ronald Fisher “0.05” sayısını “anlamlılık eşiği” olarak önerdi:
- p < 0.05 → Şans eseri olma ihtimali %5’ten az → muhtemelen gerçek bir etki
- p ≥ 0.05 → Şans eseri olabilir → “yeterli kanıt yok”
0.05 sihirli bir sayı değil — Fisher’ın iş için pratik bulduğu bir eşik. Bazı alanlarda (genetik, fizik) çok daha katı eşikler kullanılır (p < 0.001 veya hatta 5 sigma = 0.0000003).
❌ p-Değeri NE DEĞİLDİR
YANLIŞ 1: “p = 0.03, demek ki H₀’ın doğru olma olasılığı %3”
DOĞRU: p, H₀’ın olasılığı değildir! H₀ doğruysa böyle bir sonucun olasılığıdır. Tam tersi yön.
YANLIŞ 2: “p < 0.05, demek ki etki büyük”
DOĞRU: p sadece anlamlılığı söyler, büyüklüğü değil! Çok büyük örneklemde p küçük çıkar ama etki minicik olabilir.
YANLIŞ 3: “p > 0.05, demek ki etki yok”
DOĞRU: p > 0.05 sadece “kanıt yetersiz” anlamına gelir. Etki yine de var olabilir, ama biz onu tespit edemiyoruz.
YANLIŞ 4: “p = 0.04 ve p = 0.06 çok farklı”
DOĞRU: İki sonuç aslında çok yakın. Sadece bir tanesi keyfi 0.05 eşiğini geçiyor. Pratik fark çok küçük.
📋 p-Değeri Yorumlama Tablosu
| p-değeri | Yorum |
|---|---|
| p < 0.001 | Çok güçlü kanıt — H₀ reddedilir |
| 0.001 ≤ p < 0.01 | Güçlü kanıt — H₀ reddedilir |
| 0.01 ≤ p < 0.05 | Yeterli kanıt — H₀ reddedilir |
| 0.05 ≤ p < 0.10 | Zayıf kanıt — “Sınırda anlamlı” denilebilir, ama dikkat |
| p ≥ 0.10 | Yetersiz kanıt — H₀ reddedilmez |
🧪 Çoklu Test Tuzağı
Eğer 100 farklı hipotez testi yaparsan, hepsi gerçekte boş bile olsa, sadece şans eseri yaklaşık 5 tanesi p < 0.05 çıkar!
Bu yüzden çok sayıda test yapıyorsan düzeltme yapman gerekir (Bonferroni, FDR vb.).
🌟 p-Değeri Yerine veya Yanında Ne Rapor Etmeli?
- p-değeri (anlamlılık için)
- Etki büyüklüğü (Cohen’s d, R², η² — pratik anlam için)
- %95 Güven aralığı (belirsizliği göstermek için)
- Örneklem büyüklüğü (gücün yeterli olduğunu göstermek için)
Bu dördü birlikte → güvenilir rapor.
🏛 Modern Bilim Topluluğu Ne Diyor?
American Statistical Association (Amerika İstatistik Derneği) 2016’da resmi bir açıklama yaptı:
- p-değeri tek başına bilimsel sonuç değildir
- 0.05 eşiği keyfidir, hassas yorumlama gerekir
- p-değeri etki büyüklüğünü ölçmez
- p-değeri olmadığında bile çıkarım yapılabilir
Modern bilim p-değerine tek başına güvenmiyor. Etki büyüklüğü ve güven aralığı eşit derecede önemli.
🔗 İlgili Konular
- Fisher, R. A. (1925). Statistical methods for research workers. Oliver and Boyd.
- Wasserstein, R. L., & Lazar, N. A. (2016). The ASA’s statement on p-values: Context, process, and purpose. The American Statistician, 70(2), 129–133.
- Greenland, S., et al. (2016). Statistical tests, P values, confidence intervals, and power: A guide to misinterpretations. European Journal of Epidemiology, 31, 337–350.