Ana içeriğe geç

Giriş12 dk

Poisson

Önkoşul:Bernoulli ve Binom

Kanca

Bir kafeye saatte ortalama 4 müşteri geliyor. Bu, “her saat tam 4 kişi gelir” demek değil — bazı saatler 0 kişi, bazı saatler 9 kişi gelebilir. Hiç müşteri gelmeyen bir saat ne kadar olası, ve “bugün müthiş yoğunduk, 8’den fazla kişi geldi” demek ne kadar sıra dışı?

Sezgi

Önceki derste Binom dağılımını “n tane bağımsız deneme, kaçı başarılı” olarak kurmuştuk. Ama müşteri gelişinde bir “n deneme sayısı” yok — müşteriler günün herhangi bir anında, rastgele gelebilir. Burada saymak istediğimiz şey belirli bir aralıkta (bir saatte) kaç nadir olay olduğu.

Poisson dağılımı, bağımsız ve rastgele zamanlarda gerçekleşen olayların belirli bir aralıktaki sayısını modeller — tek parametresi λ (lambda), o aralıktaki ortalama olay sayısıdır. λ ne kadar büyükse, dağılım o kadar sağa kayar ve genişler.

0510152000.050.100.150.20değeryoğunluk / olasılık
  • PMF — olasılık kütlesi
  • CDF — birikimli olasılık

Eşiğin (6) üzerinde kalma olasılığı: %21.5

λ’yı değiştir: küçük λ’da dağılım 0’a yakın ve çarpık, büyük λ’da simetrik bir çan eğrisine yaklaşıyor.

Mekanizma

Kafe örneğine dönelim: λ = 4 (saatte ortalama 4 müşteri). 10.000 saati simüle edip her saatte kaç müşteri geldiğini sayalım:

10.000 saatlik simülasyon

# Bir kafeye saatte ortalama 4 müşteri geliyor (lambda = 4). Müşteriler birbirinden
# bağımsız, rastgele zamanlarda geliyor. 10.000 saati simüle edelim.
lam = 4
tekrar = 10_000
saatlik_musteri = rng.poisson(lam, size=tekrar)

for k in [0, 2, 4, 6, 10]:
    deneysel = np.mean(saatlik_musteri == k)
    teorik = stats.poisson.pmf(k, lam)
    print(f"k={k:>2}  deneysel P(X=k)={deneysel:.4f}   teorik P(X=k)={teorik:.4f}")

print(f"\nDeneysel ortalama: {saatlik_musteri.mean():.2f}   Teorik lambda = {lam}")
print(f"Deneysel varyans:  {saatlik_musteri.var():.2f}   Teorik lambda = {lam}")
k= 0  deneysel P(X=k)=0.0196   teorik P(X=k)=0.0183
k= 2  deneysel P(X=k)=0.1410   teorik P(X=k)=0.1465
k= 4  deneysel P(X=k)=0.1986   teorik P(X=k)=0.1954
k= 6  deneysel P(X=k)=0.1035   teorik P(X=k)=0.1042
k=10  deneysel P(X=k)=0.0053   teorik P(X=k)=0.0053

Deneysel ortalama: 4.00   Teorik lambda = 4
Deneysel varyans:  4.10   Teorik lambda = 4

Deneysel ve teorik olasılıklar (k=4 için %19.86 ve %19.54) birbirine çok yakın. Deneysel ortalama tam 4.00, deneysel varyans 4.10 — teorik değer olan λ=4’e çok yakın. Poisson’da hem ortalama hem varyans aynı sayıya, λ’ya eşittir — bu, dağılımın kendine has bir özelliği.

Poisson aslında tanıdık bir yerden geliyor: Binom dağılımının bir uç durumu.

Binom → Poisson

# Poisson aslında Binom'un özel bir hâli: n çok büyük, p çok küçükken, n*p = lambda sabit
# kalırsa Binom(n, p) neredeyse Poisson(lambda) ile aynı sonucu verir.
n_buyuk = 10_000
p_kucuk = lam / n_buyuk  # n*p = lambda = 4 sabit kalsın

for k in [0, 2, 4, 6, 10]:
    binom_pmf = stats.binom.pmf(k, n_buyuk, p_kucuk)
    poisson_pmf = stats.poisson.pmf(k, lam)
    print(f"k={k:>2}  Binom(n={n_buyuk}, p={p_kucuk:.4f})={binom_pmf:.4f}   Poisson(λ={lam})={poisson_pmf:.4f}")
k= 0  Binom(n=10000, p=0.0004)=0.0183   Poisson(λ=4)=0.0183
k= 2  Binom(n=10000, p=0.0004)=0.1465   Poisson(λ=4)=0.1465
k= 4  Binom(n=10000, p=0.0004)=0.1954   Poisson(λ=4)=0.1954
k= 6  Binom(n=10000, p=0.0004)=0.1042   Poisson(λ=4)=0.1042
k=10  Binom(n=10000, p=0.0004)=0.0053   Poisson(λ=4)=0.0053

n = 10.000 deneme, p = 0.0004 gibi (çok deneme, çok küçük olasılık) bir Binom dağılımı, Poisson(λ=4) ile noktası noktasına aynı sonucu veriyor. Çoğu kişi Poisson’u Binom’dan tamamen ayrı bir formül sanır. Değil, çünkü Poisson, Binom’un “n sonsuza giderken, np sabit kalırken” aldığı limit halidir — müşteri gelişinde “n” (günün kaç anı olabilir) pratik olarak sonsuz, “p” (o anda müşteri gelme olasılığı) pratik olarak sıfıra yakın.

Matematik

Poisson dağılımının formülü
P(X=k)=λkeλk!P(X = k) = \frac{\lambda^k e^{-\lambda}}{k!}E[X]=λE[X] = \lambdaVar(X)=λ\mathrm{Var}(X) = \lambda
SembolAnlamı
λ\lambdaBelirli bir aralıktaki ortalama olay sayısı (saatte ortalama 4 müşteri)
kkAradığımız olay sayısı (o saatte tam olarak kaç müşteri geldiği)
k!k!kk faktöriyel — (nk)\binom{n}{k}‘nın Binom’daki rolüne benzer bir normalize edici
eλe^{-\lambda}Tüm olasılıkların toplamının 1 olmasını garanti eden sabit

Binom’dan farkı: Poisson’da “kaç deneme yapıldığı” (n) diye bir şey yok, sadece “ortalama oran” (λ) var. Bu yüzden Poisson, Binom’un tersine, denemeleri tek tek saymanın mümkün olmadığı durumlarda (sürekli zaman akışında rastgele olaylar) kullanılır.

Kod

İki pratik soruyu cevaplayalım: “hiç müşteri gelmeyen bir saat” ve “olağanüstü yoğun bir saat (8 ve üzeri)”:

Nadir olay soruları

# İki pratik soru: "bir saatte hiç müşteri gelmez mi?" ve "olağanüstü yoğun bir saat (8+) olur mu?"
p_sifir_musteri = stats.poisson.pmf(0, lam)
p_yogun_saat = 1 - stats.poisson.cdf(7, lam)  # 8 ve üzeri

print(f"P(bir saatte 0 müşteri)      = {p_sifir_musteri:.4f}")
print(f"P(bir saatte 8+ müşteri)     = {p_yogun_saat:.4f}")
P(bir saatte 0 müşteri)      = 0.0183
P(bir saatte 8+ müşteri)     = 0.0511

P(0 müşteri) = %1.83 — nadir ama imkansız değil. P(8+ müşteri) = %5.11 — yaklaşık her 20 saatte bir “yoğun saat” bekleyebilirsin.

Solda farklı lambda değerleri için Poisson PMF eğrileri, lambda arttıkça sağa kayıp genişliyor; sağda 10.000 saatlik simülasyonun deneysel dağılımı teorik Poisson(4) eğrisiyle üst üste.
λ arttıkça Poisson dağılımı sağa kayar ve çan eğrisine benzemeye başlar.

Nerede işe yarar

Poisson, “sürekli zamanda rastgele, bağımsız olaylar” olduğu her yerde karşına çıkar:

  • Web ve altyapı. Bir sunucuya saniyede gelen istek sayısı, bir web sitesine dakikada gelen ziyaretçi sayısı.
  • Operasyon. Bir çağrı merkezine saatte gelen çağrı sayısı, bir hastanenin acil servisine gelen hasta sayısı.
  • Kalite ve güvenilirlik. Bir üretim hattında günde kaç kusurlu ürün çıktığı, bir yazılımda ay içinde kaç kritik hata bildirildiği.

Bu 3 hatayı yaparsın:

  1. Olay oranının zaman içinde sabit olduğunu varsaymak — kafeye öğle saatinde daha çok müşteri gelir, tek bir λ tüm günü temsil etmez.
  2. Olayların gerçekten bağımsız olduğunu kontrol etmemek — bir kampanya sırasında gelen kalabalık, “bağımsız rastgele gelişler” varsayımını bozar.
  3. λ’yı ortalama sanıp varyansı da aynı sanmayı unutmak — bu Poisson’a özgü bir özellik, başka dağılımlarda ortalama ve varyans farklı olabilir.

Kendini test et

1. Poisson dağılımının Binom dağılımından temel farkı nedir?
  1. Poisson'da "deneme sayısı" (n) yoktur, sadece ortalama oran (λ) vardır (doğru cevap)
  2. Poisson sadece sürekli değişkenlerde kullanılır
  3. İkisi arasında hiçbir fark yoktur
  4. Poisson'da olasılık her zaman 0.5'tir

Neden: Binom "n denemeden kaçı başarılı" sorar; Poisson ise sürekli zamanda rastgele olan olayların bir aralıktaki sayısını, sadece ortalama oranla (λ) modeller.

2. Poisson dağılımında ortalama ile varyans arasındaki ilişki nedir?
  1. Varyans her zaman ortalamanın karesidir
  2. İkisi birbirinden bağımsızdır
  3. İkisi de λ'ya eşittir (doğru cevap)
  4. Varyans her zaman sıfırdır

Neden: Poisson dağılımının ayırt edici özelliği budur: E[X] = Var(X) = λ. Bu, simülasyonda deneysel ortalama (4.00) ve varyansın (4.10) birbirine çok yakın çıkmasının sebebidir.

3. Binom(n=10000, p=0.0004) ile Poisson(λ=4) neden neredeyse aynı sonucu veriyor?
  1. Tesadüf
  2. n çok büyük, p çok küçükken ve n×p = λ sabit kalırken Binom, Poisson'a yakınsar (doğru cevap)
  3. İkisi zaten aynı formüldür
  4. Sadece k=0 için aynıdırlar

Neden: Poisson, Binom'un n→∞, p→0, np=λ sabit limit durumudur — çok deneme, çok küçük olasılık, sabit ortalama koşulunda ikisi pratik olarak özdeşleşir.

Özet

Özet

  • Poisson, belirli bir aralıkta (zaman, alan) rastgele ve bağımsız gerçekleşen olayların sayısını modeller.
  • Tek parametresi λ — hem beklenen değer hem varyans λ'ya eşittir.
  • Poisson, Binom'un n çok büyük, p çok küçükken (np=λ sabit) aldığı limit halidir.
  • λ arttıkça dağılım sağa kayar, genişler ve giderek Normal dağılıma benzemeye başlar.
  • Web trafiği, çağrı merkezi, kalite kontrol gibi "nadir, bağımsız olay sayma" problemlerinin standart aracıdır.
Sonraki adım: Normal dağılım →