Makine Öğrenmesi
- 1Makine öğrenmesine giriş
Spam tespiti için kural mı yazarsın, yoksa örneklerden mi öğretirsin? İkisini de deneyip makine öğrenmesinin ne olduğunu somut bir farkla kuruyoruz.
- 2Denetimli / denetimsiz / pekiştirmeli
Etiketli veri, etiketsiz veri, ya da sadece bir ödül sinyali — makine öğrenmesinin üç ailesini, üç somut örnekle ayırıyoruz.
- 3Basit doğrusal regresyon
20 evin metrekare-fiyat verisinden, hatayı 16.4 kat azaltan bir doğru buluyoruz. Bu doğru nasıl 'bulunuyor', hangi doğru en iyisi?
- 4Çoklu doğrusal regresyon
Metrekareye oda sayısını ekleyince kapalı formül yetersiz kalmaya başlayabilir. Gradyan inişi, aynı sonuca adım adım nasıl ulaşıyor?
- 5Regresyon başarı metrikleri
MSE'yi zaten biliyorsun. Peki MAE, RMSE ve R² ne işe yarar, ve tek bir aykırı değer neden RMSE'yi %191 artırırken MAE'yi sadece %69 artırıyor?
- 6Polinom regresyon
Metrekarenin karesini eklemek MSE'yi 2.7 kat düşürüyor -- ama dereceyi 15'e çıkarmak neden daha da kötü sonuç veriyor?
- 7Aşırı öğrenme ve bias-variance
Derece=1 model de kötü, derece=16 model de kötü -- ama farklı NEDENLERLE. Aradaki derece=7 neden en iyisi, ve bunu nasıl anlarız?
- 8Ridge, Lasso, Elastic Net
6 öznitelikten 3'ü saf gürültü. Lasso bu 3'ünü katsayısını tam sıfıra indirerek 'eliyor' -- Ridge neden aynısını yapamıyor?
- 9Çapraz doğrulama türleri
Karıştırılmış bir K-Fold, zaman serisi verisinde R²=0.31 gösteriyor; doğru yöntem R²=-3.71 buluyor. Aradaki fark, gelecekteki veriyi eğitime sızdırmak.
- 10Lojistik regresyon
Doğrusal regresyon, 0 saat çalışan bir öğrenciye -0.11 geçme 'olasılığı' veriyor. Bu anlamsız sayı, lojistik regresyona neden ihtiyacımız olduğunu gösteriyor.
- 11Sınıflandırma başarı metrikleri
Herkese 'hastalık yok' diyen bir model %90 doğruluk alıyor ama TÜM hastaları kaçırıyor. Doğruluk neden bazen yanıltıcı, hangi metrik ne zaman doğru?
- 12Dengesiz veri seti
1000 işlemden 30'u dolandırıcılık. Düz bir model bunların TEK BİRİNİ bile yakalayamıyor -- recall tam olarak sıfır. İki basit düzeltme bunu nasıl çözüyor?
- 13Destek vektör makineleri
Lojistik regresyon 'bir sınır bulur'. SVM 'en GENİŞ marjinli sınırı' bulur -- ve bu marjini sadece 2 nokta belirliyor. Diğer 38 nokta neden önemsiz?
- 14Kernel hilesi
Öznitelikleri elle 3 boyuta genişletmek ile RBF kernel kullanmak AYNI sonucu veriyor. Farkları ne, ve kernel neden 'hile' olarak adlandırılıyor?
- 15Naive Bayes
Model, öznitelikler bağımsızmış gibi davranıyor -- ama gerçekte aralarında 0.375 korelasyon var. Bu 'yanlış' varsayım neden hâlâ %92.5 doğruluk veriyor?
- 16KNN
KNN hiç 'eğitilmiyor' -- tahmin anında tüm veriye bakıyor. Ama bir özniteliği 100 kat büyütmek doğruluğu %97.8'den %73.3'e düşürüyor. Neden?
- 17Karar ağaçları
Sınırsız derinlikli bir ağaç eğitim verisini %100 ezberliyor ama çapraz doğrulamada derinlik=2'den daha iyi değil. Ağaç nasıl ezberliyor, nasıl önleriz?
- 18Entropi, Gini, bilgi kazancı
Aynı veriye Gini kriteriyle kurulan ağaç %94.2, entropi kriteriyle kurulan ağaç %86.7 doğruluk veriyor. İki 'kirlilik' ölçüsü neden FARKLI ağaçlar üretiyor?
- 19Topluluk (ensemble) yöntemleri
Aynı veriye kurulan 8 karar ağacı, aynı yeni müşteri için 2 farklı tahmin veriyor. Tek bir ağaca güvenmek yerine, hepsinin oyunu alsak?
- 20Random Forest
Random Forest, 4 saf gürültü özniteliğini kendi kendine düşük öneme indiriyor -- hiçbirini elle çıkarmadan. Bagging'den tek farkı nedir?
- 21AdaBoost
Tek bir 'karar kütüğü' %68 doğruluk veriyor. 50 tanesini AdaBoost ile art arda birleştirince %98.5'e çıkıyor. Ağaçlar burada neden SIRAYLA kuruluyor?
- 22Gradient Boosting
Her yeni ağaç, fiyata değil bir öncekinin HATASINA uyduruluyor. 3 turda MSE 74.6'dan 11.3'e iniyor -- ama en yüksek öğrenme oranı çapraz doğrulamada en kötüsü.
- 23XGBoost
1000 ağaç istendi ama XGBoost 27'de kendiliğinden durdu -- ve scikit-learn'ün Gradient Boosting'inden 2.6 kat hızlı, neredeyse aynı doğrulukla.
- 24LightGBM
20.000 satırda LightGBM, XGBoost'tan 2.9 kat hızlı -- kategorik bir özniteliği one-hot encode ETMEDEN de kullanabiliyor. Hız nereden geliyor?
- 25Box-Cox dönüşümü
Gelirin çarpıklığı 2.543. Box-Cox sonrası -0.001'e iniyor, Shapiro-Wilk p-değeri 0.00000'dan 0.84489'a fırlıyor. Tek formül bunu nasıl başarıyor?
- 26PCA
5 öznitelikli bir veri setinde ilk 2 bileşen varyansın %99.6'sını açıklıyor. 5 sayı yerine 2 sayı yeterliyse, diğer 3'ü nereye kayboldu?
- 27K-Means
20 rastgele başlangıçtan 9'u kötü bir yerel optimuma takılıyor. K-Means'in 'ata, sonra merkez güncelle' döngüsü neden bazen yanlış bir yerde durabiliyor?
- 28Kümeleme başarı metrikleri
Inertia, k arttıkça hep azalır -- asla bir 'en iyi k' göstermez. Silhouette skoru ise k=3'te tam zirve yapıp sonra düşüyor. Aradaki fark ne?
- 29Hiyerarşik kümeleme
İki kümeyi ince bir nokta köprüsü birleştiriyor. single-linkage köprüyü takip edip kümeleri YANLIŞLIKLA birleştiriyor (ARI=0.725), diğer 3 yöntem düşmüyor.
- 30DBSCAN
İki 'ay' şeklindeki kümede K-Means'in ARI'si sadece 0.245. DBSCAN aynı veride 2 kümeyi doğru buluyor VE 11 gürültü noktasını fark ediyor. Fark nereden geliyor?
- 31Isolation Forest
Normal bir noktayı rastgele bölünmelerle izole etmek ortalama 12.3 adım sürüyor. Bir anomaliyi izole etmek sadece 4.8 adım. Neden bu kadar farklı?