Veri Bilimi Notları · № 01 · Temmuz 2026
Boyutluluk Laneti
Model kötü çalışıyorsa suçlu çoğu zaman algoritma değil, uzayın kendisidir. Her yeni değişken, verinizin içine yayıldığı uzayı 10 kat büyütür.
Basit bir düşünce deneyi. Elinizde 10 gözlem var. Tek bir değişkene bakıyorsunuz ve bu değişkeni 10 aralığa bölüyorsunuz. Her aralığa bir gözlem düşüyor — tablo dolu, resim net.
İkinci bir değişken ekliyorsunuz. Artık 10 değil 100 hücre var, gözlem sayınız hâlâ 10. Hücrelerin %90'ı boş. Üçüncü değişken: 1.000 hücre, %99'u boş. Dördüncü: 10.000 hücre, %99,9'u boş.
Veriniz artmadı. Sadece içine yayıldığı uzay her adımda 10 kat büyüdü. Boyutluluk laneti tam olarak bu. Ve “benim 100.000 gözlemim var” demek kurtarmıyor: 6 değişkende yine aynı yere geliyorsunuz.
Sorun şu ki bu boşluk sessiz. Uzaklığa dayanan ne varsa — kNN, k-means, her türlü kümeleme — bu seyreklikte kör olur ama hata vermez. Model çalışır, sayı üretir, yanlıştır.
Laplace 1814'te evrendeki her parçacığın konumunu bilen bir zihin hayal etmişti; o zihin geleceği görebilirdi. Asıl soru şu: her şeyi aynı anda bilseydik, nasıl karar verirdik? Karar vermek zaten indirgemektir.
Çözüm daha fazla veri değil, daha az boyut. Bir tahmin modelinde 300 değişken, doğru seçilmiş 30 değişkenden daha iyi değildir. Sadece daha pahalıdır.