CB DIGITAL
Tüm Makalelere Dön
Veri Bilimi
3 Mart 2026
6 dakika okuma süresi

Apache Spark ile Büyük Veri İşleme Temelleri: Kapsamlı Rehber

Cengiz Bozdemir
Cengiz BozdemirKurumsal Yazılım Mimarı
Apache Spark ile Büyük Veri İşleme Temelleri: Kapsamlı Rehber

Apache Spark Nedir ve Büyük Veri Dünyasındaki Rolü

Günümüzde veri, modern işletmelerin en değerli varlığı haline gelmiştir. Ancak verinin hacmi, hızı ve çeşitliliği (3V kuralı: Volume, Velocity, Variety) geleneksel veri işleme yöntemlerini yetersiz kılmaktadır. İşte bu noktada Apache Spark, büyük veri işleme ekosisteminin merkezine yerleşen, açık kaynaklı ve dağıtık bir hesaplama motoru olarak karşımıza çıkar. 2009 yılında UC Berkeley'deki AMPLab'da geliştirilmeye başlanan ve 2014 yılında bir Apache Top-Level projesi haline gelen Spark, özellikle Hadoop MapReduce modelinin kısıtlamalarını aşmak için tasarlanmıştır.

Spark'ın en büyük avantajı, veriyi disk yerine bellek içi (in-memory) işleme yeteneğidir. MapReduce modelinde her işlem adımından sonra verinin diske yazılması zorunluluğu, ciddi bir performans darboğazı oluştururken; Spark, ara sonuçları RAM üzerinde tutarak işlemleri 100 kata kadar daha hızlı gerçekleştirebilmektedir. Bu hız, özellikle makine öğrenmesi (machine learning) algoritmaları ve iteratif veri işleme süreçleri için devrim niteliğindedir. Apache Spark, yalnızca hız sunmakla kalmaz; aynı zamanda Java, Scala, Python ve R gibi popüler programlama dillerini destekleyerek geniş bir geliştirici kitlesine hitap eder.

Apache Spark Mimarisinin Temel Taşları

Spark'ın çalışma prensibini anlamak için onun Master-Slave (Efendi-Köle) mimarisini kavramak gerekir. Bir Spark uygulaması, bir Driver Program ve küme üzerinde çalışan birden fazla Executor (Yürütücü) biriminden oluşur. Bu yapı, hesaplama yükünün yüzlerce hatta binlerce sunucuya dağıtılmasını sağlar.

  • Driver Program: Uygulamanın ana giriş noktasıdır (Main method). Kullanıcının kodunu analiz eder, işleri (jobs) görevlere (tasks) böler ve bu görevlerin yürütücüler üzerinde nasıl dağıtılacağını planlar. Ayrıca SparkContext nesnesini oluşturarak küme yöneticisi ile iletişimi sağlar.
  • Cluster Manager: Kaynakların yönetilmesinden sorumludur. Spark; kendi yerleşik yöneticisi olan Standalone modunun yanı sıra, Apache Mesos, Hadoop YARN ve Kubernetes gibi popüler küme yöneticileriyle de entegre çalışabilir.
  • Executor: İşçi düğümlerinde (worker nodes) çalışan süreçlerdir. Driver'dan gelen görevleri yerine getirir, veriyi işler ve sonuçları bellekte veya diskte saklar. Bir uygulama bittiğinde executor'lar sonlandırılır.

Spark'ın veriyi nasıl işlediğini belirleyen en kritik yapı ise DAG (Directed Acyclic Graph) yani Yönlendirilmiş Döngüsüz Grafiktir. Spark, bir işlem dizisini hemen çalıştırmak yerine, bu işlemlerin mantıksal bir planını (DAG) oluşturur. Bu sayede Query Optimizer (Sorgu Optimize Edici) devreye girerek en verimli yürütme yolunu belirleyebilir.

Veri Yapıları: RDD, DataFrame ve Dataset

Spark'ın evrimi boyunca veri işleme modelleri kullanıcı dostu ve performans odaklı hale gelmiştir. Temelde üç ana veri yapısı bulunmaktadır:

1. RDD (Resilient Distributed Datasets)

RDD, Spark'ın en temel soyutlamasıdır. Dağıtık, değişmez (immutable) ve hata toleranslı nesne koleksiyonlarıdır. Veri bir düğümde kaybolursa, RDD'nin sahip olduğu "lineage" (geçmiş/soy ağacı) bilgisi sayesinde veri yeniden hesaplanabilir. RDD'ler düşük seviyeli API sunar ve veri üzerinde tam kontrol sağlar; ancak yapısal olmayan verilerde optimizasyon yapma yeteneği sınırlıdır.

2. DataFrame

İlişkisel veritabanlarındaki tablolara benzeyen DataFrame, adlandırılmış sütunlara sahip bir veri koleksiyonudur. RDD'den farklı olarak, verinin şemasını (schema) bilir. Spark'ın Catalyst Optimizer mekanizması sayesinde sorgular otomatik olarak optimize edilir. Python ve SQL kullanıcıları için oldukça tanıdık ve verimli bir yapıdır.

3. Dataset

Dataset, DataFrame'in sahip olduğu avantajları (optimizasyon) RDD'nin sahip olduğu tip güvenliği (type-safety) ile birleştirir. Sadece Scala ve Java dillerinde kullanılabilir. Derleme zamanında hata kontrolü yapılmasına olanak tanır, bu da büyük ve karmaşık kurumsal projelerde hataları minimize eder.

Spark Ekosistemi ve Bileşenleri

Apache Spark'ı güçlü kılan unsurlardan biri, farklı veri işleme ihtiyaçlarını tek bir çatı altında birleştiren zengin modül kütüphanesidir. Bu, geliştiricilerin farklı araçlar arasında geçiş yapma zorunluluğunu ortadan kaldırarak Unified Analytics (Birleşik Analitik) deneyimi sunar.

  • Spark SQL: Yapılandırılmış verileri işlemek için kullanılır. SQL sorguları yazmanıza veya DataFrame API'sini kullanmanıza olanak tanır. JSON, Parquet, Avro ve Hive gibi pek çok veri kaynağına doğrudan erişim sağlar.
  • Spark Streaming: Gerçek zamanlı veri akışlarını işlemek için kullanılır. Kafka, Flume ve Twitter gibi kaynaklardan gelen verileri mikro-batch'ler (küçük paketler) halinde işler. Günümüzde daha modern bir yaklaşım olan Structured Streaming ile veri akışları tıpkı statik bir tabloymuş gibi işlenebilir.
  • MLlib (Machine Learning Library): Spark'ın ölçeklenebilir makine öğrenmesi kütüphanesidir. Sınıflandırma, regresyon, kümeleme ve işbirliği filtreleme gibi yaygın algoritmaları içerir. Büyük veri setleri üzerinde model eğitmek için optimize edilmiştir.
  • GraphX: Graf (çizge) hesaplamaları ve analizi için kullanılır. Sosyal ağ analizi veya dolandırıcılık tespiti gibi ilişkisel verilerin yoğun olduğu alanlarda tercih edilir.

Spark İşleyiş Mantığı: Transformations ve Actions

Spark'ta işlemler iki ana kategoriye ayrılır. Bu ayrım, sistemin Lazy Evaluation (Tembel Değerlendirme) stratejisinin temelini oluşturur. Spark, bir komut verildiğinde hemen işlem yapmaz; bunun yerine bir işlem planı hazırlar ve sadece bir sonuç istendiğinde harekete geçer.

Transformations (Dönüşümler): Mevcut bir veri setinden yeni bir veri seti oluşturan işlemlerdir. Örneğin; filter(), map(), flatMap() ve groupBy() birer dönüşümdür. Bu işlemler "tembeldir"; yani çağrıldıklarında hemen çalışmazlar, sadece DAG'a eklenirler.

Actions (Eylemler): Veri üzerinde bir hesaplama yapıp Driver programına sonuç döndüren veya veriyi dış sisteme yazan işlemlerdir. count(), collect(), saveAsTextFile() ve first() birer eylemdir. Bir "Action" çağrıldığında, Spark o ana kadar biriktirdiği tüm "Transformation"ları optimize ederek çalıştırır.

Performans Optimizasyonu ve En İyi Uygulamalar

Büyük veri projelerinde kodun çalışması yeterli değildir; kodun verimli çalışması gerekir. Spark uygulamalarında performansı artırmak için dikkat edilmesi gereken bazı kritik noktalar şunlardır:

1. Veri Bölümleme (Partitioning): Verinin küme içindeki dağılımı performansı doğrudan etkiler. Çok az partition (bölüm), paralelliği azaltırken; çok fazla partition, yönetim yükünü (overhead) artırır. İdeal olarak, CPU çekirdek sayısının 2-3 katı partition kullanılması önerilir.

2. Caching ve Persistence: Eğer bir veri seti birden fazla kez kullanılacaksa, onu cache() veya persist() metodları ile belleğe almak gerekir. Bu, verinin her seferinde diskten okunmasını veya yeniden hesaplanmasını engeller.

3. Shuffle İşlemlerinden Kaçınma: reduceByKey veya join gibi işlemler verinin ağ üzerinden düğümler arasında taşınmasına (Shuffle) neden olur. Shuffle, Spark'taki en maliyetli işlemdir. Broadcast Variables kullanarak küçük tabloları tüm düğümlere kopyalamak, büyük tablolarla yapılan join işlemlerindeki shuffle yükünü azaltabilir.

4. Dosya Formatı Seçimi: Metin tabanlı formatlar (CSV, JSON) yerine Parquet veya ORC gibi sütun bazlı (columnar) ve sıkıştırılmış formatların kullanılması, I/O performansını ve depolama verimliliğini muazzam ölçüde artırır.

Sonuç: Neden Apache Spark Öğrenmelisiniz?

Apache Spark, sadece bir teknoloji değil, büyük veri ekosisteminin standart işletim sistemi haline gelmiştir. Esnekliği, hızı ve geniş kütüphane desteği ile veri mühendislerinden veri bilimcilere kadar herkes için vazgeçilmez bir araçtır. Bulut bilişim servislerinin (AWS EMR, Azure HDInsight, Databricks) Spark desteği, bu teknolojinin erişilebilirliğini daha da artırmıştır.

Büyük veri işleme süreçlerinde Spark mimarisini, veri yapılarını ve optimizasyon tekniklerini kavramak, modern veri projelerinde başarılı olmanın anahtarıdır. İster gerçek zamanlı bir analitik platformu kuruyor olun, ister devasa veri setleri üzerinde karmaşık makine öğrenmesi modelleri eğitiyor olun, Spark size ihtiyacınız olan gücü ve ölçeklenebilirliği sağlayacaktır. Geleceğin veri odaklı dünyasında yer almak isteyen her profesyonel için Apache Spark yetkinliği, kariyer basamaklarında atılacak en sağlam adımlardan biridir.

#big data#apache spark#veri bilimi#yazılım#veri analitiği
Cengiz Bozdemir

Cengiz Bozdemir

Kurumsal Yazılım Mimarı & Full-Stack Geliştirici

İşletmeniz veya girişiminiz için yüksek performanslı sistemler, özel yazılımlar ve yapay zeka otomasyonları inşa ediyorum.

KURUMSAL YAZILIM MİMARİSİ18+ YILLIK TECRÜBEPHP 8.3 & LARAVELFLUTTER & MOBİL ÇÖZÜMLERNEXT.JS & REACT UYGULAMALARIYAPAY ZEKA & OTOMASYONE-TİCARET & PAZARYERİ ENTEGRASYONUCENGİZ BOZDEMİRCBDIGITALKURUMSAL YAZILIM MİMARİSİ18+ YILLIK TECRÜBEPHP 8.3 & LARAVELFLUTTER & MOBİL ÇÖZÜMLERNEXT.JS & REACT UYGULAMALARIYAPAY ZEKA & OTOMASYONE-TİCARET & PAZARYERİ ENTEGRASYONUCENGİZ BOZDEMİRCBDIGITALKURUMSAL YAZILIM MİMARİSİ18+ YILLIK TECRÜBEPHP 8.3 & LARAVELFLUTTER & MOBİL ÇÖZÜMLERNEXT.JS & REACT UYGULAMALARIYAPAY ZEKA & OTOMASYONE-TİCARET & PAZARYERİ ENTEGRASYONUCENGİZ BOZDEMİRCBDIGITALKURUMSAL YAZILIM MİMARİSİ18+ YILLIK TECRÜBEPHP 8.3 & LARAVELFLUTTER & MOBİL ÇÖZÜMLERNEXT.JS & REACT UYGULAMALARIYAPAY ZEKA & OTOMASYONE-TİCARET & PAZARYERİ ENTEGRASYONUCENGİZ BOZDEMİRCBDIGITAL
© 2026 CB DIGITAL Tüm hakları saklıdır.