CB DIGITAL
Tüm Makalelere Dön
Veri Bilimi
3 Mart 2026
5 dakika okuma süresi

Apache Spark ile Büyük Veri İşleme Temelleri: Kapsamlı Rehber

Cengiz Bozdemir
Cengiz BozdemirKurumsal Yazılım Mimarı
Apache Spark ile Büyük Veri İşleme Temelleri: Kapsamlı Rehber

Apache Spark’ın Büyük Veri Dünyasındaki Yeri ve Önemi

Günümüzde veri, modern işletmelerin en değerli varlığı haline gelmiştir. Ancak, verinin sadece miktarı değil, bu verinin ne kadar hızlı ve verimli bir şekilde işlendiği stratejik bir üstünlük sağlar. Geleneksel veri işleme yöntemlerinin, devasa boyutlardaki veri setleri (Terabaytlar ve Petabaytlar) karşısında yetersiz kalması, Apache Spark gibi dağıtık sistemlerin doğuşuna zemin hazırlamıştır. Apache Spark, açık kaynaklı, çok dilli bir motor olarak, hem toplu (batch) hem de gerçek zamanlı (real-time) veri işleme yetenekleriyle modern veri mühendisliğinin merkezinde yer alır.

Hadoop MapReduce modelinin disk tabanlı çalışma prensibi, özellikle iteratif algoritmalarda ciddi performans darboğazlarına yol açıyordu. Spark, veriyi bellek içi (in-memory) işleme yeteneği sayesinde, MapReduce'tan 100 kata kadar daha hızlı sonuçlar üretebilmektedir. Bu hız, makine öğrenmesi modellerinin eğitilmesinden karmaşık veri analitiğine kadar geniş bir yelpazede devrim yaratmıştır.

Apache Spark Mimarisi: Temel Bileşenler ve Çalışma Prensibi

Spark’ın gücü, esnek ve ölçeklenebilir master-slave mimarisi üzerine kuruludur. Bir Spark uygulaması başladığında, küme üzerinde koordinasyonu sağlayan bir yapı devreye girer. Bu mimarinin temel taşlarını anlamak, performans optimizasyonu yapmak için kritiktir.

1. Driver Program (Sürücü Program)

Driver Program, uygulamanın ana giriş noktasıdır (main function). Kullanıcının kodunu analiz eder, veri işleme adımlarını mantıksal bir plana dönüştürür ve bu planı Directed Acyclic Graph (DAG) adı verilen bir yapıya çevirir. Driver, işin parçalara bölünmesinden ve bu parçaların Executor birimlerine dağıtılmasından sorumludur.

2. Cluster Manager (Küme Yöneticisi)

Spark, kaynak yönetimi için farklı küme yöneticileriyle entegre olabilir. En yaygın kullanılanlar Standalone, Apache Mesos, Hadoop YARN ve son yılların popüler tercihi Kubernetes’tir. Küme yöneticisi, uygulamanın çalışması için gerekli olan CPU ve RAM kaynaklarını tahsis eder.

3. Executor (Yürütücü Birimler)

Executorlar, worker node'lar (işçi düğümler) üzerinde çalışan ve asıl veri işleme görevlerini yerine getiren süreçlerdir. Her bir executor, veriyi yerel olarak saklar ve kendisine atanan Task (görev) birimlerini çalıştırır. Görevler tamamlandığında sonuçları Driver’a geri gönderirler.

Veri Yapıları: RDD, DataFrame ve Dataset

Spark, veriyi işlemek için üç temel soyutlama sunar. Bu yapılar, verinin nasıl saklandığını ve üzerinde nasıl işlem yapıldığını belirler.

RDD (Resilient Distributed Datasets)

RDD, Spark’ın temel yapı taşıdır. "Resilient" (Dayanıklı) kelimesi, verinin kaybolması durumunda sistemin bu veriyi otomatik olarak yeniden oluşturabilme yeteneğini (lineage) ifade eder. "Distributed" (Dağıtık) ise verinin kümedeki farklı makineler arasında bölündüğünü belirtir. RDD’ler değişmezdir (immutable); yani bir RDD üzerinde işlem yapıldığında yeni bir RDD oluşur.

DataFrame

DataFrame, RDD’lerin üzerine inşa edilmiş, ilişkisel veritabanlarındaki tablolara benzeyen bir yapıdır. Adlandırılmış sütunlara sahiptir ve Spark SQL motoru tarafından optimize edilebilir. Catalyst Optimizer sayesinde, yazdığınız sorgular en verimli yürütme planına dönüştürülür. Python (PySpark) ve R kullanıcıları için oldukça tanıdık bir söz dizimi sunar.

Dataset

Dataset, RDD’nin tip güvenliği (type-safety) ile DataFrame’in performans avantajlarını birleştirir. Sadece Java ve Scala dillerinde mevcuttur. Compile-time (derleme zamanı) hata kontrolü sağlar, bu da büyük ve karmaşık projelerde hata payını minimize eder.

Spark’ın Çalışma Mantığı: Transformation ve Action

Spark, veri işlemlerini iki ana kategoriye ayırır. Bu ayrım, Lazy Evaluation (Tembel Değerlendirme) prensibinin temelini oluşturur.

Transformations (Dönüşümler)

Veri setinden yeni bir veri seti türeten işlemlerdir. Örneğin; filter(), map(), flatMap() ve groupBy() birer transformation’dır. Spark, bir transformation komutu aldığında hemen çalıştırmaz. Bunun yerine, yapılacak işlemlerin bir listesini (DAG) oluşturur. Bu, sistemin genel bir optimizasyon yapmasına olanak tanır.

Actions (Eylemler)

Hesaplamayı tetikleyen ve sonucu Driver programına döndüren veya bir depolama sistemine yazan işlemlerdir. count(), collect(), saveAsTextFile() ve show() eylem örnekleridir. Bir action çağrılana kadar hiçbir transformation gerçek anlamda yürütülmez.

Spark Ekosistemi ve Bileşenleri

Apache Spark sadece bir veri işleme motoru değil, aynı zamanda kapsamlı bir kütüphane ekosistemidir. Bu kütüphaneler, farklı veri tipleriyle aynı platform üzerinde çalışmayı mümkün kılar.

  • Spark SQL: Yapılandırılmış verileri SQL sorguları veya DataFrame API'si ile işlemek için kullanılır. JSON, Parquet, Avro ve Hive gibi pek çok formatı destekler.
  • Spark Streaming & Structured Streaming: Gerçek zamanlı veri akışlarını (Kafka, Flume, Kinesis vb.) işlemek için kullanılır. Structured Streaming, akış verisini sürekli büyüyen bir tablo gibi ele alarak geliştirme sürecini kolaylaştırır.
  • MLlib (Machine Learning Library): Sınıflandırma, regresyon, kümeleme ve işbirliğine dayalı filtreleme gibi yaygın makine öğrenmesi algoritmalarını içerir. Dağıtık mimarisi sayesinde devasa veri setleri üzerinde model eğitebilir.
  • GraphX: Graf teorisi ve paralel grafik hesaplamaları için kullanılır. Sosyal ağ analizi veya dolandırıcılık tespiti (fraud detection) gibi alanlarda kritik öneme sahiptir.

Performans Optimizasyonu ve En İyi Uygulamalar

Büyük veri projelerinde Spark kullanmak tek başına yeterli değildir; sistemin verimli çalışması için belirli optimizasyon tekniklerinin uygulanması gerekir. Shuffle operasyonu, verinin ağ üzerinden düğümler arasında taşınması işlemidir ve Spark uygulamalarındaki en maliyetli süreçtir. Broadcasting tekniği ile küçük veri setlerini tüm executor'lara kopyalayarak shuffle maliyeti azaltılabilir.

Partitioning (Bölümleme) stratejisi, verinin küme üzerindeki dağılımını belirler. Yanlış bölümleme, bazı düğümlerin çok yoğun çalışmasına (data skew), bazılarının ise boşta kalmasına neden olur. repartition() ve coalesce() fonksiyonları ile veri dağılımı optimize edilmelidir. Ayrıca, sık kullanılan veri setlerini cache() veya persist() komutlarıyla bellek üzerinde tutmak, tekrarlanan hesaplamaların önüne geçer.

Veri Depolama ve Dosya Formatları

Spark ile çalışırken verinin hangi formatta saklandığı, okuma ve yazma performansını doğrudan etkiler. CSV veya JSON gibi metin tabanlı formatlar, büyük veri dünyasında hantal kalmaktadır. Bunun yerine, Apache Parquet veya Apache Avro gibi sütun tabanlı (columnar) ve sıkıştırılmış formatlar tercih edilmelidir. Parquet, sadece sorgulanan sütunların okunmasına izin vererek disk I/O operasyonlarını minimize eder.

Sonuç: Geleceğin Veri Mimarilerinde Spark

Apache Spark, esnekliği, hızı ve geniş kütüphane desteği ile büyük veri işleme standartlarını belirlemeye devam ediyor. Bulut bilişimin (AWS, Azure, GCP) yükselişiyle birlikte, Spark'ın serverless ve managed (Databricks gibi) servisler üzerinden kullanımı daha da yaygınlaşmıştır. Veri mühendisleri ve veri bilimciler için Spark temellerine hakim olmak, sadece bir teknoloji öğrenmek değil, verinin devasa ölçeklerde nasıl yönetileceğine dair bir vizyon kazanmaktır.

Hızla değişen teknoloji dünyasında, Spark’ın sunduğu birleşik veri işleme (unified data processing) vizyonu, karmaşık veri boru hatlarını (data pipelines) basitleştirmek ve veriden değer elde etme süresini kısaltmak için en güçlü araç olmaya devam edecektir.

#apache spark#büyük veri#veri mühendisliği#veri analitiği#pyspark
Cengiz Bozdemir

Cengiz Bozdemir

Kurumsal Yazılım Mimarı & Full-Stack Geliştirici

İşletmeniz veya girişiminiz için yüksek performanslı sistemler, özel yazılımlar ve yapay zeka otomasyonları inşa ediyorum.

KURUMSAL YAZILIM MİMARİSİ18+ YILLIK TECRÜBEPHP 8.3 & LARAVELFLUTTER & MOBİL ÇÖZÜMLERNEXT.JS & REACT UYGULAMALARIYAPAY ZEKA & OTOMASYONE-TİCARET & PAZARYERİ ENTEGRASYONUCENGİZ BOZDEMİRCBDIGITALKURUMSAL YAZILIM MİMARİSİ18+ YILLIK TECRÜBEPHP 8.3 & LARAVELFLUTTER & MOBİL ÇÖZÜMLERNEXT.JS & REACT UYGULAMALARIYAPAY ZEKA & OTOMASYONE-TİCARET & PAZARYERİ ENTEGRASYONUCENGİZ BOZDEMİRCBDIGITALKURUMSAL YAZILIM MİMARİSİ18+ YILLIK TECRÜBEPHP 8.3 & LARAVELFLUTTER & MOBİL ÇÖZÜMLERNEXT.JS & REACT UYGULAMALARIYAPAY ZEKA & OTOMASYONE-TİCARET & PAZARYERİ ENTEGRASYONUCENGİZ BOZDEMİRCBDIGITALKURUMSAL YAZILIM MİMARİSİ18+ YILLIK TECRÜBEPHP 8.3 & LARAVELFLUTTER & MOBİL ÇÖZÜMLERNEXT.JS & REACT UYGULAMALARIYAPAY ZEKA & OTOMASYONE-TİCARET & PAZARYERİ ENTEGRASYONUCENGİZ BOZDEMİRCBDIGITAL
© 2026 CB DIGITAL Tüm hakları saklıdır.