LLM ’lerin Gizli Dünyası – 1 : Büyük Dil Modellerini Anlamak 50 Soru ve Cevap

LLM ’lerin Gizli Dünyası – 1 : Büyük Dil Modellerini Anlamak 50 Soru ve Cevap

16 Mayıs 2026 Kapalı Yazar: emrecaglaryildiz

Yapay zeka artık sadece bir teknoloji trendi değil; yazılım geliştirmeden içerik üretimine, veri analizinden otomasyona kadar her alanda hayatımızın görünmez mimarı haline geldi.

Peki ya bu devasa modellerin arkasındaki “sihirli kutu” nasıl çalışıyor? Tokenizasyonun neden alt kelimelere bölündüğünü, attention mekanizmasının cümle içindeki kelimeleri nasıl ilişkilendirdiğini veya LoRA gibi tekniklerin büyük modelleri sınırlı kaynaklarda çalıştırabilmeyi nasıl mümkün kıldığını hiç merak ettiniz mi?

Bu yazıda, LLM’lerin karmaşık görünen ama aslında son derece mantıklı çalışan yapısını; GPT mimarisinden RAG pipeline’larına, softmax’tan chain-of-thought akıl yürütmeye kadar 50 temel soru ve net cevaplarla masaya yatırıyoruz. İster yeni başlayan ister deneyimli bir geliştirici olun, bu rehber size büyük dil modellerinin “gizli dünyasına” kapı aralayacak.

Q1. Tokenizasyon nedir ve LLM’lerde neden önemlidir?
Cevap: Tokenizasyon, metni “token” adı verilen daha küçük birimlere (kelimeler, alt kelimeler veya hatta karakterler) ayırma işlemidir. Örneğin, “tokenization” kelimesi “token” ve “ization” gibi alt kelimelere bölünebilir. Bu adım kritiktir çünkü LLM’ler ham metni doğrudan anlamaz; bunun yerine bu tokenları temsil eden sayı dizilerini işler. Etkili tokenizasyon, modellerin çeşitli dilleri işlemesini, nadir kelimeleri yönetmesini ve kelime dağarcığını küçültmesini sağlayarak hem verimliliği hem de performansı artırır.

Q2. LoRA ve QLoRA nedir?
Cevap: LoRA ve QLoRA, Büyük Dil Modellerinin (LLM) ince ayarını optimize etmek için tasarlanmış, bellek kullanımını azaltan ve performansdan ödün vermeden verimliliği artıran tekniklerdir.

  • LoRA (Low-Rank Adaptation): Modelin davranışını değiştirmek için mevcut katmanlara düşük ranklı matris uyarlamaları ekleyen, parametre sayısını artırmadan bellek yükünü düşüren bir yöntemdir. Kaynakları sınırlı olan ortamlar için idealdir.
  • QLoRA (Quantized LoRA): LoRA’nın üzerine 4-bit Normal Float, Çift Quantization ve Sayfa Tabanlı Optimizasyonlar gibi teknikleri ekleyerek bellek kullanımını daha da azaltır. Ağırlık hassasiyetini düşürse de doğruluğu korur; büyük modelleri sınırlı kaynaklarla ince ayarlamak için kullanılır.

Q3. Beam search nedir ve greedy decoding’den nasıl farklıdır?
Cevap: Beam search, metin üretimi sırasında en olası kelime dizisini bulmak için kullanılan bir arama algoritmasıdır. Greedy decoding her adımda tek en yüksek olasılıklı kelimeyi seçerken, beam search aynı anda birden fazla olası diziyi paralel olarak keşfeder ve üstteki k adayı (beam) korur. Bu, özellikle uzun metin üretiminde daha tutarlı ve bağlama uygun çıktılar üretir.

Q4. LLM metin üretiminde “temperature” kavramını açıklayın.
Cevap: Temperature, sonraki tokenlar için olasılık dağılımını ayarlayarak metin üretimindeki rastgeleliği kontrol eden bir hiperparametredir. Düşük sıcaklık (0’a yakın) modeli deterministik yapar; yüksek sıcaklık (>1) dağılımı düzleştirerek daha az olası tokenların seçilmesini sağlar ve çeşitlilik yaratır. 0.7 gibi değerler yaratıcılık ile tutarlılık arasında denge kurmak için uygundur.

Q5. Masked language modeling nedir ve model ön eğitimine nasıl katkı sağlar?
Cevap: Maskeleme tabanlı dil modellemesi (MLM), girdideki bazı tokenlar rastgele maskelenir ve modelden bağlama göre bunları tahmin etmesi istenir. Bu, kelimeler arasındaki bağlamsal ilişkileri öğrenmeyi zorunlu kılar ve BERT gibi modellerde ön eğitim sırasında dilin derin anlamını kavramak için kullanılır.

Q6. Dizi-Dizisi (Sequence-to-Sequence) Modelleri nedir?
Cevap: Girdi ve çıktı uzunlukları değişken olabilecek görevlerde (makine çevirisi, metin özetleme, konuşma tanıma vb.) bir veri dizisini başka bir diziye dönüştürmek için tasarlanmış sinir ağı mimarisidir.

Q7. Özyinelemeli (autoregressive) modeller ile maske modelleri LLM eğitiminde nasıl farklılık gösterir?
Cevap: Özyinelemeli modeller (GPT gibi) metni bir token’ı birinin ardına, önceki token’lara dayanarak üretir; üretim görevleri için idealdir. Maske modelleri (BERT gibi) cümle içinde rastgele maskelenmiş token’ları hem sol hem sağ bağlamı kullanarak tahmin eder; anlama ve sınıflandırma görevlerinde daha etkilidir.

Q8. Embedding’ler LLM’lerde ne rol oynar ve nasıl başlatılır?
Cevap: Embedding’ler, tokenların (kelime/alt kelime) anlamsal ve sözdizimsel bilgilerini içeren yoğun, sürekli vektör temsilleridir. Discrete tokenları sinir ağlarına uygun yüksek boyutlu uzaya haritalar. Genellikle rastgele veya Word2Vec/GloVe gibi önceden eğitilmiş vektörlerle başlatılır; eğitim sırasında görev özelliğine göre ince ayarlanır.

Q9. Next sentence prediction (NSP) nedir ve dil modellemesinde nasıl kullanılır?
Cevap: NSP, BERT gibi modellerde iki cümle arasındaki ilişkiyi öğrenmek için kullanılan bir ön eğitim görevidir. Girdiye %50 olasılıkla gerçek sonraki cümle, %50 olasılıkla rastgele bir cümle verilir; model ikinci cümlenin doğru olup olmadığını sınıflandırır. Bu, soru-cevap ve diyalog gibi görevlerde dil anlayışını güçlendirir.

Q10. Top-k örnekleme ile nükleus (top-p) örnekleme arasındaki fark nedir?
Cevap: Top-k, modelin seçimlerini en yüksek olasılıklı k tokenla sınırlar (örn. k=10). Nükleus (top-p) ise dinamik bir yaklaşımdır; kümülatif olasılığı bir eşik p‘yi (örn. 0.9) aşan tokenları seçer. Bu, bağlama göre aday kümesini esneterek hem çeşitliliği hem de tutarlılığı korur.

Q11. Prompt mühendisliği LLM çıktılarını nasıl etkiler?
Cevap: Prompt mühendisliği, girdi istemlerini özenle tasarlayarak modelin çıktısını yönlendirmektir. İyi kurgulanmış bir prompt, bağlam ekleyerek veya spesifik talimat vererek özetleme/soru-cevap gibi görevlerde doğruluğu artırır. Zero-shot ve few-shot senaryolarda özellikle etkilidir.

Q12. Felaket unutma (catastrophic forgetting) LLM’lerde nasıl azaltılır?
Cevap: Model yeni öğrenirken eski bilgileri unutmaması için:

  1. Rehearsal: Eski ve yeni verilerin karışımıyla yeniden eğitim.
  2. Elastic Weight Consolidation (EWC): Kritik ağırlıklara önem atayarak koruma.
  3. Modüler Yaklaşımlar: Yeni görevler için ek katmanlar/modüller ekleme (ProgNet, OFEL).

Q13. Model damıtımı (distillation) nedir ve LLM’lere nasıl uygulanır?
Cevap: Daha küçük bir “öğrenci” modelin, daha büyük “öğretmen” modelin yumuşak tahminlerini (soft predictions) öğrenerek davranışını taklit etmesidir. Bu, hesaplama ve bellek ihtiyacını düşürürken performansı korur; kaynak kısıtlı cihazlarda dağıtım için idealdir.

Q14. LLM’ler kelime dağarcığı dışı (OOV) kelimeleri nasıl işler?
Cevap: BPE ve WordPiece gibi alt-kelime tokenizasyon teknikleriyle OOV kelimeler bilinen parçalara ayrılır (örn. “unhappiness” → “un”, “happi”, “ness”). Bu sayede model daha önce görmediği kelimeleri de bileşenlerinden anlayabilir.

Q15. Transformer mimarisi geleneksel Dizi-Dizisi modellerinin zorluklarını nasıl aşar?
Cevap:

  • Paralel İşleme: Self-attention ile tüm tokenlar aynı anda işlenir (Seq2Seq’deki sıralı işlemeye göre hızlı).
  • Uzun Menilli Bağımlılıklar: Attention sayesinde uzak tokenlar arasında doğrudan ilişki kurulur.
  • Konumsal Kodlama: Token sırasını korur.
  • Bağlam Şişkinliği Çözümü: Decoder, encoder çıktılarının tamamına attention yapabilir; tek bir bağlam vektörü kısıtlaması ortadan kalkar.

Q16. Makine öğrenmesinde aşırı öğrenme (overfitting) nedir ve nasıl önlenir?
Cevap: Modelin eğitim verisindeki gürültüyü ezberleyip yeni verilere genelleme yapamamasıdır. Önleme yöntemleri: L1/L2 düzenlileştirme, Dropout, veri artırma (augmentation), erken durdurma (early stopping) ve model karmaşıklığını azaltma.

Q17. Üretken (Generative) ve Ayırt Edici (Discriminative) modeller arasındaki fark nedir?
Cevap: Üretken modeller P(x,y) ortak dağılımını öğrenir ve yeni veri örnekleri oluşturur (örn. dil modelleri). Ayırt edici modeller P(y|x) koşullu olasılığını öğrenir, sınırlar çizer ve sınıflandırma/regresyon yapar (örn. duygu analizi).

Q18. GPT-4’ün GPT-3’ten yetenek ve uygulama açısından farkları nelerdir?
Cevap: ~1 trilyon parametre (GPT-3: 175B), çoklu mod desteği (metin+görüntü), 25.000 token bağlam penceresi, daha yüksek doğruluk ve azaltılmış halüsinasyon, 26 dilde gelişmiş performans.

Q19. LLM’lerde konumsal kodlamalar (positional encodings) nedir?
Cevap: Transformer’lar tokenları paralel işlediği için sıra bilgisini kaybeder. Konumsal kodlamalar, sinüsoidal fonksiyonlarla üretilen sabit vektörlerdir ve embedding’lere eklenerek modelin token sırasını anlamasını sağlar.

Q20. Çok başlı dikkat (Multi-head attention) nedir?
Cevap: Tek bir attention mekanizması yerine, sorgu/anahtar/değer vektörleri birden fazla alt uzaya projelenir ve paralel olarak hesaplanır. Çıktılar birleştirilerek modelin daha karmaşık desenleri ve ilişkileri yakalaması sağlanır.

Q21. Softmax fonksiyonunun türevini çıkarın ve attention mekanizmalarındaki rolünü açıklayın.
Cevap: Softmax, gerçek sayı vektörünü [0,1] aralığında toplamı 1 olan olasılık dağılımına dönüştürür. Attention skorlarına uygulandığında tokenlara göre önem derecesi normalize edilir; model en alakalı kısımlara odaklanır.

Q22. Self-attention’da nokta çarpımı nasıl kullanılır ve hesaplama verimliliği açısından etkisi nedir?
Cevap: Sorgu (Q) ve anahtar (K) vektörleri arasındaki benzerliği ölçmek için kullanılır: scores = Q·K^T / √d_k. Etkilidir ancak uzun dizilerde O(n²) karmaşıklık yaratır; bu da daha verimli yaklaşımları tetikler.

Q23. Çapraz entropi kaybı (cross-entropy loss) nedir ve dil modellemesinde neden yaygındır?
Cevap: Tahmin edilen olasılık dağılımı ile gerçek etiket arasındaki farkı ölçer: L = -Σ y_true · log(y_pred). Yanlış tahminleri ağır cezalandırarak modelin doğru tokena yüksek güven vermesini sağlar.

Q24. Embedding’lere göre kayıp fonksiyonunun gradyanı nasıl hesaplanır?
Cevap: Zincir kuralı uygulanır: ∂L/∂E = (∂L/∂logits) · (∂logits/∂E). Geri yayılım bu gradyanları katmanlar boyunca geçirerek embedding’leri minimize edecek şekilde günceller.

Q25. Transformer’da geri yayılımda Jacobian matrisinin rolü nedir?
Cevap: Çıktı vektörünün girdilere göre kısmi türevlerini tutar. Çok boyutlu çıktılarda her parametre ve embedding’in doğru şekilde güncellenmesini sağlayarak kaybın minimize edilmesine yardımcı olur.

Q26. Boyut azaltmada özdeğer (eigenvalue) ve özvektörlerin (eigenvector) kavramı nedir?
Cevap: A·v = λ·v denklemini sağlayan vektörlerdir. PCA gibi yöntemlerde özvektörler temel bileşenleri, özdeğerler ise her bileşenin açıkladığı varyans miktarını temsil eder. Büyük özdeğere sahip bileşenler seçilerek boyut azaltılır.

Q27. KL (Kullback-Leibler) sapması LLM çıktılarında nasıl değerlendirilir?
Cevap: Gerçek P ve tahmini Q dağılımları arasındaki farkı ölçer: KL(P||Q) = Σ P·log(P/Q). Düşük KL değeri, modelin gerçek etiketlere yakın tahminler yaptığını gösterir; ince ayar ve değerlendirme metriklerinde kullanılır.

Q28. ReLU aktivasyon fonksiyonunun türevini çıkarın ve önemi nedir?
Cevap: ReLU(x) = max(0, x) → Türevi: x>0 ise 1, x≤0 ise 0. Negatif girdileri sıfırlayarak sparsite yaratır, kaybolan gradyan sorununu hafifletir ve hesaplama verimliliği sağlar.

Q29. Zincir kuralı (chain rule) nedir ve derin öğrenmedeki gradyan inişiyle ilişkisi nedir?
Cevap: d/dx f(g(x)) = f'(g(x))·g'(x) formülüyle bileşke fonksiyonların türevini verir. Geri yayılımda kaybın her katman parametresine göre gradyanını hesaplamak için kullanılır; gradient descent’in verimli çalışmasını sağlar.

Q30. Transformer’da dikkat skorları nasıl hesaplanır ve matematiksel yorumu nedir?
Cevap: Attention(Q,K,V) = softmax((Q·K^T)/√d_k) · V. Nokta çarpımı benzerliği ölçer, √d_k ile ölçeklendirme gradyan stabilitesini sağlar. Softmax normalize eder; modelin hangi tokenlara odaklanacağını belirler.

Q31. Gemini’nin mimarisi GPT-4 gibi çoklu mod LLM’lere göre eğitim verimliliğini ve kararlılığını nasıl optimize eder?
Cevap:
1) Tek modelde metin/görüntü birleşimi (parametre paylaşımı),
2) Çapraz-mod attention ile daha iyi öğrenme,
3) Kendi kendine denetimli/contrastive öğrenme ile veri verimliliği,
4) Metin ve görüntü kayıplarının dengeli senkronizasyonu.

Q32. Temel modellerin (Foundation Models) farklı türleri nelerdir?
Cevap:
1) Dil Modelleri (BERT, GPT-3),
2) Bilgisayar Görüşü Modelleri (ResNet, VGGNet),
3) Üretken Modeller (DALL-E, Imagen),
4) Çoklu Mod Modeller (PaLM, LaMDA). Hepsi geniş, etiketsiz veriyle unsupervised öğrenir.

Q33. Parametre-Etiketli İnce Ayar (PEFT) felaket unutmayı nasıl önler?
Cevap: Modelin büyük kısmını dondururken sadece küçük görev özel parametreleri günceller. Böylece eski bilgiler ezilmez, yeni görevlere hızlı adapte olur.

Q34. Geri Alım-Artırılmış Üretim (RAG) hattının temel adımları nelerdir?
Cevap:
1) Geri Alım: Sorgu kodlanır ve belge gömme’leriyle karşılaştırılır, alakalı belgeler çekilir.
2) Sıralama: Belgeler alakalılığa göre sıralanır.
3) Üretim: En üstteki belgeler bağlam olarak modele verilir, daha doğru çıktı üretilir.

Q35. Uzmanlar Karışımı (Mixture of Experts – MoE) LLM ölçeklenebilirliğini nasıl artırır?
Cevap: Her girdi için bir gating fonksiyonu yalnızca ilgili uzman alt-ağları aktif eder. Bu, hesaplama yükünü düşürürken modelin karmaşıklığı dinamik olarak yönetmesini sağlar; milyarlarca parametreli modelleri verimli çalıştırır.

Q36. Düşünce Zinciri (Chain-of-Thought – CoT) istemleme nedir ve karmaşık akıl yürütmeyi nasıl geliştirir?
Cevap: Modelin problemi adım adım çözmesini teşvik eden bir teknik. İnsan benzeri mantığı simüle eder, çok adımlı görevlerde doğruluğu artırır ve karar süreçlerini yorumlanabilir kılar.

Q37. Ayırt Edici AI ile Üretken AI arasındaki fark nedir?
Cevap: Ayırt edici AI P(y|x) modelleyerek sınıflandırma/regresyon yapar (spam tespiti, teşhis). Üretken AI P(x,y) modelleyerek yeni veri üretir (metin, görsel, müzik). GAN’lar, VAE’ler ve LLM’ler üreticidir.

Q38. Bilgi grafiği entegrasyonu LLM’leri nasıl geliştirir?
Cevap: Yapısal bilgi ekleyerek:
1) Doğruluk artar (halüsinasyon azalır),
2) Mantıksal çıkarım güçlenir,
3) Bağlam ve varlık ilişkileri daha iyi anlaşılır. Soru-cevap ve öneri sistemlerinde kritiktir.

Q39. Sıfır-örnek öğrenme (zero-shot learning) nedir ve LLM’lere nasıl uygulanır?
Cevap: Model, görev için özel ince ayar olmadan sadece prompt’taki talimatlarla çalışabilir. Geniş dil anlayışı sayesinde sınıflandırma, çeviri veya özetleme gibi görevlere genelleme yapar.

Q40. Uyarlanabilir Softmax (Adaptive Softmax) LLM’leri nasıl hızlandırır?
Cevap: Kelimeleri frekans gruplarına ayırarak nadir kelimeler için daha az hesaplama yapar. Büyük kelime dağarcığını verimli yönetirken doğruluğu korur.

Q41. Kaybolan gradyan sorunu nedir ve Transformer mimarisi bunu nasıl aşar?
Cevap: Geri yayılımda gradyanlar küçülerek derin ağların öğrenmesini engeller.
Transformer:
1) Self-attention ile sıralı bağımlılığı kaldırır,
2) Artık bağlantılar (residual) gradyan akışını korur,
3) Layer normalization stabilizasyon sağlar.

Q42. LLM’lerde “az-örnek öğrenme” (few-shot learning) nedir ve avantajları nelerdir?
Cevap: Modelin sadece birkaç örnekle yeni görevi anlayabilmesidir. Avantajları: az veri ihtiyacı, yüksek esneklik, düşük maliyet ve hızlı adapte olma.

Q43. LLM saldırgan veya yanlış çıktılar üretmeye başladığında teşhis ve çözüm nasıl yapılır?
Cevap: Önce kalıplar, prompt yapısı ve eğitim verisi yanlışı incelenir. Ön işleme hattı, veri dengesi, hiperparametreler ve ince ayar değerlendirilir. Çözümler: adversarial training, debiasing, veri artırma veya daha dengeli veriyle yeniden eğitim.

Q44. Kodlayıcı (encoder) ile çözümleyici (decoder) arasındaki fark nedir?
Cevap: Encoder girdiyi alır ve soyut temsillere dönüştürür (anlama). Decoder bu temsilleri + önceki çıktıları kullanarak nihai metni üretir (üretim).

Q45. LLM’ler ile geleneksel istatistiksel dil modelleri arasındaki temel farklar nelerdir?
Cevap: Mimari (Transformer/self-attention vs N-gram/HMM), Ölçek (milyarlarca parametre vs küçük), Eğitim (unsupervised + fine-tune vs supervised), Girdi (değişken uzunluk/BPE vs sabit), Bağlam (dinamik embedding vs statik), Esneklik (çoklu görev vs tek görev), Kaynak (GPU/TPU vs hafif).

Q46. “Bağlam penceresi” (context window) nedir?
Cevap: Modelin bir anda işleyebildiği token/metin aralığıdır. Daha geniş pencere daha iyi bağlam anlayışı ve tutarlılık sağlar ancak hesaplama maliyetini artırır; performans-verimlilik dengesi gerektirir.

Q47. Hiperparametre nedir?
Cevap: Eğitim önceden belirlenen, modelin öğrenme sürecini kontrol eden ayarlardır (örn. learning rate, batch size, aktivasyon fonksiyonu, optimizasyon algoritması). Deneyim ve denemeyle seçilir.

Q48. Transformer modellerinde dikkat mekanizmaları kavramını açıklayın.
Cevap: Modelin her tahminde tüm kelimelere eşit önem vermez; bağlama göre alakalı kelimelere “odaklanır”. Örn: “Topu kovaladı çünkü hızlıydı” cümlesinde “it” kelimesinin topa mı köpeğe mi atıfta bulunduğunu attention sayesinde çözer.

Q49. Büyük Dil Modelleri (LLM’ler) nedir?
Cevap: Devasa metin veri kümesiyle eğitilmiş, dil kalıplarını, bağlamını ve ilişkilerini öğrenerek insan benzeri metin anlama/üretme/tahmin yapabilen yapay zeka sistemleridir. Soru-cevap, çeviri, özetleme, yaratıcı yazım gibi çoklu görevlerde genelleme yeteneğine sahiptir.

Q50. LLM’leri kullanmanın yaygın zorlukları nelerdir?
Cevap: Yüksek hesaplama/bellek ihtiyacı, eğitim verisinden kaynaklanan yanlılık, karar süreçlerinin yorumlanabilirliği (siyah kutu), veri gizliliği/güvenlik endişeleri ve yüksek geliştirme/dağıtım maliyeti.


Büyük dil modelleri, ilk bakışta sihirli bir kutu gibi görünse de aslında tokenizasyondan attention mekanizmasına, LoRA’dan RAG pipeline’larına kadar son derece mantıklı ve matematiksel temellere dayanan sistemlerdir. Bu 50 soru-cevap rehberiyle LLM’lerin mimarisini, eğitim süreçlerini ve pratik kullanım alanlarını adım adım inceledik.

Unutmayın ki yapay zeka teknolojisi statik değil; her gün yeni mimari yeniliklerle (MoE, çoklu mod desteği, daha verimli fine-tuning teknikleri) evriliyor. Temel kavramları anlamak, bu değişimin sadece izleyicisi değil, aktif katılımcısı olmanızı sağlar.

İster bir geliştirici, ister içerik üreticisi ya da teknoloji meraklısı olun; LLM’lerin dilini konuşmak artık bir lüks değil, dijital çağın temel becerilerinden biri. Bu yazıda paylaştığımız yapıları kendi projelerinizde denemeyi, prompt mühendisliğini geliştirmeyi ve RAG/LoRA gibi tekniklerle sınırları zorlamayı unutmayın.

Yapay zeka geleceği yazan bizleriz; siz de bu yolculuğa kendi sorularınızla devam edin. :)

5/5 - (9 votes)