Büyük dil modelleri (LLM), dışarıdan bakıldığında insan gibi metin anlayan ve yanıt üreten sistemler gibi görünür. Ancak arka planda gerçekleşen süreç tamamen matematiksel işlemlerden oluşur.
Bir LLM, metni doğrudan “kelime” olarak anlamaz. Bunun yerine metni sayısal verilere dönüştürür, bu veriler arasındaki ilişkileri analiz eder ve en olası çıktıyı üretir.
Genel süreç şu şekilde ilerler:
Metin → Tokenization → Embedding → Transformer → Next Token Prediction → Çıktı
Token Nedir?
Token, LLM’lerin metni işlediği en küçük birimdir.
Bir token:
- bir kelime olabilir
- bir kelimenin parçası olabilir
- bir sayı olabilir
- noktalama işareti olabilir
- hatta boşluk bile olabilir
Örneğin:
Yapay zekâ geleceği değiştiriyor.”
Bu cümle modele göre şu şekilde bölünebilir:
Yapay – zekâ – geleceği – değiştiriyor | .
Ancak bazı kelimeler daha küçük parçalara ayrılabilir:
- bilgisayarlaştırılamayan → bilgisayar + laş + tır + ılamayan (veya benzeri parçalar)
- international → inter + national (veya intern + ational)
Bu sayede model, daha önce görmediği kelimeleri bile parçalayarak anlayabilir.
Tokenization Süreci
Tokenization, metnin token’lara ayrılması işlemidir.
Kullanıcı bir metin yazdığında model bunu doğrudan işlemez. Önce tokenizer devreye girer ve metni modelin anlayacağı token dizisine çevirir.
Yaygın Tokenization Yöntemleri
Tokenization süreci her modelde farklı yöntemlerle gerçekleştirilir. Ama modern LLM’lerde en yaygın kullanılan yaklaşım, kelimeleri sabit sözlük yerine daha küçük anlamlı parçalara bölmektir. Bu sayede model hem verimli çalışır hem de daha önce görmediği kelimeleri çözebilir.
En yaygın üç yöntem şunlardır:
1- Byte Pair Encoding (BPE)
BPE, en çok kullanılan tokenization yöntemlerinden biridir.
Temel mantığı şudur: Sık tekrar eden karakter veya kelime parçalarını birleştirerek yeni token’lar oluşturmak.
Başlangıçta metin çok küçük parçalara (harfler gibi) ayrılır. Daha sonra en sık yan yana gelen parçalar birleştirilir ve sözlük (vocabulary) giderek büyür.
Örnek:
“t”, “a”, “p”, “a”, “y”
→ “ta”, “pa”, “y”
→ “tapy” (örnek birleşim)
Zamanla model şu tür daha büyük parçaları öğrenir:
- “bil”
- “gis”
- “ayar”
BPE’nin avantajı:
- kelime hazinesini çok verimli kullanır
- nadir kelimeleri parçalayarak temsil edebilir
- eğitim maliyetini düşürür
Bu yüzden GPT serisi dahil birçok modern model BPE türevlerini kullanır.
2- WordPiece
WordPiece, özellikle Google tarafından geliştirilen modellerde yaygın olarak kullanılmıştır (örneğin BERT).
BPE’ye benzer şekilde çalışır ancak önemli bir fark vardır:
Parçaları birleştirirken sadece frekansa değil, olasılık skorlarına da bakar.
Yani amaç sadece sık geçen parçaları birleştirmek değil, aynı zamanda dil modeline en yüksek olasılık katkısını sağlayan birleşimleri seçmektir.
Örnek:
“playing” kelimesi şu şekilde parçalanabilir:
- play + ##ing
Buradaki “##” işareti, parçanın bir kelimenin devamı olduğunu gösterir.
WordPiece’in avantajı:
- daha “dil odaklı” bir segmentasyon yapar
- gramer yapısını daha iyi korur
- özellikle çeviri ve sınıflandırma görevlerinde güçlüdür
3- SentencePiece
SentencePiece kendi başına bir algoritma değil, ham metin üzerinde çalışan bir tokenizasyon çerçevesidir. İçerisinde BPE veya Unigram Language Model gibi farklı algoritmalar kullanılabilir.
SentencePiece, diğer yöntemlerden farklı olarak metni “önceden kelimeye bölünmüş” kabul etmez. Direkt ham metni işler. Yani boşlukları bile normal bir karakter gibi görür.
Bu yaklaşım özellikle çok dilli modeller için önemlidir çünkü:
- her dilde farklı kelime yapıları vardır
- boşluk kullanımı her dilde aynı değildir
SentencePiece genellikle şu iki yöntemle birlikte kullanılır:
- BPE
- Unigram Language Model
Özellikle:
- Google T5
- birçok çok dilli LLM
tarafından tercih edilir.
Avantajları:
- dil bağımsızdır
- farklı alfabelerde stabil çalışır
- tokenization tutarlılığı yüksektir
LLM Neden Token Kullanır?
Büyük dil modelleri (LLM), metni doğrudan kelime olarak değil, token adı verilen küçük parçalara bölerek işler. Bunun temel nedeni, insan dilinin bilgisayarlar tarafından doğrudan işlenemeyecek kadar karmaşık olmasıdır.
Token kullanımı, LLM’lere üç temel avantaj sağlar:
- Verimlilik: Kelimeler küçük parçalara ayrılarak daha az hesaplama ile işlenir
- Esneklik: Daha önce görülmemiş kelimeler bile parçalanarak anlaşılabilir
- Genelleme kabiliyeti: Benzer yapılar arasındaki ilişkiler daha kolay öğrenilir
Örneğin “bilgisayarlaştırılamayan” gibi uzun bir kelime, tek parça olarak değil daha küçük alt birimlere ayrılarak işlenir. Bu sayede model, kelimeyi ezberlemek yerine yapısını öğrenir.
Eğer tokenizasyon olmasaydı, her kelimenin ayrı ayrı öğrenilmesi gerekirdi ve bu durum model boyutunu ve hesaplama maliyetini ciddi şekilde artırırdı.
Bu nedenle tokenization, modern LLM mimarisinin temel yapı taşlarından biridir.
Embedding Nedir?
Token’lar tek başına anlam taşımaz. Bu nedenle sayısal vektörlere dönüştürülür.
Bu işleme embedding denir.
Her token, yüzlerce veya binlerce boyutlu bir vektörle temsil edilir.
Bu sayede model:
- kelimeler arasındaki anlam ilişkilerini öğrenir
- benzer kavramları yakın konumlandırır
Örneğin:
- kedi
- köpek
- aslan
Bu kelimeler embedding uzayında birbirine yakın yer alır.
Benzer şekilde:
- Paris → Fransa
- Berlin → Almanya
gibi ilişkiler de matematiksel olarak temsil edilir.
Konumsal Kodlama (Positional Encoding)
Transformer mimarisi kelimeleri aynı anda işlediği için, tek başına embedding vektörleri kelimelerin cümledeki sırasını göstermez. Bu nedenle her token’a konum bilgisini temsil eden ek vektörler eklenir. Bu işleme positional encoding adı verilir.
Bu sayede model:
- ilk kelimeyi bilir
- son kelimeyi bilir
- kelimelerin birbirine göre sırasını öğrenebilir.
Bu bence makalenin eksik kalan en önemli teknik noktası.
Transformer Mimarisi
Embedding katmanından sonra veriler Transformer yapısına girer.
Transformer, modern LLM’lerin temel mimarisidir.
Özelliği şudur: Metni sırayla değil, aynı anda işler.
Eski modeller (RNN, LSTM) metni kelime kelime işlerken Transformer tüm cümleyi paralel olarak analiz eder.
Bu sayede:
- daha hızlı eğitim
- daha güçlü bağlam anlayışı
- daha yüksek doğruluk
elde edilir.
Self-Attention Mekanizması
Transformer’ın en önemli bileşeni Self-Attention’dır. Self-Attention mekanizması her token’ın diğer tüm token’larla olan ilişkisini ağırlıklandırarak hesaplar.
Örneğin:
“Ahmet, Mehmet’e kitabı verdi çünkü o artık okumayacaktı.”
Burada “o” kelimesinin kim olduğu bağlama bağlıdır.
Self-Attention sayesinde model:
- tüm kelimeleri birlikte değerlendirir
- bağlam ilişkisini kurar
- anlamı doğru çözer
Bu mekanizma LLM’lerin doğal dil üretmesinin temel nedenidir.
Decoder Yapısı Nedir?
Modern üretici büyük dil modellerinin (GPT gibi) büyük bölümü Transformer mimarisinin decoder tabanlı versiyonunu kullanır.
Decoder yapısı, önceki token’ları dikkate alarak sıradaki token’ı tahmin edecek şekilde çalışır.
Bu nedenle model:
- yalnızca geçmiş bağlama bakar
- geleceği adım adım üretir
- her seferinde bir sonraki token’ı tahmin eder
Bu yapı, GPT benzeri modellerin doğal dil üretiminde başarılı olmasının temel nedenidir.
Context Window (Bağlam Penceresi)
Her modelin aynı anda işleyebileceği metin miktarı sınırlıdır.
Bu sınıra context window denir.
Context window büyüdükçe model:
- daha uzun metinleri analiz eder
- daha fazla bilgiyi hatırlar
- daha karmaşık görevleri çözebilir
İlk GPT modelleri yalnızca birkaç bin token işleyebilirken, günümüzde bazı modeller yüz binlerce hatta milyonlarca tokenlık bağlam pencerelerini desteklemektedir.
Next Token Prediction
LLM’lerin çalışma prensibi aslında tek bir göreve dayanır: Bir sonraki token’ı tahmin etmek
Örneğin:
“Türkiye’nin başkenti …”
Model en yüksek olasılıkla “Ankara” cevabını üretir.
Sonra süreç devam eder:
“Ankara …”
Bu şekilde her adımda yeni bir token eklenir ve anlamlı bir metin ortaya çıkar.
İnsan açısından bu süreç akıl yürütme veya düşünme gibi görünse de aslında istatistiksel tahmin zinciridir.
Özet
LLM’lerin çalışma mantığı şu zincire dayanır:
- Metin önce token’lara ayrılır
- Token’lar embedding ile sayısal vektörlere dönüşür
- Transformer bu verileri analiz eder
- Self-Attention bağlam ilişkisini kurar
- Model bir sonraki token’ı tahmin ederek çıktı üretir
Bu basit görünen yapı, milyarlarca parametre ile birleştiğinde oldukça güçlü bir dil sistemi ortaya çıkarır.


YORUMLAR