Bu modülde ne öğreneceksin?
- Token, token ID ve embedding farkını kavramak
- Pozisyon bilgisinin neden gerekli olduğunu görmek
- Bağlam penceresi ve context yönetiminin sınırlarını anlamak
Tokenizasyon
Model metni doğrudan kelime olarak işlemez. Metin önce token adı verilen küçük parçalara ayrılır. Token bazen tam kelime, bazen kelime parçası, bazen noktalama işareti, bazen de boşlukla birleşmiş bir parçadır. Bu yöntem, farklı dillerdeki ekleri ve nadir kelimeleri daha yönetilebilir hale getirir.
Embedding
Token ID’leri tek başına anlam taşımaz. Bu ID’ler yüksek boyutlu vektörlere çevrilir. Embedding uzayında benzer bağlamlarda kullanılan kavramlar birbirine yakın temsil edilebilir. Model, “kod”, “fonksiyon”, “derleme”, “hata” gibi kavramlar arasındaki ilişkileri bu sayısal temsil üzerinden işler.
Pozisyon bilgisi
Aynı kelimeler farklı sırada geldiğinde anlam değişebilir. Bu yüzden model yalnızca hangi tokenların var olduğunu değil, hangi sırada geldiklerini de bilmek zorundadır. Pozisyon bilgisi bu sırayı temsil eder ve attention mekanizmasının anlamlı bağ kurmasını sağlar.
Bağlam penceresi
Modelin aynı anda dikkate alabildiği token miktarı sınırlıdır. Uzun belgelerde sistem metni parçalara bölebilir, önemli bölümleri seçebilir veya önceki konuşmadan özetlenmiş bağlam kullanabilir. Bu yüzden çok uzun dosyalarda doğru chunking ve kaynak seçimi kritik hale gelir.
Kısa teknik notlar
Token sayısı, maliyet ve yanıt uzunluğunu doğrudan etkiler.
Embedding anlamı “sayıya çevirme” aşamasıdır.
Bağlam penceresi dolarsa bazı detaylar özetlenmek veya seçilmek zorunda kalabilir.
Bağlam ve temsil derinliği
Tokenizasyon modelin metni işlenebilir parçalara ayırmasıdır. Türkçe gibi eklemeli dillerde kelimeler çoğu zaman alt parçalara bölünür; bu yüzden token sayısı tahmin edilenden fazla olabilir.
Verimli kullanım bağlantısı
Uzun metinlerde en önemli bilgi her zaman modelin bağlamında olmayabilir; bu yüzden özetleme ve kaynak seçimi dikkat gerektirir.
Embedding, tokenın anlamını tek başına değil, kullanım bağlamları üzerinden sayısal uzayda temsil eder. Bu sayede benzer kavramlar yakın, farklı bağlamlar uzak temsiller kazanabilir.
Context window büyüdükçe daha fazla bilgi görülebilir; fakat alakasız bilgi artarsa modelin dikkat dağılımı da zorlaşır. İyi bağlam, uzun bağlamdan daha değerlidir.
Bu konuyu eğitim sırasında nasıl kurmalısın?
Cümlenin önce küçük token parçalarına, sonra sayısal vektörlere dönüştüğünü göster.
Embedding uzayını harita benzetmesiyle anlat: anlamca yakın kavramlar benzer bölgelerde temsil edilir.
Bağlam penceresi dolduğunda modelin tüm geçmişi aynı ayrıntıyla taşıyamayabileceğini vurgula.
Bu modülde geçen teknik terimler
Bu bölümde geçen teknik kavramların kısa ve doğrudan açıklamaları.
Tokenizer
Metni tokenlara ayıran ve bunları token ID değerlerine dönüştüren sistemdir.
Token ID
Her tokenın model sözlüğündeki sayısal karşılığıdır.
Embedding
Tokenların sayısal vektörlere dönüştürülmüş temsilidir; model anlam ilişkilerini bu temsil üzerinden işler.
Vector Space
Embeddinglerin konumlandığı çok boyutlu matematiksel uzaydır.
Positional Encoding
Tokenların cümle içindeki sırasını modele aktaran pozisyon bilgisidir.
Context Window
Modelin tek seferde görebildiği aktif token alanıdır.
Chunking
Uzun belge veya metinlerin daha küçük, anlamlı parçalara bölünmesidir.