BaşlaEğitim ModülleriKullanım ÖrnekleriSlayt Sunumu
Modül 03 · Temel

Tokenizasyon, Embedding ve Bağlam Penceresi

Metnin küçük parçalara ayrılıp sayısal vektörlere dönüşmesini, bağlam sınırlarının cevabı nasıl etkilediğini öğren.

KullanıcımetnitokenIDvektör
Bağlam penceresi
Token akışı0 token
Context kullanımı0%

Bu modülde ne öğreneceksin?

  • Token, token ID ve embedding farkını kavramak
  • Pozisyon bilgisinin neden gerekli olduğunu görmek
  • Bağlam penceresi ve context yönetiminin sınırlarını anlamak
03.1

Tokenizasyon

Model metni doğrudan kelime olarak işlemez. Metin önce token adı verilen küçük parçalara ayrılır. Token bazen tam kelime, bazen kelime parçası, bazen noktalama işareti, bazen de boşlukla birleşmiş bir parçadır. Bu yöntem, farklı dillerdeki ekleri ve nadir kelimeleri daha yönetilebilir hale getirir.

03.2

Embedding

Token ID’leri tek başına anlam taşımaz. Bu ID’ler yüksek boyutlu vektörlere çevrilir. Embedding uzayında benzer bağlamlarda kullanılan kavramlar birbirine yakın temsil edilebilir. Model, “kod”, “fonksiyon”, “derleme”, “hata” gibi kavramlar arasındaki ilişkileri bu sayısal temsil üzerinden işler.

03.3

Pozisyon bilgisi

Aynı kelimeler farklı sırada geldiğinde anlam değişebilir. Bu yüzden model yalnızca hangi tokenların var olduğunu değil, hangi sırada geldiklerini de bilmek zorundadır. Pozisyon bilgisi bu sırayı temsil eder ve attention mekanizmasının anlamlı bağ kurmasını sağlar.

03.4

Bağlam penceresi

Modelin aynı anda dikkate alabildiği token miktarı sınırlıdır. Uzun belgelerde sistem metni parçalara bölebilir, önemli bölümleri seçebilir veya önceki konuşmadan özetlenmiş bağlam kullanabilir. Bu yüzden çok uzun dosyalarda doğru chunking ve kaynak seçimi kritik hale gelir.

Kısa teknik notlar

Not

Token sayısı, maliyet ve yanıt uzunluğunu doğrudan etkiler.

Not

Embedding anlamı “sayıya çevirme” aşamasıdır.

Not

Bağlam penceresi dolarsa bazı detaylar özetlenmek veya seçilmek zorunda kalabilir.

Derinleşme

Bağlam ve temsil derinliği

01

Tokenizasyon modelin metni işlenebilir parçalara ayırmasıdır. Türkçe gibi eklemeli dillerde kelimeler çoğu zaman alt parçalara bölünür; bu yüzden token sayısı tahmin edilenden fazla olabilir.

Uygulama

Verimli kullanım bağlantısı

Uzun metinlerde en önemli bilgi her zaman modelin bağlamında olmayabilir; bu yüzden özetleme ve kaynak seçimi dikkat gerektirir.

02

Embedding, tokenın anlamını tek başına değil, kullanım bağlamları üzerinden sayısal uzayda temsil eder. Bu sayede benzer kavramlar yakın, farklı bağlamlar uzak temsiller kazanabilir.

03

Context window büyüdükçe daha fazla bilgi görülebilir; fakat alakasız bilgi artarsa modelin dikkat dağılımı da zorlaşır. İyi bağlam, uzun bağlamdan daha değerlidir.

Anlatım akışı

Bu konuyu eğitim sırasında nasıl kurmalısın?

01

Cümlenin önce küçük token parçalarına, sonra sayısal vektörlere dönüştüğünü göster.

02

Embedding uzayını harita benzetmesiyle anlat: anlamca yakın kavramlar benzer bölgelerde temsil edilir.

03

Bağlam penceresi dolduğunda modelin tüm geçmişi aynı ayrıntıyla taşıyamayabileceğini vurgula.

Terim kutusu

Bu modülde geçen teknik terimler

Bu bölümde geçen teknik kavramların kısa ve doğrudan açıklamaları.

Tokenizer

Metni tokenlara ayıran ve bunları token ID değerlerine dönüştüren sistemdir.

Token ID

Her tokenın model sözlüğündeki sayısal karşılığıdır.

Embedding

Tokenların sayısal vektörlere dönüştürülmüş temsilidir; model anlam ilişkilerini bu temsil üzerinden işler.

Vector Space

Embeddinglerin konumlandığı çok boyutlu matematiksel uzaydır.

Positional Encoding

Tokenların cümle içindeki sırasını modele aktaran pozisyon bilgisidir.

Context Window

Modelin tek seferde görebildiği aktif token alanıdır.

Chunking

Uzun belge veya metinlerin daha küçük, anlamlı parçalara bölünmesidir.