Bu modülde ne öğreneceksin?
- Logit ve softmax ilişkisini anlamak
- Temperature, top-p ve stop koşullarının etkisini görmek
- Streaming yanıtın kullanıcı deneyimini nasıl iyileştirdiğini kavramak
Token token üretim
Model cevabın tamamını tek seferde yazmaz. Her adımda bir sonraki token için olasılık dağılımı üretir, seçilen token bağlama eklenir ve süreç tekrar eder. Bu yüzden cevaplar ekranda akıyormuş gibi görünür.
Logit ve softmax
Model son katmanda her olası token için skor üretir. Bu skorlara logit denir. Softmax işlemi bu skorları olasılıklara dönüştürür. En yüksek olasılıklı token her zaman seçilmek zorunda değildir; decoding parametreleri çeşitliliği değiştirir.
Temperature ve top-p
Düşük temperature daha tutarlı, kontrollü ve deterministik cevaplara yöneltir. Yüksek temperature daha yaratıcı ama hata riski daha yüksek sonuçlar doğurabilir. Top-p ise en olası tokenların dinamik bir çekirdeğinden seçim yaparak çeşitlilik ile tutarlılık arasında denge kurar.
Streaming ve durdurma
Ürünlerde cevap genellikle streaming olarak kullanıcıya aktarılır. Böylece tüm cevabın bitmesi beklenmez. Stop sequence, maksimum token sınırı ve tekrar cezaları cevabın nerede duracağını ve ne kadar tekrarlı olacağını etkileyebilir.
Kısa teknik notlar
Kod üretimi için düşük temperature genellikle daha uygundur.
Yaratıcı metinlerde daha yüksek çeşitlilik tercih edilebilir.
Streaming, gerçek üretim süresini azaltmaz ama algılanan bekleme süresini ciddi biçimde düşürür.
Decoding ve akış hissi
Model cevabı tek seferde oluşturmaz; her adımda sonraki token için olasılık dağılımı üretir. Seçilen token bağlama eklenir ve süreç yeniden çalışır.
Verimli kullanım bağlantısı
Cevap üretiminde yaratıcılık ve tutarlılık arasında denge vardır; teknik sorularda düşük rastlantısallık daha güvenli sonuç verir.
Temperature düşük olduğunda cevap daha kararlı olur; yüksek olduğunda çeşitlilik artar. Kod ve teknik açıklamalarda düşük çeşitlilik genellikle daha güvenlidir.
Streaming, kullanıcının cevabı anlık akıyor gibi görmesini sağlar. İlk token gecikmesi bağlam uzunluğu, routing, model yoğunluğu ve güvenlik kontrolünden etkilenebilir.
Bu konuyu eğitim sırasında nasıl kurmalısın?
Cevabın tek seferde değil, token token üretildiğini görsel akışla göster.
Temperature ve top-p değerlerinin yaratıcılık ile tutarlılık arasında denge kurduğunu anlat.
Streaming’in modelin tamamlamasını beklemeden kullanıcıya akıcı çıktı hissi verdiğini açıkla.
Bu modülde geçen teknik terimler
Bu bölümde geçen teknik kavramların kısa ve doğrudan açıklamaları.
Logit
Modelin her olası sonraki token için ürettiği ham skordur.
Softmax
Ham skorları olasılık dağılımına dönüştüren matematiksel işlemdir.
Temperature
Çıktının ne kadar tutarlı veya yaratıcı olacağını etkileyen sampling ayarıdır.
Top-p
En olası tokenların dinamik bir kümesinden seçim yapan nucleus sampling yöntemidir.
Decoding
Modelin olasılık dağılımından gerçek token seçtiği üretim aşamasıdır.
Streaming
Cevabın tamamı bitmeden token token kullanıcıya gösterilmesidir.