BaşlaEğitim ModülleriKullanım ÖrnekleriSlayt Sunumu
Modül 06 · Orta

Cevap Üretimi: Logit, Softmax, Temperature, Top-p ve Streaming

Modelin cevabı tek seferde değil, token token nasıl ürettiğini ve parametrelerin davranışı nasıl değiştirdiğini öğren.

Modelcevabıtokentokenüretir...

“cevap”

“metin”

“kod”

Top-p çekirdeği0%
Temperature

Bu modülde ne öğreneceksin?

  • Logit ve softmax ilişkisini anlamak
  • Temperature, top-p ve stop koşullarının etkisini görmek
  • Streaming yanıtın kullanıcı deneyimini nasıl iyileştirdiğini kavramak
06.1

Token token üretim

Model cevabın tamamını tek seferde yazmaz. Her adımda bir sonraki token için olasılık dağılımı üretir, seçilen token bağlama eklenir ve süreç tekrar eder. Bu yüzden cevaplar ekranda akıyormuş gibi görünür.

06.2

Logit ve softmax

Model son katmanda her olası token için skor üretir. Bu skorlara logit denir. Softmax işlemi bu skorları olasılıklara dönüştürür. En yüksek olasılıklı token her zaman seçilmek zorunda değildir; decoding parametreleri çeşitliliği değiştirir.

06.3

Temperature ve top-p

Düşük temperature daha tutarlı, kontrollü ve deterministik cevaplara yöneltir. Yüksek temperature daha yaratıcı ama hata riski daha yüksek sonuçlar doğurabilir. Top-p ise en olası tokenların dinamik bir çekirdeğinden seçim yaparak çeşitlilik ile tutarlılık arasında denge kurar.

06.4

Streaming ve durdurma

Ürünlerde cevap genellikle streaming olarak kullanıcıya aktarılır. Böylece tüm cevabın bitmesi beklenmez. Stop sequence, maksimum token sınırı ve tekrar cezaları cevabın nerede duracağını ve ne kadar tekrarlı olacağını etkileyebilir.

Kısa teknik notlar

Not

Kod üretimi için düşük temperature genellikle daha uygundur.

Not

Yaratıcı metinlerde daha yüksek çeşitlilik tercih edilebilir.

Not

Streaming, gerçek üretim süresini azaltmaz ama algılanan bekleme süresini ciddi biçimde düşürür.

Derinleşme

Decoding ve akış hissi

01

Model cevabı tek seferde oluşturmaz; her adımda sonraki token için olasılık dağılımı üretir. Seçilen token bağlama eklenir ve süreç yeniden çalışır.

Uygulama

Verimli kullanım bağlantısı

Cevap üretiminde yaratıcılık ve tutarlılık arasında denge vardır; teknik sorularda düşük rastlantısallık daha güvenli sonuç verir.

02

Temperature düşük olduğunda cevap daha kararlı olur; yüksek olduğunda çeşitlilik artar. Kod ve teknik açıklamalarda düşük çeşitlilik genellikle daha güvenlidir.

03

Streaming, kullanıcının cevabı anlık akıyor gibi görmesini sağlar. İlk token gecikmesi bağlam uzunluğu, routing, model yoğunluğu ve güvenlik kontrolünden etkilenebilir.

Anlatım akışı

Bu konuyu eğitim sırasında nasıl kurmalısın?

01

Cevabın tek seferde değil, token token üretildiğini görsel akışla göster.

02

Temperature ve top-p değerlerinin yaratıcılık ile tutarlılık arasında denge kurduğunu anlat.

03

Streaming’in modelin tamamlamasını beklemeden kullanıcıya akıcı çıktı hissi verdiğini açıkla.

Terim kutusu

Bu modülde geçen teknik terimler

Bu bölümde geçen teknik kavramların kısa ve doğrudan açıklamaları.

Logit

Modelin her olası sonraki token için ürettiği ham skordur.

Softmax

Ham skorları olasılık dağılımına dönüştüren matematiksel işlemdir.

Temperature

Çıktının ne kadar tutarlı veya yaratıcı olacağını etkileyen sampling ayarıdır.

Top-p

En olası tokenların dinamik bir kümesinden seçim yapan nucleus sampling yöntemidir.

Decoding

Modelin olasılık dağılımından gerçek token seçtiği üretim aşamasıdır.

Streaming

Cevabın tamamı bitmeden token token kullanıcıya gösterilmesidir.