Bu modülde ne öğreneceksin?
- Next-token prediction mantığını anlamak
- Supervised fine-tuning ve RLHF/AI feedback aşamalarını ayırmak
- Eğitim sonrası değerlendirme ve kırmızı takım testlerinin neden gerekli olduğunu kavramak
Ön eğitim
GPT türü modellerin temel eğitim hedefi, verilen bağlamdan sonra gelecek tokenı tahmin etmektir. Model büyük metin ve kod koleksiyonlarında dil örüntülerini, kavram ilişkilerini, yazım kalıplarını ve kod yapılarını öğrenir. Bu aşama modeli güçlü bir dil tahminleyicisine dönüştürür.
Supervised fine-tuning
Ön eğitim modeli metin devam ettirmede güçlü yapar; fakat kullanıcı talimatına düzenli cevap verme davranışı için kaliteli örneklerle ince ayar gerekir. SFT aşamasında model, soru-cevap, özetleme, kod yazma, açıklama ve biçimlendirme gibi görevleri daha doğrudan takip etmeyi öğrenir.
RLHF ve alternatif hizalama
İnsan geri bildirimiyle hizalama sürecinde farklı cevaplar kalite ve güvenlik açısından sıralanır. Model, yalnızca olası metin üretmek yerine daha faydalı, daha güvenli ve kullanıcının niyetine daha uygun cevaplar üretmeye yönlendirilir. Bazı yaklaşımlarda insan geri bildiriminin yanında ilke tabanlı AI geri bildirimi de kullanılabilir.
Değerlendirme
Eğitim bitince iş bitmez. Model benchmark testleri, güvenlik senaryoları, kod görevleri, halüsinasyon ölçümleri, zararlı istek testleri ve gerçek kullanıcı deneyimleriyle değerlendirilir. Bu aşama ürün kalitesinin sürdürülebilmesi için kritiktir.
Kısa teknik notlar
Pretraining dil bilgisini ve örüntüleri kazandırır.
SFT talimat takip davranışını güçlendirir.
RLHF/AI feedback cevap tercihlerini ve güvenlik davranışını iyileştirir.
Eğitimden asistana dönüşüm
Ön eğitim modeli “metni devam ettirme” konusunda güçlendirir. Ancak kullanıcıya faydalı, düzenli ve güvenli cevap verme davranışı için supervised fine-tuning ve hizalama gerekir.
Verimli kullanım bağlantısı
Eğitim sürecini ham dil öğrenimi ve kullanıcıya uygun davranış öğrenimi olarak iki ayrı katman halinde düşünmek açıklamayı kolaylaştırır.
RLHF veya benzeri geri bildirim süreçlerinde model, insanların daha iyi bulduğu cevaplara yakın davranışlar geliştirmeye çalışır. Bu, yalnızca doğru bilgi değil; ton, format ve güvenlik açısından da etkilidir.
Model değerlendirme süreçleri doğruluk, zararlı çıktı, halüsinasyon, kod güvenliği, çok dilli kalite ve talimat uyumu gibi başlıklarda yapılır.
Bu konuyu eğitim sırasında nasıl kurmalısın?
Ön eğitimin dil kalıplarını, SFT’nin talimat davranışını, RLHF’nin tercih uyumunu geliştirdiğini ayır.
Modelin yalnızca bilgi ezberlemediğini, olasılıksal kalıplar ve kullanım davranışları öğrendiğini anlat.
Değerlendirme sürecinde doğruluk, güvenlik, faydalılık ve biçim uyumunun birlikte ölçüldüğünü vurgula.
Bu modülde geçen teknik terimler
Bu bölümde geçen teknik kavramların kısa ve doğrudan açıklamaları.
Pretraining
Modelin büyük veri üzerinde sonraki tokenı tahmin etmeyi öğrendiği temel eğitim aşamasıdır.
SFT
Supervised Fine-Tuning. Modele kaliteli örnek soru-cevap çiftleriyle talimat takip etme davranışı kazandırır.
RLHF
Reinforcement Learning from Human Feedback. İnsan tercihleriyle daha faydalı cevap davranışı optimize edilir.
Reward Model
İnsan tercih sıralamalarından öğrenerek hangi cevabın daha iyi olduğunu puanlayan modeldir.
Preference Data
İnsanların farklı model cevaplarını karşılaştırarak oluşturduğu tercih verisidir.
Alignment
Modelin kullanıcıya yararlı, güvenli ve talimata uygun davranacak şekilde hizalanmasıdır.