Bu modülde ne öğreneceksin?
- Halüsinasyon nedenlerini anlamak
- Güvenlik katmanlarının eğitimden çıktı kontrolüne kadar uzandığını görmek
- Kritik alanlarda doğrulama alışkanlığı kazanmak
Halüsinasyon
Model cevapları doğrudan bir doğruluk veritabanından çekmez; bağlama göre olası görünen token dizileri üretir. Bu yüzden eksik bilgi, belirsiz istek, güncel olmayan veri veya yanlış bağlam durumunda emin görünen ama yanlış cevap üretebilir.
Güvenlik katmanları
Modern asistanlarda güvenlik tek bir filtre değildir. Eğitim verisi filtreleme, SFT, RLHF veya benzeri hizalama, güvenlik sınıflandırıcıları, araç izinleri, hassas veri kontrolleri ve çıktı sonrası değerlendirme gibi katmanlar birlikte çalışır.
Jailbreak ve direnç
Kötü niyetli kullanıcılar sistemi yönergeleri yok saymaya, gizli bilgileri açığa çıkarmaya veya zararlı talimat üretmeye zorlayabilir. Bu nedenle sistemler yalnızca kullanıcı metnini değil, talebin amacını ve olası etkisini de değerlendirir.
Güvenilir kullanım
Tıbbi, hukuki, finansal, güvenlik, kod, güncel haber veya akademik kaynak gerektiren konularda cevap doğrulanmalıdır. AI iyi bir yardımcıdır; fakat kritik karar sistemlerinde tek başına otorite gibi kullanılmamalıdır.
Kısa teknik notlar
Halüsinasyon, tutarlı görünen cevabın doğru olmamasıdır.
Güvenlik katmanları hem eğitimde hem ürün çalışırken devrededir.
Kaynaklı ve doğrulanabilir cevap, güvenilirliği artırır.
Sınırlar ve savunma katmanları
Halüsinasyon, modelin yanlış bilgiyi güvenli ve akıcı bir dille üretmesidir. Bunun nedeni modelin doğruluk veritabanı değil, olasılıksal üretim sistemi olmasıdır.
Verimli kullanım bağlantısı
Güvenilir cevap için modelin akıcılığına değil, kaynağa, bağlama ve doğrulanabilirliğe bakılmalıdır.
Prompt injection, dış kaynak içindeki kötü niyetli talimatların sistem davranışını değiştirmeye çalışmasıdır. Güvenli sistemler veri ile komutu ayırır.
Güvenlik; eğitim filtreleri, hizalama, sınıflandırıcılar, araç izinleri, kaynak doğrulama ve çıktı kontrolü gibi birden fazla katmandan oluşur.
Bu konuyu eğitim sırasında nasıl kurmalısın?
Halüsinasyonu modelin olası ama yanlış metin üretme riski olarak anlat.
Prompt injection riskini dış kaynak içindeki gizli talimat örneğiyle açıkla.
Güvenlik katmanlarının tek bir filtre değil; eğitim, sınıflandırma, politika ve araç izni birleşimi olduğunu belirt.
Bu modülde geçen teknik terimler
Bu bölümde geçen teknik kavramların kısa ve doğrudan açıklamaları.
Halüsinasyon
Modelin güvenilir görünen fakat yanlış veya kaynaksız cevap üretmesi durumudur.
Moderation
İstek veya çıktının güvenlik açısından sınıflandırılması ve gerektiğinde sınırlandırılmasıdır.
Policy Classifier
İçeriğin risk kategorisini belirleyen güvenlik sınıflandırıcısıdır.
Prompt Injection
Güvenilmez metnin modele sahte talimat gibi okutulması riskidir.
Privacy
Kişisel veya hassas bilgilerin korunması ilkesidir.
Refusal
Modelin güvenli olmadığı için bir isteği yerine getirmeyi reddetmesidir.