BaşlaEğitim ModülleriKullanım ÖrnekleriSlayt Sunumu
Modül 04 · Orta

Transformer, Self-Attention, Multi-Head Attention ve KV Cache

Modelin bağlam ilişkilerini nasıl hesapladığını ve cevap üretirken önceki hesapları nasıl hızlandırabildiğini öğren.

Head 1: anlamHead 2: formatHead 3: kodHead 4: bağlam
KV Cache
Attention yoğunluğu0%
Cache isabeti0%

Bu modülde ne öğreneceksin?

  • Self-attention formülünü sezgisel düzeyde anlamak
  • Multi-head attention ile farklı ilişki türlerinin nasıl yakalandığını görmek
  • KV cache kavramının üretim hızına etkisini kavramak
04.1

Transformer mantığı

Transformer, her tokenın diğer tokenlarla ilişkisini aynı anda hesaplayabilen bir mimaridir. Bu sayede uzun cümlede zamirin neye döndüğü, kodda değişkenin nerede tanımlandığı veya kullanıcının “tablo halinde ver” talimatının cevabın hangi bölümünü etkileyeceği takip edilebilir.

04.2

Self-attention

Self-attention her token için “Bu bağlamda hangi tokenlara ne kadar dikkat etmeliyim?” sorusuna cevap üretir. Query, key ve value temsilleri üzerinden ağırlıklar hesaplanır. Yüksek ağırlık alan tokenlar, mevcut tokenın yeni temsilinde daha etkili olur.

04.3

Multi-head attention

Tek bir dikkat başlığı yeterli değildir. Bir başlık özne-yüklem ilişkisini izlerken, diğeri tarihleri, bir diğeri kod değişkenlerini, bir başkası çıktı formatını takip edebilir. Multi-head attention, metni aynı anda farklı açılardan okuma yeteneği verir.

04.4

KV cache

Cevap üretilirken model her yeni token için önceki tokenlara bakar. Önceden hesaplanan key/value temsillerini saklamak, tekrar tekrar aynı hesapların yapılmasını azaltır. Bu teknik özellikle uzun cevaplarda gecikmeyi düşürmek için önemlidir.

Kısa teknik notlar

Not

Attention, bağlam ilişkilerinin ağırlıklı haritasıdır.

Not

Multi-head yapı, farklı ilişki türlerini paralel takip eder.

Not

KV cache, üretilmiş bağlam için bazı hesapları yeniden yapmamak adına kullanılır.

Derinleşme

Attention ve KV cache

01

Self-attention, her tokenın diğer tokenlarla ilişkisini ağırlıklandırır. Bu mekanizma sayesinde model bir zamirin hangi nesneye döndüğünü veya kod bloğunda değişkenin nerede kullanıldığını takip edebilir.

Uygulama

Verimli kullanım bağlantısı

Attention mantığını anlatırken “hangi token hangi bilgiye bakıyor?” sorusunu merkeze almak konuyu sadeleştirir.

02

Multi-head attention, aynı metni farklı açılardan okuyabilmeyi sağlar. Bir başlık dil ilişkilerine, başka bir başlık format talimatına, başka bir başlık teknik bağımlılıklara odaklanabilir.

03

KV cache inference sırasında önceki key/value hesaplarını saklayarak uzun cevap üretiminde tekrar hesaplamayı azaltır. Bu, özellikle ilk tokendan sonraki akışın daha stabil hissedilmesini sağlar.

Anlatım akışı

Bu konuyu eğitim sırasında nasıl kurmalısın?

01

Self-attention’ı “hangi parçaya ne kadar bakılmalı?” sorusu üzerinden anlat.

02

Multi-head attention’ın aynı cümleyi farklı ilişki türleriyle okumasını örneklendir.

03

KV cache’in üretim sırasında tekrar hesaplamayı azaltarak gecikmeyi düşürebildiğini açıkla.

Terim kutusu

Bu modülde geçen teknik terimler

Bu bölümde geçen teknik kavramların kısa ve doğrudan açıklamaları.

Transformer

Attention mekanizmasını temel alan, tokenlar arasındaki ilişkileri paralel biçimde işleyen model mimarisidir.

Self-Attention

Bir tokenın aynı bağlamdaki diğer tokenlara ne kadar dikkat etmesi gerektiğini hesaplayan mekanizmadır.

Query / Key / Value

Attention hesabında kullanılan üç temsil türüdür; Query soru, Key eşleşme, Value taşınacak bilgi gibi düşünülebilir.

Multi-Head Attention

Aynı metni birden fazla attention başlığıyla farklı ilişkiler açısından okuma yöntemidir.

Feed-Forward Network

Attention sonrası her token temsilini ayrı ayrı dönüştüren sinir ağı katmanıdır.

Layer Normalization

Katmanlar arasında değerleri dengede tutarak üretimi daha kararlı hale getiren işlemdir.