02 · BAĞLAM
DoğrulandıToken, Context ve Attention
Token bütçesi, sabit ağırlıklar ve geçici attention durumunu aynı zihinsel modelde birleştir.
Context; sistem mesajı, template, kullanıcı, RAG içeriği ve cevap rezervinin toplam token bütçesidir. Token ID ve parçalanma modele özgüdür; Türkçe maliyet tahmin edilmez, hedef tokenizer ile ölçülür.
Inference sırasında WQ/WK/WV sabittir. Q/K/V vektörleri ve attention skorları girdiye göre değişir; KV cache geçmiş K/V aktivasyonlarını geçici tutar.
İlk düşünce
Context iki katına çıkınca toplam VRAM kesin dört katına çıkar.
Düzeltme
Klasik attention işi yaklaşık dört kat artar; sabit ağırlıklar ve çalışma zamanı nedeniyle toplam VRAM aynı oranda artmak zorunda değildir.
Karar kuralı
Gerçek uzunluk dağılımını ölç; önce 1024–2048 ile güvenli baseline kur.