02 · BAĞLAM

Doğrulandı

Token, Context ve Attention

Token bütçesi, sabit ağırlıklar ve geçici attention durumunu aynı zihinsel modelde birleştir.

Context; sistem mesajı, template, kullanıcı, RAG içeriği ve cevap rezervinin toplam token bütçesidir. Token ID ve parçalanma modele özgüdür; Türkçe maliyet tahmin edilmez, hedef tokenizer ile ölçülür.

Inference sırasında WQ/WK/WV sabittir. Q/K/V vektörleri ve attention skorları girdiye göre değişir; KV cache geçmiş K/V aktivasyonlarını geçici tutar.

01

İlk düşünce

Context iki katına çıkınca toplam VRAM kesin dört katına çıkar.

02

Düzeltme

Klasik attention işi yaklaşık dört kat artar; sabit ağırlıklar ve çalışma zamanı nedeniyle toplam VRAM aynı oranda artmak zorunda değildir.

03

Karar kuralı

Gerçek uzunluk dağılımını ölç; önce 1024–2048 ile güvenli baseline kur.