Ne oldu, nasıl gelişti?
### 1. Token İsrafının Temel Nedeni Çoğu chatbot uygulaması, kullanıcının 15. mesajında bile geçmişteki 14 mesajın tamamını `messages` dizisinde tekrar modele gönderir. Bu durum, lineer değil karesel (O(N^2)) bir token artışına yol açar.
### 2. 3 Katmanlı Hafıza Optimizasyon Mimarisi 1. **Kayan Pencere (Sliding Window):** Sadece son 4-6 mesajı tam metin olarak tutun. 2. **Hiyerarşik Özetleme (Running Summary):** 6 mesajdan eski olan konuşmaları arka planda çalışan ucuz ve hızlı bir modelle (örn: `gpt-4o-mini` veya `deepseek-chat`) tek bir paragraflık 'Kullanıcı Tercihleri ve Konuşma Özeti' haline getirin. Bu özeti sistem promptunun altına tek bir bağlam olarak ekleyin. 3. **Anlamsal Önbellek (Semantic Caching):** Kullanıcıların sıkça sorduğu benzer soruları (örn: 'Şifremi nasıl sıfırlarım?' ve 'Parolamı unuttum ne yapmalıyım?') `GPTCache` veya `Redis Vector Similarity` ile yakalayarak LLM'e hiç gitmeden önbellekten 0 ms gecikmeyle ve 0 maliyetle yanıtlayın.
### 3. Örnek Maliyet Karşılaştırması (100.000 Aktif Kullanıcı/Ay) - **Optimize Edilmemiş Mimari:** Ortalama 4.000 token/istek -> Aylık ~$4.800 - **Özetleme + Semantic Cache Mimarisi:** Ortalama 900 token/istek (%30 cache isabeti) -> Aylık ~$1.100 (%77 Tasarruf).