Ne oldu, nasıl gelişti?
### 1. Donanım Gereksinimleri ve Quantization (Nicemleme) Büyük modelleri tam hassasiyette (FP16) çalıştırmak çok yüksek VRAM gerektirir. 4-bit (AWQ/GPTQ) veya GGUF formatına sıkıştırılmış modeller performanstan neredeyse hiç kaybetmeden donanım maliyetini 4 kat düşürür: - **7B - 8B Modeller (Llama 3, Mistral):** Tek bir RTX 3090 / 4090 (24GB VRAM) yeterlidir. - **14B - 32B Modeller (DeepSeek R1 / Qwen 2.5):** 2x 24GB GPU veya 1x A100 (40GB/80GB). - **70B Modeller:** 2x A100 (80GB) veya 4x RTX 4090.
### 2. vLLM ile Docker Compose Kurulumu vLLM, eşzamanlı yüzlerce kullanıcı isteğini PagedAttention ile bellek şişmesi yaşamadan yönetir.
```yaml version: '3.8' services: vllm-deepseek: image: vllm/vllm-openai:latest container_name: deepseek-local-api runtime: nvidia environment: - HUGGING_FACE_HUB_TOKEN=hf_your_token ports: - "8000:8000" volumes: - ~/.cache/huggingface:/root/.cache/huggingface ipc: host command: > --model deepseek-ai/DeepSeek-R1-Distill-Qwen-14B --quantization awq --max-model-len 8192 --gpu-memory-utilization 0.95 --port 8000 deploy: resources: reservations: devices: - driver: nvidia count: all capabilities: [gpu] ```
### 3. OpenAI Uyumlu İstek Atma Kurulum bittiğinde yerel sunucunuz `http://localhost:8000/v1` adresinden standart OpenAI formatında yanıt verir: ```python from openai import OpenAI
client = OpenAI( base_url="http://localhost:8000/v1", api_key="yerel-sunucu-anahtari" )
response = client.chat.completions.create( model="deepseek-ai/DeepSeek-R1-Distill-Qwen-14B", messages=[{"role": "user", "content": "Verilen metni Türkçe özetle."}] ) print(response.choices[0].message.content) ```
### 4. Güvenlik ve Reverse Proxy API'yi şirket ağına açarken önüne Nginx veya Traefik koyarak SSL sertifikası ve Bearer Token kimlik doğrulaması ekleyin.