Şu an neler oluyor?

Tüm akışa dön
DeepSeek ve Açık Kaynak LLM'leri Docker Üzerinde Kendi Sunucunda Host Etme
Yapay Zeka 3 Ekim 2026 · 1 gün önce 200 karakter

DeepSeek ve Açık Kaynak LLM'leri Docker Üzerinde Kendi Sunucunda Host Etme

Haberin özeti

Kurumunuzda yapay zeka otomasyonları kurmak istiyor ancak gizlilik politikaları veya yüksek API faturaları nedeniyle bulut servislerini kullanamıyorsanız, çözüm kendi sunucunuzda host etmektir.

↳
Olay örgüsü

Ne oldu, nasıl gelişti?

### 1. Donanım Gereksinimleri ve Quantization (Nicemleme) Büyük modelleri tam hassasiyette (FP16) çalıştırmak çok yüksek VRAM gerektirir. 4-bit (AWQ/GPTQ) veya GGUF formatına sıkıştırılmış modeller performanstan neredeyse hiç kaybetmeden donanım maliyetini 4 kat düşürür: - **7B - 8B Modeller (Llama 3, Mistral):** Tek bir RTX 3090 / 4090 (24GB VRAM) yeterlidir. - **14B - 32B Modeller (DeepSeek R1 / Qwen 2.5):** 2x 24GB GPU veya 1x A100 (40GB/80GB). - **70B Modeller:** 2x A100 (80GB) veya 4x RTX 4090.

### 2. vLLM ile Docker Compose Kurulumu vLLM, eşzamanlı yüzlerce kullanıcı isteğini PagedAttention ile bellek şişmesi yaşamadan yönetir.

```yaml version: '3.8' services: vllm-deepseek: image: vllm/vllm-openai:latest container_name: deepseek-local-api runtime: nvidia environment: - HUGGING_FACE_HUB_TOKEN=hf_your_token ports: - "8000:8000" volumes: - ~/.cache/huggingface:/root/.cache/huggingface ipc: host command: > --model deepseek-ai/DeepSeek-R1-Distill-Qwen-14B --quantization awq --max-model-len 8192 --gpu-memory-utilization 0.95 --port 8000 deploy: resources: reservations: devices: - driver: nvidia count: all capabilities: [gpu] ```

### 3. OpenAI Uyumlu İstek Atma Kurulum bittiğinde yerel sunucunuz `http://localhost:8000/v1` adresinden standart OpenAI formatında yanıt verir: ```python from openai import OpenAI

client = OpenAI( base_url="http://localhost:8000/v1", api_key="yerel-sunucu-anahtari" )

response = client.chat.completions.create( model="deepseek-ai/DeepSeek-R1-Distill-Qwen-14B", messages=[{"role": "user", "content": "Verilen metni Türkçe özetle."}] ) print(response.choices[0].message.content) ```

### 4. Güvenlik ve Reverse Proxy API'yi şirket ağına açarken önüne Nginx veya Traefik koyarak SSL sertifikası ve Bearer Token kimlik doğrulaması ekleyin.

Etkileri

Kimi, nasıl etkiliyor?

Kurumların KVKK uyumlu, sıfır veri çıkışlı ve bütçe dostu yapay zeka altyapısına sahip olmasını sağlar.

Sırada ne var?

Bundan sonra ne olacak?

HuggingFace üzerinden optimize edilmiş AWQ modellerini indirip Docker container'ı ayağa kaldırın.

Bunu Neden Bilmelisin?

Hassas müşteri verilerini üçüncü taraf bulut API'lerine göndermek istemeyen kurumlar için sıfır veri sızıntısı ve sabit altyapı maliyeti sunar.

Geçmişi Ne?

vLLM kütüphanesinin PagedAttention algoritması sayesinde açık kaynak modellerin çıkarım (inference) hızları ticari API seviyesine ulaştı.

Büyük Resim

Yapay zekada açık kaynak modellerin kapalı modellere yetişmesi, şirketlerin teknolojik bağımsızlığını kazanmasını hızlandırıyor.

Kaynak (neleroluyor. Özel Analiz)

📰 İlgili Haberler