Takip et

Yapay Zeka Çıkarımını Öncü Şirketlerden Taşıma Rehberi

Yapay Zeka Çıkarımını Öncü Şirketlerden Taşıma Rehberi

Yapay zeka çıkarım yüklerinizi OpenAI ve Anthropic gibi öncü şirketlerden kendi altyapınıza taşıyarak maliyetleri düşürün ve veri güvenliğini sağlayın.

Öncü Yapay Zeka Şirketlerine Bağımlılık Neden Bir Risk Haline Geldi?

Yapay zeka odaklı yazılımlar geliştiren şirketler için OpenAI, Anthropic ve Google gibi öncü (frontier) model sağlayıcılarının sunduğu API servisleri hızlı bir başlangıç imkanı tanır. Ancak, uygulamanız büyüdükçe ve günlük aktif kullanıcı sayısı arttıkça bu bağımlılık ciddi bir operasyonel ve finansal riske dönüşebilir. Çünkü tescilli modellerin kullanım maliyetleri, ölçeklenme aşamasında lineer değil üstel bir şekilde yükselme eğilimindedir. Özellikle milyonlarca istek (request) işleyen kurumsal sistemlerde aylık API faturası, kendi sunucu altyapınızı işletme maliyetinin katbekat üzerine çıkabilir.

Bununla birlikte, tek risk finansal maliyetler değildir. Veri gizliliği ve yasal uyumluluk (KVKK, GDPR, HIPAA gibi) konuları öncü model sağlayıcılarıyla çalışırken en büyük engel olarak karşımıza çıkar. Müşterilerinizin hassas verilerini üçüncü taraf bir bulut sağlayıcısının sunucularına göndermek, birçok sektörde yasal ihlallere yol açabilir. Ayrıca, model sağlayıcılarının uyguladığı oran sınırları (rate limits) ve anlık servis kesintileri, uygulamanızın kesintisiz hizmet vermesini doğrudan engeller. Örneğin, öncü bir şirketin API altyapısında yaşanacak 10 dakikalık bir kesinti, sizin tüm iş akışınızı durdurabilir.

Son olarak, model davranışlarındaki görünmez güncellemeler (silent model drift) yazılımınızın kararlılığını tehdit eder. Servis sağlayıcılar arka planda modelleri güncelledikçe, daha önce sorunsuz çalışan istemleriniz (prompts) beklenmedik çıktılar üretebilir. Bu durum, istem mühendisliği süreçlerinizi sürekli baştan yapmanızı gerektirir. Dolayısıyla, çıkarım (inference) yüklerini kendi kontrolünüzdeki açık kaynak modellere ve kendi bulut/yerel altyapınıza taşımak, uzun vadeli bağımsızlık ve sürdürülebilirlik için kritik bir stratejik hamledir.

Açık Kaynak Büyük Dil Modelleri Yetenek Bakımından Nerede?

Geçmişte açık kaynaklı büyük dil modelleri (LLM), kapalı kaynaklı öncü modellerin performans olarak çok gerisinde kalıyordu. Ancak günümüzde Llama 3.3, DeepSeek-V3, DeepSeek-R1 ve Qwen 2.5 gibi gelişmiş açık ağırlıklı (open-weight) modeller bu aralığı tamamen kapatmıştır. Özellikle belirli bir alana odaklanmış (domain-specific) görevlerde, doğru ince ayar (fine-tuning) yapılmış açık kaynaklı bir model, GPT-4o veya Claude 3.5 Sonnet gibi genel amaçlı modelleri geride bırakabilmektedir.

Açık kaynak ekosisteminin sunduğu en büyük avantaj esnekliktir. Kapalı bir API kullandığınızda modelin iç yapısına, ağırlıklarına veya mantıksal katmanlarına müdahale edemezsiniz. Buna karşın, açık kaynaklı bir modeli kendi veriseti kombinasyonlarınızla eğitebilir, belirli bir çıktı formatına tam uyumlu hale getirebilir ve güvenlik filtrelerini kendi standartlarınıza göre yapılandırabilirsiniz. Çeviri, metin özetleme, kod üretimi, veri çıkarma ve yapılandırılmış JSON çıktısı oluşturma gibi yaygın kullanım senaryolarında 8B ile 70B parametre aralığındaki modeller mükemmel sonuçlar sunmaktadır.

Aşağıdaki tabloda, popüler açık kaynaklı modeller ile öncü kapalı kaynaklı modellerin temel karakteristikleri karşılaştırılmıştır:

Model Ailesi Erişim Modeli Maliyet Yapısı Veri Gizliliği Özelleştirilebilirlik
GPT-4o / Claude 3.5 Kapalı API Jeton (Token) Başına Ödeme Üçüncü Taraf Sunucular Sadece İstem (Prompt) Seviyesinde
Llama 3.3 (70B) Açık Ağırlıklı Sabit Altyapı / GPU Maliyeti Tam Kontrol (Kendi Sunucunuz) Tam İnce Ayar (LoRA / SFT)
DeepSeek-R1 / V3 Açık Ağırlıklı Sabit Altyapı / GPU Maliyeti Tam Kontrol (Kendi Sunucunuz) Ağırlık ve Mantık Müdahalesi
Qwen 2.5 (32B/72B) Açık Ağırlıklı Sabit Altyapı / GPU Maliyeti Tam Kontrol (Kendi Sunucunuz) Yüksek Özelleştirilebilirlik

Göç Öncesi Altyapı ve Donanım İhtiyaçları Nasıl Hesaplanır?

Kendi çıkarım altyapınızı kurmadan önce yapmanız gereken ilk iş, grafik işlemci (GPU) bellek (VRAM) ihtiyacını doğru şekilde hesaplamaktır. Bir modelin sunucuda çalışabilmesi için hem model ağırlıklarının hem de bağlam belleğinin (KV Cache) VRAM içerisine sığması gerekir. Temel bir kural olarak, FP16 (16-bit hassasiyet) formatındaki her 1 milyar parametre yaklaşık 2 GB VRAM alanı kaplar. Örneğin, 70 milyar parametreli (70B) bir model yalnızca ağırlıklar için 140 GB VRAM gerektirir.

Ancak, nicemleme (quantization) teknikleri sayesinde bu devasa bellek gereksinimleri drastik bir şekilde düşürülebilir. INT8 veya INT4 (AWQ, GPTQ, Unsloth) yöntemleriyle model kalitesinden neredeyse hiç ödün vermeden bellek tüketimini %50 ila %75 oranında azaltmak mümkündür. Örneğin, 4-bit AWQ ile nicemlenmiş 70B bir model yaklaşık 35-40 GB VRAM içerisinde çalışabilir hale gelir. Bu da modeli iki adet NVIDIA RTX 4090 veya tek bir NVIDIA A100 / H100 GPU üzerinde çalıştırmanıza olanak tanır.

Bunun yanında, eşzamanlı kullanıcı sayısını (concurrency) ve saniye başına işlenen jeton sayısını (tokens per second) hesaba katmalısınız. İhtiyacınızı belirlerken şu adımları izleyebilirsiniz:

  • Model Boyutu Seçimi: Görevin karmaşıklığına göre 8B, 14B, 32B veya 70B boyutunda bir model belirleyin.
  • Nicemleme Derecesi: Performans ve hız dengesine göre FP8 veya INT4 AWQ formatını tercih edin.
  • Eşzamanlı Yük Hesabı: Bağlam uzunluğuna (Context Window) bağlı olarak KV Cache için ekstra VRAM payı (%20-%30) ayırın.
  • GPU Mimarisi: Kurumsal ölçek için NVIDIA H100, A100 veya L40S; maliyet odaklı başlangıçlar için veri merkezinde barındırılan RTX 4090 kartlarını değerlendirin.

En Popüler Çıkarım Motorlarının Karşılaştırması

Çıkarım mimarisinin kalbini “Inference Engine” olarak adlandırılan yüksek performanslı sunucu yazılımları oluşturur. Ham PyTorch kodları ile üretim ortamında canlı servis sunmak aşırı yavaş ve verimsiz olacaktır. Bu nedenle, C++ ve CUDA seviyesinde optimize edilmiş çıkarım motorları kullanılmalıdır. Günümüzde öne çıkan üç ana motor bulunmaktadır: vLLM, Hugging Face TGI (Text Generation Inference) ve Ollama.

vLLM, PagedAttention algoritması sayesinde bellek yönetimini sanal bellek mimarisine benzer şekilde yaparak boşta kalan VRAM israfını sıfıra indirir. Bu sayede, yüksek eşzamanlı istek altında en yüksek bant genişliğini (throughput) sağlar. TGI ise Hugging Face ekosistemiyle mükemmel bir entegrasyona sahiptir ve kurumsal güvenlik özellikleri sunar. Ollama ise daha çok lokal geliştirme ve hızlı prototipleme süreçleri için idealdir.

Kriter vLLM TGI (Hugging Face) Ollama
Öncelikli Kullanım Amacı Yüksek Trafikli Üretim Ortamı Kurumsal Yaygınlaştırma Yerel Geliştirme / Test
Performans (Throughput) Çok Yüksek (PagedAttention) Yüksek Orta
OpenAI API Uyumluluğu Tam Uyumlu (Yerleşik) Kısmi / Adaptör ile Uyumlu
Çoklu GPU (Tensor Parallel) Mükemmel Destek Mükemmel Destek Sınırlı
Kurulum Kolaylığı Orta (Docker/Pip) Orta (Docker) Çok Kolay (Tek Tık)

Uygulamalı Göç: vLLM ile OpenAI Uyumlu API Sunucusu Kurulumu

Göç sürecinin en pratik yanı, vLLM gibi modern motorların OpenAI ile tamamen aynı API uç noktalarını (endpoints) sunmasıdır. Bu durum, mevcut kod tabanınızdaki binlerce satırlık mantığı değiştirmeden, yalnızca API adresini (base URL) kendi sunucunuza yönlendirerek göçü tamamlamanızı sağlar.

İlk adım olarak, GPU destekli sunucunuza gerekli bağımlılıkları ve vLLM kütüphanesini yüklemeniz gerekir. Aşağıdaki terminal komutuyla kurulumu gerçekleştirebilirsiniz:

pip install vllm
vllm serve Qwen/Qwen2.5-32B-Instruct-AWQ \
    --quantization awq \
    --tensor-parallel-size 2 \
    --max-model-len 8192 \
    --port 8000

Yukarıdaki komut, Qwen 2.5 32B modelini AWQ nicemlemesiyle iki GPU üzerine dağıtarak (Tensor Parallelism) 8000 portunda yayına alır. Sunucunuz çalışmaya başladıktan sonra, Python tarafındaki OpenAI SDK istemcinizi yalnızca birkaç satır değiştirerek kendi yerel altyapınıza bağlayabilirsiniz:

from openai import OpenAI

# OpenAI istemcisini kendi vLLM sunucunuza yönlendirin
client = OpenAI(
    base_url="http://localhost:8000/v1",
    api_key="EMPTY"  # Kendi sunucunuzda API anahtarı kontrolünü opsiyonel yapabilirsiniz
)

response = client.chat.completions.create(
    model="Qwen/Qwen2.5-32B-Instruct-AWQ",
    messages=[
        {"role": "system", "content": "Sen yardımcı bir yazılım mimarısın."},
        {"role": "user", "content": "Kendi LLM sunucumuza geçmenin avantajları nelerdir?"}
    ],
    temperature=0.7,
    max_tokens=500
)

print(response.choices[0].message.content)

Görüldüğü üzere, mevcut kod yapınızda hiçbir temel mantık değişmemiştir. Sadece uç nokta adresi (base_url) ve model ismi güncellenmiştir. Bu durum, göç sürecindeki riskleri minimuma indirir ve gerektiğinde eski sisteme hızlıca geri dönme (fallback) imkanı tanır.

Gerçek Dünya Vaka Analizi: Müşteri Hizmetlerinde %75 Maliyet Tasarrufu

Teorik avantajların ötesinde, gerçek bir üretim senaryosunu incelemek göçün etkilerini anlamak açısından faydalı olacaktır. Türkiye merkezli bir e-ticaret platformu, günlük ortalama 15 milyon jeton (token) işleyen bir yapay zeka müşteri asistanına sahipti. Sistem başlangıçta OpenAI GPT-4o API’si üzerinden çalışıyordu. Ancak aylık API faturaları 12.000 Dolar seviyesine ulaştığında şirket altyapıyı kendi bünyesine taşımaya karar verdi.

Şirket mühendisleri ilk olarak müşteri mesajlarının geçmiş verilerini analiz etti ve sistemin gereksinimlerini belirledi. Ardından, Llama-3.1-70B-Instruct modelini kendi müşteri hizmetleri verisetleri ile LoRA (Low-Rank Adaptation) tekniğini kullanarak ince ayardan geçirdiler. Eğitilen model, şirketin ürün kataloğunu ve iade politikalarını GPT-4o’dan daha doğru şekilde yanıtlamaya başladı.

Altyapı olarak aylık toplam maliyeti 2.800 Dolar olan 2x NVIDIA A100 (80GB) bulut sunucu kiralandı. vLLM motoru kurularak sistem üretime alındı. Göç sonrası elde edilen sonuçlar şu şekildedir:

  • Aylık Maliyet: 12.000 Dolar’dan 2.800 Dolar’a düştü (%76.6 maliyet tasarrufu).
  • Gecikme Süresi (Latency): İlk Jeton Süresi (TTFT) 850ms’den 240ms’ye geriledi.
  • Veri Güvenliği: Müşteri TC Kimlik No, adres ve sipariş bilgileri hiçbir üçüncü taraf servise aktarılmadan tamamen şirket içi sunucularda işlendi.
  • Hizmet Kesintisizliği: Üçüncü taraf API kota sınırları ortadan kaldırıldığı için anlık kampanya dönemlerindeki yüksek trafik sorunsuz yönetildi.

İleri Düzey Performans Optimizasyon Teknikleri Nelerdir?

Kendi çıkarım sunucularınızı işletirken sistem kapasitesini maksimuma çıkarmak için bazı ileri düzey teknikleri uygulamanız gerekir. Tek bir GPU sunucusundan en yüksek verimi almak, doğru mimari yapılandırmalara bağlıdır.

Sürekli Demetleme (Continuous Batching)

Geleneksel demetleme (batching) yöntemlerinde, tüm isteklerin tamamlanması beklenir ve en uzun yanıt kadar zaman kaybedilir. Sürekli demetleme tekniğinde ise, bir istek tamamlandığı an oluşan boş jenerasyon adımı (iteration) yeni gelen bir istek ile doldurulur. vLLM bu işlemi otomatize ederek sunucu throughput değerini 23 katına kadar çıkarabilir.

Spekülatif Çıkarım (Speculative Decoding)

Yüksek parametreli büyük bir modeli (örneğin 70B) çalıştırmak yavaştır. Spekülatif çıkarımda, küçük ve hızlı bir taslak model (örneğin 8B) hızlıca birkaç jeton üretir. Ardından ana büyük model (70B) bu jetonları tek bir ileri besleme (forward pass) adımında paralel olarak doğrular. Bu teknik, çıktı kalitesinden hiçbir şey kaybetmeden çıkarım hızını 1.5x – 2.5x kat artırabilir.

Yapılandırılmış Çıktı Garantisi (Structured Outputs)

Öncü modellerde JSON formatında çıktı almak için istem mühendisliğine güvenilir. Kendi sunucunuzda ise Outlines veya vLLM’in guided_decoding özelliğini kullanarak modelin yalnızca belirlediğiniz JSON şemasına (JSON Schema) uyan jetonları üretmesini dil bilgisi seviyesinde (Grammar-guided generation) zorunlu kılabilirsiniz. Bu sayede hatalı JSON çıktı alma riski tamamen sıfırlanır.

Yapay Zeka Çıkarım Göçü Hakkında Sıkça Sorulan Sorular

Açık kaynaklı modeller kapalı modellere göre güvenlik açısından zayıf mıdır?

Hayır, aksine açık kaynaklı modeller kod ve ağırlık seviyesinde şeffaf olduğu için güvenlik denetimlerine daha uygundur. Kendi sunucunuzda çalıştırdığınız bir model dış dünyaya veri sızdırmaz. Ancak modelin zararlı içerik üretmesini engellemek için Llama Guard gibi ek güvenlik katmanlarını çıkarım hattınıza (pipeline) eklemeniz tavsiye edilir.

Kendi GPU sunucumuzu satın almak mı yoksa buluttan kiralamak mı daha mantıklıdır?

Bu durum iş yükünüzün sürekliliğine bağlıdır. Eğer 7/24 kesintisiz ve yüksek hacimli bir çıkarım yükünüz varsa, GPU sunucularını satın almak (On-Premise) uzun vadede en ucuz seçenektir. Ancak dalgalı bir trafiğiniz varsa veya başlangıç aşamasındaysanız, RunPod, Lambda Labs veya AWS/GCP gibi bulut sağlayıcılarından saatlik GPU kiralamak esneklik sağlar.

API istemci kodlarımızda radikal değişiklikler yapmamız gerekecek mi?

Hayır. vLLM ve TGI gibi modern çıkarım motorları OpenAI REST API standartlarını destekler. Mevcut yazılımınızda yalnızca sunucu bağlantı adresini (base_url) ve model adını değiştirerek göçü birkaç dakika içinde tamamlayabilirsiniz.

Model güncellendiğinde altyapıyı nasıl güncel tutabiliriz?

Açık kaynak dünyası çok hızlı gelişmektedir. Yeni bir model versiyonu (örneğin Llama 3.3 yerine Llama 4) çıktığında, yeni model ağırlıklarını sunucunuza indirip çıkarım motorunuzu yeniden başlatmanız yeterlidir. Kod tabanınızda hiçbir değişiklik yapmadan sisteminizi en güncel modele terfi ettirebilirsiniz.

Yorumlar
İçeriği beğendiniz mi? Bir tartışma başlatın veya görüşlerinizi paylaşın.
Yorum Yaz

Bir yanıt yazın

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir

E-posta Bülteni
Yazılım Topluluğuna Katılın
En son güncellemeleri, yaratıcı ipuçlarını ve özel kaynakları doğrudan e-posta kutunuza alın. Tasarım ve inovasyonun geleceğini birlikte keşfedelim.