KVKK Uyumlu Yerel Yapay Zekâ ve Açık Kaynak LLM Mimarisi
Şirket içi verilerin yurt dışına çıkmasını önleyen yerel açık kaynak LLM kurulumu, vLLM/Ollama mimarisi, KVKK veri güvenliği ve on-premise RAG rehberi.

İçindekiler
Kısa cevap: KVKK uyumlu yerel yapay zekâ mimarisi; kurumun hassas müşteri, hasta veya finansal verilerinin yurt dışındaki bulut API sağlayıcılarına aktarılmasını önlemek amacıyla şirket bünyesindeki özel sunucularda veya izole özel bulut kümelerinde çalıştırılan, açık kaynaklı ağırlıklara sahip büyük dil modelleri ve yerel vektör veritabanları bütünüdür. 6698 sayılı Kişisel Verilerin Korunması Kanunu uyarınca özel nitelikli kişisel verilerin açık rıza olmaksızın sınır ötesine aktarılması ağır idari yaptırımlara yol açabilmektedir. Kişisel Verileri Koruma Kurumu (KVKK) Mevzuatı ve yüksek performanslı açık kaynak çıkarım motoru vLLM Çıkarım Mimarisi Belgeleri ilkeleri çerçevesinde hazırlanan bu teknik rehberde; hava boşluklu (air-gapped) mimariden donanım boyutlandırmasına ve yerel RAG kurulumuna kadar tüm aşamaları belgeliyoruz.
KVKK ve Kurumsal Yapay Zekâda Veri Egemenliği Nedir?
Türkiye'deki finans, sağlık, sigorta, savunma ve hukuk kuruluşları için yapay zekâ kullanmanın önündeki en büyük engel veri güvenliği ve regülasyon uyumluluğudur. Şirket çalışanlarının bilerek veya bilmeyerek ticari sırları, müşteri T.C. kimlik numaralarını veya hasta tahlil sonuçlarını halka açık bulut modellerine yapıştırması çok ciddi KVKK ihlalleri doğurmaktadır.
Veri egemenliği (Data Sovereignty), kurum verisinin kurumun kendi kontrolündeki coğrafi ve fiziksel sınırlarda kalması anlamına gelir. Yerel açık kaynaklı modeller (On-Premise LLM), veri merkezinin dışına tek bir bayt dahi veri sızdırmadan yapay zekânın tüm analitik gücünü kurum bünyesinde çalıştırmayı mümkün kılar.
Hukuki dokümanların otomatik analizi konusundaki çözümlerimizi Hukuk ve Sözleşme Yapay Zekâ Otomasyonu sayfamızda bulabilir; şirketinizin veri mimarisini test etmek için Ücretsiz Güvenlik ve Mimari İnceleme talep edebilirsiniz.
Yerel modeller yalnızca hukuki cezalardan korunmakla kalmaz; kurumun fikri mülkiyetini, patent başvurularını ve özel algoritmalarını da üçüncü taraf yapay zekâ sağlayıcılarının olası veri sızıntılarına veya eğitim havuzlarına dahil edilme riskine karşı tam koruma altına alır.
KVKK Madde 9'da düzenlenen sınır ötesi veri aktarımı hükümleri uyarınca, bulut API'lerine gönderilen verilerin hangi ülkelerdeki sunucularda işlendiğinin belirsiz olması regülasyon risklerini tırmandırmaktadır. Şirket içi yerel altyapı, bu belirsizliği kökünden ortadan kaldırır. Kurum kendi sunucularındaki şifrelenmiş disklerde veriyi saklar ve çıkarımı yerel işlemciler üzerinde icra eder.
Ayrıca 6698 sayılı kanunun 12. maddesi gereğince veri sorumlusu, kişisel verilerin hukuka aykırı olarak işlenmesini ve erişilmesini önlemekle yükümlüdür. Şirket içi kapalı devre çalışan yerel yapay zekâ sunucuları, siber saldırı yüzeyini daraltarak regülasyon uyumunu en üst seviyeye taşır.
Bulut LLM API'leri vs Yerel On-Premise Modeller Karşılaştırması
Genel bulut API sağlayıcıları ile şirket içi yerel model kurulumlarının kurumsal karşılaştırması:
| Kriter & Özellik | Genel Bulut LLM API'leri | Yerel On-Premise Açık Kaynak LLM |
|---|---|---|
| Veri Lokasyonu & KVKK | Yurt dışı sunucular (ABD/AB veri merkezleri) | Şirket içi veri merkezi veya Türkiye içi özel bulut |
| İnternet Bağımlılığı | İnternet kesildiğinde tüm operasyon durur | Hava boşluklu (Air-gapped) izole ağda kesintisiz çalışma |
| Maliyet Yapısı | Kullanılan token başına sürekli değişken fatura | Sabit donanım yatırımı, sınırsız sorgulama (Sıfır token ücreti) |
| Özelleştirme ve İnce Ayar (Fine-Tuning) | Sınırlı veya çok maliyetli kurumsal lisanslar | Kurum içi verilerle tam ağırlık uyarlama (LoRA/QLoRA) |
| Veri İhlali Riski | Üçüncü taraf sağlayıcı riskleri ve API sızıntıları | Şirketin kendi siber güvenlik duvarlarının arkasında tam koruma |
| Gecikme (Latency) | Ağ gecikmesi (Network round-trip: 500-1500 ms) | Yerel ağda ultra düşük gecikme (Yerel bus: 50-200 ms) |
| Denetim ve Loglama | Sağlayıcının sunduğu sınırlı kullanım metrikleri | Tam erişim günlükleri, ham token kayıtları, tam şeffaflık |
Açık Kaynak Model Ekosistemi ve GPU Donanım Mimarisi
2026 yılı açık kaynak ekosisteminde Llama 3 serisi, Mistral ve DeepSeek modelleri kurumsal sınıf seviyeye ulaşmıştır. Kurulum için gereken donanım kapasitesi hedeflenen model boyutuna ve kullanıcı eşzamanlılığına bağlıdır:
- Giriş Seviyesi (8B Parametre / 4-bit Kuantize): Şirket içi dahili departmanlar ve basit sorgulamalar için 1x NVIDIA RTX 4090 veya A5000 (24 GB VRAM) fazlasıyla yeterlidir. Saniyede 40-70 token çıkarım hızı üretir.
- Orta Seviye (14B - 32B Parametre / FP8 Kuantize): Karmaşık sözleşme analizi ve muhasebe RAG sorguları için 2x NVIDIA L40S veya A100 (48-80 GB VRAM) önerilir. Yüksek eşzamanlı sorgularda stabil yanıt süreleri sunar.
- Büyük Kurumsal Seviye (70B Parametre): Yüksek eşzamanlı yüzlerce kullanıcı ve çok dilli derin akıl yürütme için 4x veya 8x NVIDIA H100/A100 sunucu kümeleri konuşlandırılır.
GPU VRAM hesaplama formülü: Gereken VRAM (GB) = (Model Parametre Sayısı x Bit Derinliği / 8) x 1.25 (KV Önbellek Payı). Örneğin FP8 formatındaki 14B parametreli bir model yaklaşık 17.5 GB VRAM tüketir; 24 GB VRAM'e sahip bir iş istasyonunda 8K bağlam penceresiyle rahatlıkla çalışır.
Kuantizasyon teknikleri (AWQ, GPTQ ve GGUF), modellerin ağırlık boyutunu %70'e varan oranda küçültürken doğruluk kaybını yüzde birin altında tutar. Bu sayede orta ölçekli kurumlar bile devasa donanım bütçeleri harcamadan kendi yerel modellerini çalıştırabilir.
RAG sistemlerinde vektör veritabanı seçiminin önemini anlamak için Kurumsal RAG ve Vektör Veritabanı Seçim Rehberi incelememizi mutlaka okuyun.
Çıkarım verimliliği açısından Hugging Face TGI ve vLLM karşılaştırıldığında; vLLM'in PagedAttention ve Chunked Prefill özellikleri sayesinde çok kullanıcılı eşzamanlı isteklerde gecikme dalgalanmaları (latency jitter) %65 oranında azalmaktadır. Bellek parçalanmasının engellenmesi, donanım kaynaklarının tam kapasiteyle kullanılmasını sağlar.
vLLM Çıkarım Motoru ve Yerel Vektör Veritabanı ile Güvenli RAG
Geleneksel PyTorch çıkarım betikleri kurumsal ölçekte yetersiz kalır. Yüksek eşzamanlı kullanıcı trafiğini yönetmek için PagedAttention teknolojisini kullanan vLLM veya Ollama/TGI çıkarım motorları tercih edilir.
vLLM; GPU belleğindeki KV önbellek parçalanmasını engelleyerek aynı donanım üzerinde 4 kata kadar daha yüksek verim (throughput) sağlar. Kurum içi dokümanlar (Qdrant veya Milvus gibi yerel çalışan vektör veritabanlarında) indekslenir. Çalışan bir soru sorduğunda, sadece ilgili paragraflar yerel modelin bağlamına enjekte edilir; böylece model yalnızca şirketin onaylı bilgi kaynaklarından beslenir.
vLLM motoru kurumsal ortamda Docker konteyneri olarak şu parametrelerle ayağa kaldırılır: --model /models/llama-3-14b --tensor-parallel-size 2 --gpu-memory-utilization 0.92 --max-model-len 16384. Bu konfigürasyon, modelin bellek sızıntısı yaşamadan stabil hizmet vermesini garanti eder.
Ayrıca vektör veritabanına aktarılmadan önce kurumsal dokümanlar Microsoft Presidio gibi açık kaynaklı PII temizleme araçlarından geçirilir. T.C. kimlik numaraları, telefonlar ve IBAN bilgileri otomatik olarak maskelenerek (tokenized) depolanır.
Bilgi getirme doğruluğunu maksimize etmek için iki aşamalı arama mimarisi kurulur: İlk aşamada yoğun vektör aramasıyla en alakalı 20 paragraf çekilir; ikinci aşamada ise yerel olarak çalışan BGE-Reranker-v2 modeli bu paragrafları soruya uygunluklarına göre yeniden sıralar. Bu sayede modele sadece en yüksek kaliteli bağlam iletilir.
Vektör indeksleme mimarileri hakkında daha fazla teorik arka plan için RAG Mimarisi ve Kurumsal Bilgi Bankaları yazımızı inceleyebilirsiniz.
Çıkarım Hızı (Tokens/Sec), Gecikme ve Toplam Sahip Olma Maliyeti (TCO) Ölçümü
Yerel sistemlerde Toplam Sahip Olma Maliyeti (TCO) hesaplanırken donanım satın alma bedeli, elektrik tüketimi, sunucu barındırma ve yazılım bakım maliyetleri toplanır.
Günde 50.000'den fazla iç sorgu çalıştıran bir kurumsal organizasyonda, bulut API faturaları yıllık on binlerce doları aşabilmektedir. Tek seferlik kurumsal GPU sunucu yatırımı, 8 ila 12 ay içinde kendini amorti etmekte; sonrasındaki yıllarda ise marjinal sorgulama maliyeti sıfıra yakın kalmaktadır.
Üç yıllık TCO karşılaştırması:
| Gider Kalemi | Bulut API Modeli (Yıllık 18M Token) | Yerel Sunucu Yatırımı (2x L40S) |
|---|---|---|
| 1. Yıl Başlangıç Yatırımı | Sıfır donanım (Kullanıma dayalı) | Donanım & Kurulum: ~14.000 USD |
| Yıllık API / Elektrik Gideri | Yıllık ~12.000 - 18.000 USD API faturası | Yıllık ~800 USD elektrik & soğutma |
| 3 Yıllık Kümülatif Maliyet | ~36.000 - 54.000 USD (Artan trend) | ~16.400 USD (Sabit ve öngörülebilir) |
| KVKK Veri İhlali Ceza Riski | Yüksek (Sınır ötesi aktarım riski) | Minimum Seviyede (Veri kurum içinde kapalı) |
Ayrıca yerel sistemler internet bağlantısının koptuğu veya bulut sağlayıcılarının küresel kesinti yaşadığı anlarda bile kurum içi yerel ağda kesintisiz çalışmaya devam ederek iş sürekliliği (Business Continuity) riskini ortadan kaldırır.
Örnek Senaryo: Hukuk ve Sağlık Sektöründe İzole Evrak Analizi
Özel bir hastane grubu için devreye alınan yerel yapay zekâ klinik karar destek sistemi şu mimariyle çalışmaktadır:
Hasta epikriz raporları, radyoloji bulguları ve tahlil sonuçları hastanenin kendi kapalı veri merkezindeki yerel sunucularda depolanır. Sistem şu döngüyle işler:
- Doktor hasta dosyasını açtığında, yerel ağda çalışan vLLM çıkarım servisi dosyadaki geçmiş tıbbi bulguları özetler.
- Hastanın kullandığı ilaçlar ile yeni yazılacak reçete arasındaki olası ilaç etkileşimleri, Sağlık Bakanlığı onaylı yerel farmakoloji veritabanından sorgulanır.
- Olası bir alerji veya doz aşımı riski varsa doktorun ekranına anlık güvenlik uyarısı çıkarılır.
- Sistem, doktorun onayından geçen epikriz özetini hastane bilgi yönetim sistemine (HBYS) yerel API köprüsüyle kaydeder.
Tüm bu süreçte tek bir hasta kaydı dahi hastane dışındaki bir sunucuya gitmez; KVKK ve Sağlık Bakanlığı veri güvenliği standartları eksiksiz korunur.
Yerel LLM Kurulumunda Sık Yapılan Hatalar ve Güvenlik Açığı Riskleri
Yerel yapay zekâ projelerinde yapılan kritik teknik hatalar:
- Yetersiz VRAM Boyutlandırması: Bağlam penceresi uzadıkça (özellikle 8K veya 32K token girdiğinde) KV önbelleğin GPU belleğini taşırması ve sistemin bellek yetersizliği hatası (OOM) vermesi. Model kuantizasyonu ve bağlam uzunluğu dikkatle hesaplanmalıdır.
- Kötü Vektör Bölümleme (Chunking): Kurumsal PDF belgelerin anlamsız yerlerden bölünmesi nedeniyle yerel modelin doğru bilgiyi bulamaması. Semantik bölümleme ve üstveri (metadata) filtreleme kullanılmalıdır.
- Ağ Güvenliğinin İhmali: Yerel model API'sinin kimlik doğrulamasız olarak tüm şirket ağına açılması; iç ağdaki yetkisiz kullanıcıların model üzerinden hassas verilere ulaşabilmesi. Güçlü API anahtarları ve TLS şifrelemesi şarttır.
- Model Güncellemelerinin Takip Edilmemesi: Açık kaynaklı modeller birkaç ayda bir yeni mimarilerle güncellenir; eskiyen modellerin periyodik olarak yeni sürümlerle değiştirilmesi gerekir.
KVKK Denetim Günlüğü ve Rol Tabanlı Erişim Kontrolü (RBAC)
Yerel yapay zekâ sisteminde Rol Tabanlı Erişim Kontrolü (RBAC) zorunludur. İnsan Kaynakları personeli yalnızca personel evraklarını, muhasebe personeli yalnızca finansal belgeleri sorgulayabilmelidir.
Her sorgulama işlemi kullanıcının kimliği, tarih-saat damgası ve sorgulanan belge referansıyla birlikte değiştirilemez denetim günlüklerine (Audit Logs) yazılır. Böylece olası bir KVKK denetiminde kurum, verilerin nasıl korunduğunu eksiksiz olarak kanıtlayabilir.
Yetkilendirme katmanı, vektör veritabanı seviyesinde filtrelenir; böylece yapay zekâ yanıt üretirken kullanıcının görmeye yetkili olmadığı belgeleri asla bağlama dahil edemez. Bu çift katmanlı güvenlik, iç tehditleri ve veri sızıntılarını tamamen engeller.
Ayrıca VERBİS (Veri Sorumluları Sicil Bilgi Sistemi) beyanlarında kurumun kişisel verileri hangi yapay zekâ algoritmalarıyla işlediği açıkça tanımlanmalı, çalışanlara ve müşterilere yönelik aydınlatma yükümlülükleri eksiksiz tamamlanmalıdır. Kriptografik günlükler WORM (Write Once, Read Many) standartlarında saklanarak geriye dönük müdahalelere karşı güvence altına alınır.
📋 Kurumsal Sistem Prompt Şablonu (XML Kurgulu)
Claude 3.7 ve GPT-4o ile tam uyumlu, halüsinasyonu engelleyen deterministik JSON çıktı şablonu:
<system_instructions>
<role>Sen kıdemli bir kurumsal veri ve otomasyon mimarisisin.</role>
<rules>
1. Yalnızca verilen bağlama sadık kal, eksik verileri null ata.
2. Yanıtı saf JSON şemasında döndür.
</rules>
<output_schema>{ "intent": "sales | support", "status": "verified" }</output_schema>
</system_instructions>Sıkça Sorulan Sorular
Açık kaynaklı yerel modeller kapalı bulut modelleri (GPT-4o, Claude 3.5) kadar başarılı mı?
Genel kültür veya devasa yaratıcı yazarlık görevlerinde en üst düzey kapalı modeller önde olsa da; belirli bir kurumsal görevde (doküman sınıflandırma, SQL üretme, müşteri desteği, sözleşme analizi) açık kaynaklı 7B-70B parametreli modeller veya damıtılmış akıl yürütme modelleri (DeepSeek R1, Llama 3) doğru RAG mimarisiyle kapalı modellerle eşdeğer doğruluk sunmaktadır.
Şirket bünyesinde yerel bir LLM çalıştırmak için ne kadarlık bir donanım yatırımı gerekir?
Kuantize edilmiş 8B-14B parametreli modeller tek bir kurumsal iş istasyonunda (24GB VRAM'e sahip NVIDIA RTX 4090 veya A5000) yüksek hızda çalışabilir. 70B ölçeğindeki büyük modeller içinse 2x veya 4x NVIDIA L40S/A100 GPU sunucu altyapısı önerilir.
Yerel yapay zeka kurulumunda şirket verilerimiz internete hiç bağlanmadan çalışabilir mi?
Evet. Hava boşluklu (air-gapped) mimari sayesinde model ağırlıkları ve yerel vektör veritabanı tamamen kurum içi izole yerel ağda (LAN) çalıştırılabilir; böylece hiçbir veri paketi şirket dışına çıkamaz.
KVKK denetçileri yerel yapay zeka sistemlerinde neye dikkat eder?
Denetçiler; kişisel verilerin aktarıldığı sınır ötesi sunucuların bulunup bulunmadığına, sistem erişim loglarının (kim, ne zaman, hangi veriyi sorguladı) kriptografik olarak saklanmasına ve kullanıcı yetkilendirme (RBAC) matrisine odaklanır.