Ana Sayfa/Teknolojiler/Ev Bilgisayarında Yerel Sinir Ağları: Kuantumlama ve QLoRA ile LLM Kurulumu
Teknolojiler

Ev Bilgisayarında Yerel Sinir Ağları: Kuantumlama ve QLoRA ile LLM Kurulumu

Yerel sinir ağı çalıştırmak artık güçlü sunucular gerektirmiyor. Kuantumlama ve QLoRA teknolojileriyle büyük dil modelleri ev bilgisayarlarında kolayca kurulabiliyor, veri gizliliği ve maliyet avantajı sağlıyor. Bu yazıda, sistem gereksinimleri ve en iyi LLM alternatiflerini öğrenebilirsiniz.

16 Ağu 2026
5 dk
Ev Bilgisayarında Yerel Sinir Ağları: Kuantumlama ve QLoRA ile LLM Kurulumu

Yerel sinir ağı çalıştırma günümüzde artık onlarca endüstriyel hızlandırıcıya sahip sunucu rafları gerektirmiyor. Modern sıkıştırma ve optimizasyon yöntemleri sayesinde, güçlü bir dil modeli doğrudan ev bilgisayarınızda, tüketici sınıfı bir ekran kartıyla kurulabiliyor.

Bu sayede bulut servislerine tamamen bağımsız oluyorsunuz: Sohbetleriniz harici sunuculara gitmez, yanıtlar API sansürüne uğramaz ve üretim süreci internetsiz, abonelik gerektirmeden çalışır.

Kuantumlanmış Modeller Nedir? LLM Sıkıştırması Nasıl Çalışır?

Büyük dil modellerinin (LLM) orijinal ağırlıkları genellikle 16-bit (FP16/BF16) veya 32-bit kayan noktalı sayılarla saklanır. 8 milyar parametreli bir modelin sadece ağırlıklarını yüklemek için en az 16 GB ekran kartı belleği gerekir; bu, bağlam (context) hariçtir.

Kuantumlama, ağırlıkların hassasiyetini 16 bitten 8, 4 veya hatta 2-3 bite düşüren matematiksel bir dönüşümdür. Sayılar, modelin mantıksal bütünlüğünü minimum kayıpla özel algoritmalarla yuvarlanır.

Farklı sıkıştırma biçimleri bulunur:

  • GGUF (önceki adıyla GGML): CPU ve GPU üzerinde llama.cpp gibi kütüphanelerle çalışmak için popüler bir formattır. Katmanları RAM ve VRAM arasında esnek şekilde dağıtmaya olanak tanır.
  • AWQ ve GPTQ: Yalnızca GPU'da yüksek doğruluklu 4-bit kuantumlama algoritmalarıdır.
  • EXL2: NVIDIA ekran kartlarında yüksek üretim hızı sunan katman başına değişken bit oranı formatıdır.

4-bit formatındaki (ör. Q4_K_M) kuantumlanmış modeller, orijinal hallerine göre 3-4 kat daha az yer kaplar ve belleğe çok daha az ihtiyaç duyar. Yanıt kalitesinde ise sadece %1-3'lük bir azalma olur ki bu çoğu uygulamada fark edilmez.

QLoRA Nedir? Evde LLM Nasıl Eğitilir?

QLoRA (Quantized Low-Rank Adaptation), temel modelin 4-bit kuantumlaması ile düşük dereceli adaptörlerin birleşimini kullanan etkili bir ince ayar yöntemidir.

Klasik yöntemde, modelin milyarlarca ağırlığı güncellenir ve bu devasa VRAM gerektirir. QLoRA, temel modeli ultra kompakt 4-bit NormalFloat (NF4) formatında dondurur ve yalnızca küçük adaptör matrisleri (LoRA) eğitilir.

Sayfa tabanlı bellek optimizasyonu (Paged Optimizers) ve Çift Kuantumlama (Double Quantization) sayesinde, QLoRA VRAM ihtiyacını o kadar azaltır ki, 7B-13B parametreli bir modelin ince ayarı evde, 12-16 GB VRAM'li bir ekran kartında yapılabilir.

QLoRA ile Klasik LoRA Arasındaki Fark Nedir?

LoRA, temel model ağırlıklarını FP16/BF16 hassasiyetinde bırakır ve düşük dereceli paralel katmanlar eğitir. Bu, tam eğitime göre ciddi kaynak tasarrufu sağlar; fakat temel ağırlıklar hâlâ çok yer kaplar.

QLoRA bir adım ileri gider:

  1. Temel model 4-bit'e sıkıştırılır ve VRAM'in %75'ine kadar yer açılır.
  2. Aşırı sıkıştırmanın yol açtığı bozulmaları önlemek için kuantumlanmış ölçekleme katsayıları eklenir.
  3. Adaptörler FP16 hassasiyetinde eğitilir, ancak gradyanlar sadece bu katmanlar için hesaplanır; dondurulmuş 4-bit ağırlıklar değişmeden kalır.

Böylece, LoRA ile aynı ince ayar doğruluğuna ulaşılır; fakat çok daha büyük modelleri standart bir oyun bilgisayarında çalıştırmak mümkün olur.

Sistem Gereksinimleri: Yerel Sinir Ağları için Ne Kadar VRAM Gerekli?

Yerel çalıştırmada ana kısıtlama ekran kartı belleği (VRAM) miktarıdır. Ekran kartınızın hızı üretim (token oluşturma) hızını belirler; fakat modelin tamamının GPU'ya sığıp sığmaması, esas olarak bellek kapasitesine bağlıdır.

VRAM yetersizse, bazı katmanlar RAM'e aktarılabilir; fakat bu durumda PCIe veri yolu sınırlamaları nedeniyle üretim hızı ciddi oranda düşer.

Model BoyutuKuantumlama FormatıMinimum VRAMÖnerilen Ekran Kartı
7B - 8B parametre4-bit (Q4_K_M)6-8 GBRTX 3060 / 4060 (8-12 GB)
14B parametre4-bit (Q4_K_M)10-12 GBRTX 4070 / 3080 (12 GB)
32B - 34B parametre4-bit (Q4_K_M)20-24 GBRTX 3090 / 4090 (24 GB)
70B parametre4-bit (Q4_K_M)40-48 GB2 × RTX 3090 / 4090

Bütçe dostu ekran kartı kullanılan ev bilgisayarlarında, kompakt mimariler mükemmel bir çözüm sunar. Optimize edilmiş mimarilerin düşük sistem gereksinimleriyle karmaşık görevleri nasıl çözdüğünü öğrenmek için Küçük Dil Modelleri (SLM) ve LLM: Neden İş Dünyası Kompakt Sinir Ağlarını Tercih Ediyor? başlıklı makaleyi inceleyin.

En İyi Yerel Sinir Ağları: Llama 3 ve GPT Alternatifleri

Açık kaynaklı modeller alanı hızla gelişiyor ve programlama, metin analizi, mantıksal akıl yürütme gibi alanlarda ticari sistemlerle rekabet eden çözümler sunuyor:

  • Llama 3 (8B ve 70B): Meta'nın amiral gemisi ailesi. Llama 3 8B, 4-bit kuantumlamayla erken GPT-4 sürümlerine yakın kalite sunar ve az kaynakla çalışır.
  • Mistral 7B / NeMo 12B: Avrupa menşeli, bağlamı iyi anlayan ve yüksek bilgi yoğunluğuna sahip modeller.
  • Qwen 2.5 (7B-72B): Çoklu dil desteği, karmaşık matematik ve kod üretimiyle öne çıkan bir aile.
  • DeepSeek-Coder / DeepSeek-V2: Kod yazma, yeniden düzenleme ve hata ayıklama için optimize edilmiş özel mimariler.

Böyle sistemleri kendi donanımınızda kurmak, verileriniz ve gizliliğiniz üzerinde tam kontrol sağlar. Endüstride otonom hesaplamalara geçişin detaylarını Kişisel Yapay Zeka Modelleri ve Yerel Sinir Ağları: Bulutsuz Yeni Dönem başlıklı yazımızdan öğrenebilirsiniz.

Yerel LLM Nasıl Kurulur: Ollama ile Hızlı Başlangıç

Ollama, Windows, macOS ve Linux'ta kuantumlanmış sinir ağlarını kurmak ve yönetmek için en kolay araçlardan biridir. Model katmanlarını GPU ve RAM arasında otomatik olarak dağıtır ve yerel bir API sunucusu başlatır.

  1. Kurulum: Resmi ollama.com sitesinden yükleyiciyi indirin ve kurun.
  2. Modeli çalıştırma: Komut satırını (Terminal veya PowerShell) açıp aşağıdaki komutu girin:
    ollama run llama3:8b
  3. Diyalog: İndirme tamamlanınca, model konsolda etkileşimli sohbet modunda açılır.
  4. Grafik arayüzü: ChatGPT benzeri bir web arayüzü için Docker ile Open WebUI'ı kurabilir veya LM Studio ve Chatbox gibi masaüstü istemcileri kullanabilirsiniz. Adres olarak http://localhost:11434 yazmanız yeterli.

Sonuç

Kuantumlama ve QLoRA teknolojisi, kapalı bulut API'leriyle ev kullanıcıları arasındaki donanım bariyerini ortadan kaldırdı. 8-14 milyar parametreli güçlü bir dil modelini çalıştırmak artık on binlerce dolarlık sunucular gerektirmiyor; günlük işler, kodlama ve hassas veri analizi için güçlü bir tüketici ekran kartı ve temel açık kaynak yazılımlar yeterli.

SSS

ChatGPT'yi kendi bilgisayarımda çalıştırabilir miyim?

ChatGPT'nin orijinal kodu ve ağırlıkları OpenAI tarafından kapalı tutulmakta ve sadece kendi bulut sunucularında çalışmaktadır. Ancak, Llama 3 veya Qwen 2.5'in kuantumlanmış sürümleri gibi açık modelleri ev bilgisayarınızda çalıştırabilir ve benzer işlevlere erişebilirsiniz.

LLM'i internetsiz nasıl kullanırım?

Ollama programı ve model dosyalarını bir kez indirdikten sonra internet bağlantısını tamamen kapatabilirsiniz. Tüm hesaplamalar ve çıkarımlar bilgisayarınızın yerel işlemci ve ekran kartında izole şekilde gerçekleştirilir.

Kuantumlanmış modelleri kullanmak mantıklı mı?

Evet, özellikle 4-bit (Q4_K_M gibi) kuantumlama ev kullanımı için en ideal standarttır. VRAM ihtiyacını 3-4 kat azaltırken, üretim kalitesinde sadece %1-3'lük bir kayıpla yanıt doğruluğu %97-99 seviyesinde korunur.

Etiketler:

yerel sinir ağı
kuantumlama
QLoRA
büyük dil modeli
LLM
Ollama
ekran kartı
optimizasyon

Benzer Makaleler