Yerel sinir ağı çalıştırmak artık güçlü sunucular gerektirmiyor. Kuantumlama ve QLoRA teknolojileriyle büyük dil modelleri ev bilgisayarlarında kolayca kurulabiliyor, veri gizliliği ve maliyet avantajı sağlıyor. Bu yazıda, sistem gereksinimleri ve en iyi LLM alternatiflerini öğrenebilirsiniz.
Yerel sinir ağı çalıştırma günümüzde artık onlarca endüstriyel hızlandırıcıya sahip sunucu rafları gerektirmiyor. Modern sıkıştırma ve optimizasyon yöntemleri sayesinde, güçlü bir dil modeli doğrudan ev bilgisayarınızda, tüketici sınıfı bir ekran kartıyla kurulabiliyor.
Bu sayede bulut servislerine tamamen bağımsız oluyorsunuz: Sohbetleriniz harici sunuculara gitmez, yanıtlar API sansürüne uğramaz ve üretim süreci internetsiz, abonelik gerektirmeden çalışır.
Büyük dil modellerinin (LLM) orijinal ağırlıkları genellikle 16-bit (FP16/BF16) veya 32-bit kayan noktalı sayılarla saklanır. 8 milyar parametreli bir modelin sadece ağırlıklarını yüklemek için en az 16 GB ekran kartı belleği gerekir; bu, bağlam (context) hariçtir.
Kuantumlama, ağırlıkların hassasiyetini 16 bitten 8, 4 veya hatta 2-3 bite düşüren matematiksel bir dönüşümdür. Sayılar, modelin mantıksal bütünlüğünü minimum kayıpla özel algoritmalarla yuvarlanır.
Farklı sıkıştırma biçimleri bulunur:
4-bit formatındaki (ör. Q4_K_M) kuantumlanmış modeller, orijinal hallerine göre 3-4 kat daha az yer kaplar ve belleğe çok daha az ihtiyaç duyar. Yanıt kalitesinde ise sadece %1-3'lük bir azalma olur ki bu çoğu uygulamada fark edilmez.
QLoRA (Quantized Low-Rank Adaptation), temel modelin 4-bit kuantumlaması ile düşük dereceli adaptörlerin birleşimini kullanan etkili bir ince ayar yöntemidir.
Klasik yöntemde, modelin milyarlarca ağırlığı güncellenir ve bu devasa VRAM gerektirir. QLoRA, temel modeli ultra kompakt 4-bit NormalFloat (NF4) formatında dondurur ve yalnızca küçük adaptör matrisleri (LoRA) eğitilir.
Sayfa tabanlı bellek optimizasyonu (Paged Optimizers) ve Çift Kuantumlama (Double Quantization) sayesinde, QLoRA VRAM ihtiyacını o kadar azaltır ki, 7B-13B parametreli bir modelin ince ayarı evde, 12-16 GB VRAM'li bir ekran kartında yapılabilir.
LoRA, temel model ağırlıklarını FP16/BF16 hassasiyetinde bırakır ve düşük dereceli paralel katmanlar eğitir. Bu, tam eğitime göre ciddi kaynak tasarrufu sağlar; fakat temel ağırlıklar hâlâ çok yer kaplar.
QLoRA bir adım ileri gider:
Böylece, LoRA ile aynı ince ayar doğruluğuna ulaşılır; fakat çok daha büyük modelleri standart bir oyun bilgisayarında çalıştırmak mümkün olur.
Yerel çalıştırmada ana kısıtlama ekran kartı belleği (VRAM) miktarıdır. Ekran kartınızın hızı üretim (token oluşturma) hızını belirler; fakat modelin tamamının GPU'ya sığıp sığmaması, esas olarak bellek kapasitesine bağlıdır.
VRAM yetersizse, bazı katmanlar RAM'e aktarılabilir; fakat bu durumda PCIe veri yolu sınırlamaları nedeniyle üretim hızı ciddi oranda düşer.
| Model Boyutu | Kuantumlama Formatı | Minimum VRAM | Önerilen Ekran Kartı |
|---|---|---|---|
| 7B - 8B parametre | 4-bit (Q4_K_M) | 6-8 GB | RTX 3060 / 4060 (8-12 GB) |
| 14B parametre | 4-bit (Q4_K_M) | 10-12 GB | RTX 4070 / 3080 (12 GB) |
| 32B - 34B parametre | 4-bit (Q4_K_M) | 20-24 GB | RTX 3090 / 4090 (24 GB) |
| 70B parametre | 4-bit (Q4_K_M) | 40-48 GB | 2 × RTX 3090 / 4090 |
Bütçe dostu ekran kartı kullanılan ev bilgisayarlarında, kompakt mimariler mükemmel bir çözüm sunar. Optimize edilmiş mimarilerin düşük sistem gereksinimleriyle karmaşık görevleri nasıl çözdüğünü öğrenmek için Küçük Dil Modelleri (SLM) ve LLM: Neden İş Dünyası Kompakt Sinir Ağlarını Tercih Ediyor? başlıklı makaleyi inceleyin.
Açık kaynaklı modeller alanı hızla gelişiyor ve programlama, metin analizi, mantıksal akıl yürütme gibi alanlarda ticari sistemlerle rekabet eden çözümler sunuyor:
Böyle sistemleri kendi donanımınızda kurmak, verileriniz ve gizliliğiniz üzerinde tam kontrol sağlar. Endüstride otonom hesaplamalara geçişin detaylarını Kişisel Yapay Zeka Modelleri ve Yerel Sinir Ağları: Bulutsuz Yeni Dönem başlıklı yazımızdan öğrenebilirsiniz.
Ollama, Windows, macOS ve Linux'ta kuantumlanmış sinir ağlarını kurmak ve yönetmek için en kolay araçlardan biridir. Model katmanlarını GPU ve RAM arasında otomatik olarak dağıtır ve yerel bir API sunucusu başlatır.
ollama run llama3:8b
http://localhost:11434 yazmanız yeterli.Kuantumlama ve QLoRA teknolojisi, kapalı bulut API'leriyle ev kullanıcıları arasındaki donanım bariyerini ortadan kaldırdı. 8-14 milyar parametreli güçlü bir dil modelini çalıştırmak artık on binlerce dolarlık sunucular gerektirmiyor; günlük işler, kodlama ve hassas veri analizi için güçlü bir tüketici ekran kartı ve temel açık kaynak yazılımlar yeterli.
ChatGPT'nin orijinal kodu ve ağırlıkları OpenAI tarafından kapalı tutulmakta ve sadece kendi bulut sunucularında çalışmaktadır. Ancak, Llama 3 veya Qwen 2.5'in kuantumlanmış sürümleri gibi açık modelleri ev bilgisayarınızda çalıştırabilir ve benzer işlevlere erişebilirsiniz.
Ollama programı ve model dosyalarını bir kez indirdikten sonra internet bağlantısını tamamen kapatabilirsiniz. Tüm hesaplamalar ve çıkarımlar bilgisayarınızın yerel işlemci ve ekran kartında izole şekilde gerçekleştirilir.
Evet, özellikle 4-bit (Q4_K_M gibi) kuantumlama ev kullanımı için en ideal standarttır. VRAM ihtiyacını 3-4 kat azaltırken, üretim kalitesinde sadece %1-3'lük bir kayıpla yanıt doğruluğu %97-99 seviyesinde korunur.