54 GB'lık Yapay Zeka 8 GB Laptopa Nasıl Sığıyor?
Bir yapay zeka modelinin ağırlıkları düz haliyle yüz gigabaytlarca yer tutar ve onu çalıştıran makineler bir arabadan pahalıdır. Ama aynı modelin küçültülmüş bir sürümü, internet bağlantısı bile olmayan sıradan bir dizüstünde çalışıyor. Arada sihir yok — üç mühendislik hilesi var.
Bu video "nasıl kurulur" anlatmıyor. Bir sorunun peşinden gidiyor: yapay zeka neden bulut istiyordu, ve neden artık istemiyor?
Birinci hile kuantizasyon. Model ağırlıkları on altı bitlik sayılar olarak saklanıyordu; o hassasiyetin çoğu israftı. Sayıları dört bite indirdiğinizde dosya dörtte birine iniyor ve cevaplar hâlâ işe yarıyor — çünkü bir ağırlığın tam değeri değil, komşularına göre yeri önemli.
İkinci hile uzman karışımı. Otuz milyar parametrelik bir modelin her soruda otuz milyarı birden çalışmıyor. Bir yönlendirici hangi uzmanların uyanacağına karar veriyor; geri kalanı uyumaya devam ediyor. Diskte büyük, hesapta küçük.
Üçüncü hile bellek muhasebesi. Çoğu kurulum burada batıyor, çünkü insanlar yalnız model dosyasına bakıyor. Oysa belleğe model artı KV önbelleği artı işletim sistemi giriyor. KV önbelleği siz yazdıkça büyüyen bir not defteri — hesaba katılmayınca sistem takas alanına düşüyor ve her şey beş on kat yavaşlıyor.
Sonra somut rakamlar: 8 GB belleğe ne sığar, 16 GB'ın tatlı noktası nerede, saniyede kaç kelime okuma hızını geçer. Ve asıl ilginç soru: küçük model neden hâlâ akıllı? Çünkü küçültülmedi — damıtmayla yetiştirildi.
Kapanışta dürüst kısım da var: yerel model bulutun yerini tutmuyor, ve "bedava" olan şey aslında bir hamle.
🤖 İLGİLİ VİDEO
Abone olarak yeni içeriklere ulaşabilirsiniz.
📚 Serinin tüm bölümleri: bapati.com/news/yapay-zeka-llm-nasil-calisir-rehber



