Bu neden önemli?
Yapay zekâyı kendi bilgisayarında çalıştırmak gizlilik ve maliyet açısından cazip. Ama en iyi açık modeller çok büyük. Bellek sınırını aşmanın yolları, yerel yapay zekânın geleceğini belirliyor.
Uzmanlar karışımı ne demek?
Bir dil modeli, milyarlarca sayıdan (parametre) oluşur. Klasik bir modelde her kelime üretilirken bu sayıların hepsi hesaba katılır. Model büyüdükçe hem bellek hem hesap ihtiyacı büyür.
Mixture of Experts (MoE), yani “uzmanlar karışımı” modellerde durum farklı. Modelin içinde yüzlerce küçük alt ağ, yani “uzman” var. Her kelimede küçük bir yönlendirici, o an işe yarayacak birkaç uzmanı seçiyor. Geri kalanlar boşta bekliyor.
Örneğin Qwen3.5-35B-A3B modelinin adı bunu anlatıyor: Toplam 35 milyar parametre, ama her adımda sadece yaklaşık 3 milyarı aktif. DeepSeek, Qwen, GLM gibi büyük açık modellerin çoğu artık bu yapıda.
Sorun: Hesap az, bellek çok
MoE modeller hesap açısından hafif. Ama bir sonraki kelimede hangi uzmanın seçileceğini önceden bilemediğin için normalde bütün modeli belleğe yüklemen gerekiyor. 35 milyar parametre, sıkıştırılmış hâlde bile yaklaşık 20 GB demek. Çoğu ekran kartının (GPU) belleği (VRAM) buna yetmiyor.
Ollama gibi yaygın araçlar bu durumda modelin bir kısmını sabit olarak işlemciye (CPU) bırakıyor. İşe yarıyor ama yavaşlıyor.
FreeToken: GPU belleğini önbellek gibi kullanmak
FreeToken, aralarında Ion Stoica ve Matei Zaharia gibi tanınmış araştırmacıların da bulunduğu bir ekibin açık kaynak projesi. Fikri şu:
- GPU belleği, en sık kullanılan uzmanları tutan bir önbellek gibi davranıyor. Uzun süredir çağrılmayan uzman, yenisine yer açıyor.
- Aranan uzman GPU’da yoksa, sistem o an bellek hızına bakıp işi CPU’da mı yapmanın yoksa uzmanı GPU’ya taşımanın mı daha hızlı olduğuna anlık karar veriyor.
- Uzun istemleri işlerken bir katmanın ağırlıklarını yüklerken öncekini hesaplıyor, böylece bekleme azalıyor.
Makaleye göre bu yöntemle 35B’lik bir model dizüstü GPU’sunda, çok daha büyük modeller de oyun bilgisayarında çalışabiliyor. Videodaki RTX 5090 testinde FreeToken, model VRAM’e sığmadığında Ollama’dan belirgin şekilde hızlı. Model rahatça sığdığında ise Ollama yine önde. Yani bu bir sihirli değnek değil, belirli bir sorunun çözümü.
Flash-MoE: Uzmanları diskten okumak
Flash-MoE daha da ileri gidiyor: Uzmanları belleğe hiç yüklemiyor, gerektiğinde doğrudan SSD’den okuyor. Apple’ın “LLM in a flash” makalesinden ilham alan proje, önce 397 milyar parametreli bir modeli 48 GB belleği olan bir MacBook’ta çalıştırmasıyla ses getirdi.
İlginç bir detay: Geliştirici kendi önbelleğini yazmayı denemiş, ama en iyi sonucu işletim sisteminin kendi dosya önbelleğine güvenerek almış.
Better Stack’in ikinci videosunda bu fikrin iPhone’a taşınmış bir sürümü deneniyor. Videoya göre Qwen3.5-35B-A3B, iPhone 17’de yaklaşık 1,4 GB bellek kullanarak saniyede 11 civarı kelime parçası (token) üretiyor. Bedeli: telefon hızla ısınıyor.
Neden önemli?
Yerel yapay zekâda asıl darboğaz artık işlem gücü değil, bellek. MoE modellerin “her seferinde küçük bir parça” yapısı, bu darboğazı akıllı önbellekle aşmayı mümkün kılıyor. Bu, pahalı sunucular olmadan güçlü modelleri kendi cihazında çalıştırabilmek demek.
Düşün
- Bir modelin cevaplarını buluta göndermeden kendi cihazında üretmesi senin için ne kadar önemli?
- Telefonun ısınması ve pilin bitmesi pahasına yerel model kullanır mıydın?
Bu yazıdaki araçlar Araç Kutusu'nda: Flash-MoE, FreeToken