Bu neden önemli?
Kod ajanlarının arayüzü ile arkasındaki model aslında birbirinden ayrılabilir. Bunu bilmek, maliyeti, gizliliği ve hangi modeli kullanacağını senin kontrolüne veriyor.
Araç ile model ayrı şeyler
Claude Code, terminalde çalışan bir kod ajanı. Dosyalarını okuyor, değiştiriyor, komut çalıştırıyor. Ama bu işleri yapan “beyin” aslında ayrı bir yerde: Anthropic’in sunucularındaki Claude modeli. Claude Code, modelle belirli bir API (programların birbiriyle konuşma kuralları) üzerinden haberleşiyor.
Bu şu anlama geliyor: Aynı dili konuşan başka bir sunucu bulursan, Claude Code’u ona da bağlayabilirsin. Ollama tam da bunu sağlıyor.
Ollama ne?
Ollama, açık ağırlıklı modelleri kendi bilgisayarında çalıştırmak için ücretsiz ve açık kaynak bir araç. Ağırlıkları herkese açık olan modelleri, yani Google’ın Gemma’sını, Alibaba’nın Qwen’ini, DeepSeek’i ya da Z.ai’nin GLM’ini tek komutla indirip çalıştırıyor:
ollama run gemma4
Model bilgisayarında yoksa önce iniyor, sonra sohbet başlıyor. Arka planda da diğer programların bağlanabileceği bir sunucu açıyor. Görüntü anlayabilen modellerle bir resim gösterip ne olduğunu da sorabiliyorsun. İstersen Ollama’nın kendi bulutunda çalışan büyük modelleri de aynı yoldan kullanabiliyorsun.
Claude Code’u bağlamak
Ollama’nın belgelerine göre en kısa yol şu komut:
ollama launch claude
Ya da elle yapmak istersen, Claude Code’a nereye bağlanacağını ortam değişkenleriyle söylüyorsun: Adres olarak Anthropic yerine yerel Ollama sunucusunu (http://localhost:11434) veriyorsun, kimlik bilgisi olarak da ollama yazıyorsun.
Sonuç: Claude Code’u her zamanki gibi kullanıyorsun, ama cevapları kendi bilgisayarındaki bir model veriyor. Videoda model, Gemma olmasına rağmen kendini “Claude Code” diye tanıtıyor. Çünkü aracın ona verdiği talimatlar değişmedi, sadece arkadaki beyin değişti.
Beklentini doğru ayarla
Başlıktaki “%99 daha ucuz” iddiası kulağa hoş geliyor ama bazı gerçekler var:
- Kalite farkı. Kendi bilgisayarında çalışabilen modeller, en büyük kapalı modellerle aynı seviyede değil. Basit işlerde iyi, karmaşık görevlerde zorlanabilirler.
- Donanım. Model ne kadar büyükse o kadar bellek ister. Ekran kartı belleği azsa küçük modellerle yetinmen gerekir.
- Bağlam penceresi. Modelin aynı anda “aklında tutabildiği” metin miktarına context window deniyor. Ollama varsayılan olarak bunu ekran kartı belleğine göre ayarlıyor: 24 GB’ın altında sadece 4 bin token. Kod ajanları için bu çok az. Ollama da en az 64 bin öneriyor. Bunu ayarlardan artırabilirsin ama daha fazla bellek gerekir.
- Mac’te hız. Ollama, Apple Silicon’da Apple’ın kendi makine öğrenmesi altyapısı MLX’e geçti. Bu, Mac’lerde belirgin bir hızlanma sağlıyor.
Diğer seçenekler
- LM Studio: Aynı işi güzel bir grafik arayüzle yapıyor. Yerel kullanım için Ollama’ya en yakın rakip.
- vLLM: Modelleri çok sayıda kullanıcıya servis etmek için tasarlanmış, sunucu tarafında çok daha hızlı. Kendi servisini kuracaksan daha uygun.
Düşün
- Kodunun hiçbir şirketin sunucusuna gitmemesi senin için ne kadar önemli? Bunun için ne kadar kaliteden vazgeçerdin?
- Bir ajanın gücü ne kadar araçtan, ne kadar modelden geliyor?
Bu yazıdaki araçlar Araç Kutusu'nda: Ollama