← Teknoloji Radarı

Yapay zekâ

Ollama ile Claude Code'u açık modellerle çalıştırmak

Ollama, açık modelleri kendi bilgisayarında tek komutla çalıştırmanı sağlıyor. Claude Code gibi kod ajanlarını da buna bağlayabiliyorsun: Araç aynı kalıyor, arkadaki model değişiyor.

Bu neden önemli?

Kod ajanlarının arayüzü ile arkasındaki model aslında birbirinden ayrılabilir. Bunu bilmek, maliyeti, gizliliği ve hangi modeli kullanacağını senin kontrolüne veriyor.

Run Claude Code with Ollama for 99% Cheaper AI · Better Stack, YouTube (İngilizce). Tıklayınca video yüklenir.

Araç ile model ayrı şeyler

Claude Code, terminalde çalışan bir kod ajanı. Dosyalarını okuyor, değiştiriyor, komut çalıştırıyor. Ama bu işleri yapan “beyin” aslında ayrı bir yerde: Anthropic’in sunucularındaki Claude modeli. Claude Code, modelle belirli bir API (programların birbiriyle konuşma kuralları) üzerinden haberleşiyor.

Bu şu anlama geliyor: Aynı dili konuşan başka bir sunucu bulursan, Claude Code’u ona da bağlayabilirsin. Ollama tam da bunu sağlıyor.

Ollama ne?

Ollama, açık ağırlıklı modelleri kendi bilgisayarında çalıştırmak için ücretsiz ve açık kaynak bir araç. Ağırlıkları herkese açık olan modelleri, yani Google’ın Gemma’sını, Alibaba’nın Qwen’ini, DeepSeek’i ya da Z.ai’nin GLM’ini tek komutla indirip çalıştırıyor:

ollama run gemma4

Model bilgisayarında yoksa önce iniyor, sonra sohbet başlıyor. Arka planda da diğer programların bağlanabileceği bir sunucu açıyor. Görüntü anlayabilen modellerle bir resim gösterip ne olduğunu da sorabiliyorsun. İstersen Ollama’nın kendi bulutunda çalışan büyük modelleri de aynı yoldan kullanabiliyorsun.

Claude Code’u bağlamak

Ollama’nın belgelerine göre en kısa yol şu komut:

ollama launch claude

Ya da elle yapmak istersen, Claude Code’a nereye bağlanacağını ortam değişkenleriyle söylüyorsun: Adres olarak Anthropic yerine yerel Ollama sunucusunu (http://localhost:11434) veriyorsun, kimlik bilgisi olarak da ollama yazıyorsun.

Sonuç: Claude Code’u her zamanki gibi kullanıyorsun, ama cevapları kendi bilgisayarındaki bir model veriyor. Videoda model, Gemma olmasına rağmen kendini “Claude Code” diye tanıtıyor. Çünkü aracın ona verdiği talimatlar değişmedi, sadece arkadaki beyin değişti.

Beklentini doğru ayarla

Başlıktaki “%99 daha ucuz” iddiası kulağa hoş geliyor ama bazı gerçekler var:

  • Kalite farkı. Kendi bilgisayarında çalışabilen modeller, en büyük kapalı modellerle aynı seviyede değil. Basit işlerde iyi, karmaşık görevlerde zorlanabilirler.
  • Donanım. Model ne kadar büyükse o kadar bellek ister. Ekran kartı belleği azsa küçük modellerle yetinmen gerekir.
  • Bağlam penceresi. Modelin aynı anda “aklında tutabildiği” metin miktarına context window deniyor. Ollama varsayılan olarak bunu ekran kartı belleğine göre ayarlıyor: 24 GB’ın altında sadece 4 bin token. Kod ajanları için bu çok az. Ollama da en az 64 bin öneriyor. Bunu ayarlardan artırabilirsin ama daha fazla bellek gerekir.
  • Mac’te hız. Ollama, Apple Silicon’da Apple’ın kendi makine öğrenmesi altyapısı MLX’e geçti. Bu, Mac’lerde belirgin bir hızlanma sağlıyor.

Diğer seçenekler

  • LM Studio: Aynı işi güzel bir grafik arayüzle yapıyor. Yerel kullanım için Ollama’ya en yakın rakip.
  • vLLM: Modelleri çok sayıda kullanıcıya servis etmek için tasarlanmış, sunucu tarafında çok daha hızlı. Kendi servisini kuracaksan daha uygun.

Düşün

  • Kodunun hiçbir şirketin sunucusuna gitmemesi senin için ne kadar önemli? Bunun için ne kadar kaliteden vazgeçerdin?
  • Bir ajanın gücü ne kadar araçtan, ne kadar modelden geliyor?

Bu yazıdaki araçlar Araç Kutusu'nda: Ollama