Bu neden önemli?
Yapay zekâ modellerinin fiyatı artık sadece 'milyon token başına kaç dolar' değil. Önbellek, düşünme miktarı ve abonelik mi API mi kullandığın, gerçek maliyeti belirliyor.
Fable ve Mythos: Aynı model, iki kapı
Anthropic Eylül başında Claude Fable 5.1 ve Mythos 5.1’i duyurdu. Şirkete göre ikisi aslında aynı model. Farkı güvenlik önlemlerinde:
- Fable 5.1 herkese açık.
- Mythos 5.1 ise siber güvenlik ve yaşam bilimleri gibi alanlarda çalışan, doğrulanmış kişilere özel erişim programlarıyla sunuluyor. Bu alanlarda daha az kısıtlama ile çalışıyor.
Önbellek neden bu kadar önemli?
Bir yapay zekâ ajanıyla kod yazarken, her adımda modele aynı büyük bağlamı tekrar tekrar gönderirsin: projenin dosyaları, talimatlar, önceki konuşma. Prompt caching (istem önbelleği), modelin daha önce işlediği bu kısmı saklayıp tekrar kullanmasını sağlar. Önbellekten okunan kısım, sıfırdan işlenen metinden çok daha ucuzdur.
Fable 5.1 ile bu önbellek okumaları %75 ucuzladı: milyon token başına 0,25 dolar. Normal girdi fiyatı milyon token başına 10, çıktı fiyatı 50 dolar.
Anthropic’in iddiasına göre bu indirim ve modelin daha az token harcaması sayesinde tipik işlerde maliyet yaklaşık %25, karmaşık ve ajan ağırlıklı kodlama işlerinde %45’e kadar düşüyor.
İlk tuzak: Aboneysen fark etmeyebilir
Videonun altını çizdiği nokta şu: Önbellek indirimi, token başına ödeme yapılan yerlerde geçerli, yani API’de. Aylık sabit ücretli bir Claude aboneliği kullanıyorsan faturan zaten token’a göre çıkmıyor. Senin için değişen şey daha çok kullanım limitleri ve modelin kendisi.
İkinci tuzak: Efor ayarı
Fable 5.1’de modelin ne kadar “düşüneceğini” belirleyen bir efor ayarı var: Low, Medium, High, Extra High ve Max. Yüksek efor daha iyi cevap verebilir ama daha çok token, yani daha çok para demek. Anthropic’e göre model Claude Code’da varsayılan olarak High, Claude.ai’da Medium eforla çalışıyor.
Videoya göre bağımsız ölçüm sitesi Artificial Analysis’in verileri ilginç bir sonuç gösteriyor: Fable 5.1 en yüksek eforda, görev başına Fable 5’ten daha pahalıya gelebiliyor. Yani “yeni model daha ucuz” cümlesi, her ayarda doğru değil. Asıl tasarruf, işine yeten en düşük eforu bulmaktan geçiyor.
Diğer detaylar
- Kurumsal müşteriler için veriyi kendi bulut altyapılarında tutabilecekleri bir seçenek eklendi.
- Anthropic’e göre siber güvenlik önlemlerinin masum isteklerde yanlışlıkla devreye girmesi %60 azaldı.
- Videoda model bir oyun ve bir web sitesi tasarımıyla da deneniyor. Sonuçlar olumlu, ama bu tür tek seferlik testler genel bir kıyas yerine geçmez.
Ne öğrendik?
Yeni bir model çıktığında “fiyat düştü mü?” sorusu tek başına yetmiyor. Sorulması gerekenler şunlar: Hangi kullanımda düştü? Hangi ayarda? Ve bu işi daha düşük eforla, hatta daha küçük bir modelle yapabilir miyim?
Düşün
- Kullandığın yapay zekâ aracında her cevaba ne kadar “düşünme” harcandığını hiç kontrol ettin mi?
- Bir işin kalitesi %5 artsa ama maliyeti iki katına çıksa, hangi durumda buna değer?