← Teknoloji Radarı

Yapay zekâ

Claude Opus 5: Daha çok biliyor, ama bilmediğinde de daha çok cevap veriyor

Anthropic'in yeni modeli Opus 5, Fable 5'e yakın bir zekâyı yarı fiyatına vaat ediyor. Bağımsız bir ölçüm ise ilginç bir takas gösteriyor: Model daha çok doğru biliyor, ama emin olmadığında da cevap vermeye daha istekli.

Bu neden önemli?

Bir modelin 'daha akıllı' olması, her cevabına daha çok güvenebileceğin anlamına gelmiyor. Doğruluk ile uydurma oranının farklı şeyler olduğunu bilmek, yapay zekâyı doğru kullanmanın temeli.

Did Anthropic just kill the indie hacker...? · Fireship, YouTube (İngilizce). Tıklayınca video yüklenir.

Ne geldi?

Anthropic 24 Temmuz’da Claude Opus 5’i yayınladı. Şirketin iddiası kısaca şu: En güçlü modeli Fable 5’e çok yakın bir performans, onun yarı fiyatına. Fiyat bir önceki Opus 4.8 ile aynı kaldı: milyon girdi token’ı başına 5, milyon çıktı token’ı başına 25 dolar.

Birkaç teknik detay:

  • 1 milyon token bağlam penceresi ve cevap başına 128 bin token’a kadar çıktı.
  • Düşünme varsayılan olarak açık. Model her adımda ne kadar düşüneceğine kendi karar veriyor. Sen de bunu efor ayarıyla (low, medium, high, xhigh, max) yönlendiriyorsun. Varsayılan high.
  • Düşünme token’ları da çıktı olarak ücretlendiriliyor. Yani Opus 4.8’de düşünmeden çalışan bir iş, aynı birim fiyatla daha pahalıya gelebilir.

Davranışı da değişti

Anthropic’in geliştirici belgelerine göre Opus 5 bazı işleri sen istemeden yapıyor:

  • Cevapları ve yazdığı belgeler daha uzun.
  • Ajan olarak çalışırken ne yaptığını sana daha sık anlatıyor.
  • Görevleri alt ajanlara daha kolay dağıtıyor.
  • Kendi işini kendiliğinden kontrol ediyor.

Son madde pratik bir ipucu da içeriyor. Eski modeller için yazdığın “sonunda işini kontrol et” gibi talimatları kaldırman öneriliyor. Yoksa model gereğinden fazla kontrol yapıyor, bu da zaman ve para demek.

Asıl ders: Doğruluk ile uydurma aynı şey değil

Bağımsız ölçüm sitesi Artificial Analysis’in AA-Omniscience testi, modele internetsiz bilgi soruları soruyor. Doğru cevabı ödüllendiriyor, yanlış cevabı cezalandırıyor, “bilmiyorum” demeyi ise cezalandırmıyor.

Artificial Analysis’e göre Opus 5 burada Opus 4.8’den 7 puan daha fazla doğru cevap verdi. Ama halüsinasyon oranı da 14 puan artarak %50’ye çıktı.

Bu oran “söylediklerinin yarısı yanlış” demek değil. Şu demek: Model bir soruyu bilmediğinde, “bilmiyorum” demek yerine yarı yarıya bir cevap uyduruyor. Yani model hem daha çok şey biliyor, hem de bilmediği yerde susmaya daha az istekli. Uydurduğu cevaplar da genelde çok ikna edici görünüyor.

Senin için anlamı şu: Yeni model genel olarak daha iyi olsa bile, özellikle isim, tarih, sürüm numarası ve kaynak gibi kontrol edilebilir bilgileri yine kontrol etmen gerekiyor.

Ya bağımsız geliştiriciler?

Videonun başlığı başka bir tartışmaya gönderme yapıyor: Indie hacker denen, tek başına küçük ücretli yazılımlar (SaaS) yapıp satan geliştiriciler. Videonun yorumuna göre kod yazmak eskiden zor ve pahalıydı, bu da onları koruyordu. Artık birçok kişi ihtiyaç duyduğu küçük aracı kendisi bir yapay zekâya yazdırabiliyor.

Bu bir görüş, kesin bir sonuç değil. Ama sorunun kendisi önemli: Kod yazmak ucuzladıkça, bir ürünü değerli kılan şey kodun kendisinden çok fikir, dağıtım ve kullanıcıya yakınlık oluyor.

Düşün

  • Bir yapay zekâ “bilmiyorum” dediğinde mi, yoksa her soruya cevap verdiğinde mi daha çok güvenirsin?
  • Kullandığın bir ücretli aracı bugün kendin yaptırabilir miydin? Onu yine de neden kullanıyorsun?