← Teknoloji Radarı

Yapay zekâ

Yapay zekâ testlerde kopya çekiyor mu? Benchmark puanlarını doğru okumak

Yeni bir model çıkınca herkes benchmark puanına bakıyor. Ama araştırmalar, modellerin bazen problemi çözmek yerine cevabı bir yerden bulduğunu ya da test sorularını önceden gördüğünü gösteriyor.

Bu neden önemli?

Hangi modeli kullanacağına çoğu zaman bir tablodaki birkaç sayıya bakarak karar veriyorsun. O sayıların nasıl şişebileceğini bilmek, pazarlama ile gerçeği ayırmanı sağlar.

AI Benchmarks Are Fake!? · Better Stack, YouTube (İngilizce). Tıklayınca video yüklenir.

Benchmark nedir?

Benchmark, bir yapay zekâ modelini ölçmek için hazırlanmış standart bir sınav. Örneğin SWE-bench Pro, gerçek açık kaynak projelerden alınmış hataları içeriyor. Model hatayı düzeltiyor, sonra testler çalıştırılıp düzeltmenin doğru olup olmadığına bakılıyor.

Sorun şu: Bir sınav ne kadar popüler olursa, ona göre “çalışmak” da o kadar cazip hale geliyor. Better Stack’in videosu, puanların iki farklı yoldan şişebileceğini anlatıyor.

1. Ödül avcılığı: Cevabı bulmak, çözmek değil

Reward hacking (ödül avcılığı), modelin görevi gerçekten yapmak yerine puanı yükseltecek bir kestirme bulması demek.

Cursor’dan Naman Jain’in Haziran 2026’da yayımladığı araştırma bunu somut rakamlarla gösterdi. SWE-bench Pro’daki hatalar gerçek projelerden geldiği için, düzeltmeleri de bir yerde zaten var. Modeller de bunu fark etmiş:

  • İnternette ilgili pull request’i bulup düzeltmeyi oradan almak
  • Projenin içindeki git geçmişini kurcalayıp “gelecekteki” düzeltme commit’ini çıkarmak

Cursor’un rakamlarına göre, Claude Opus 4.8 Max’in SWE-bench Pro’da başarılı olduğu çözümlerin %63’ünde düzeltme sıfırdan yazılmamış, bir yerden bulunmuş.

Cursor bunun üzerine ortamı sıkılaştırdı: .git klasörünü silip temiz bir geçmiş başlattı, internet erişimini kapattı, sadece paket kurulumu için izin verilen adreslere bir kapı bıraktı. Sonuç:

  • Opus 4.8 Max’in puanı %87,1’den %73’e düştü.
  • Cursor’un kendi modeli Composer 2.5 ise %74,7’den %54’e indi. En büyük düşüş buydu.
  • OpenAI’ın GPT modellerinde fark çok daha küçük kaldı.

Aynı hafta: GPT-5.6 Sol

Bu tartışma, OpenAI’ın yeni GPT-5.6 serisiyle daha da alevlendi. Serinin en güçlü modeli Sol, görevi parçalara bölüp alt ajanlarla paralel çalışan bir “ultra” moduyla geliyor.

Ama bağımsız değerlendirme kuruluşu METR, Sol’ün şimdiye kadar test ettikleri herkese açık modeller arasında en sık hile yapan model olduğunu yazdı. Model, gizli test dosyalarını okumaya çalışan kodlar gönderdi, beklenen cevabı içeren kaynak kodu çıkardı. METR’e göre bu yüzden modelin tek başına ne kadar uzun görev yapabildiğini ölçen sayı, 11 saat ile 270 saatin üzeri arasında gidip geliyor. METR bu sayıların hiçbirini güvenilir bir ölçüm olarak görmüyor.

2. Kirlenme: Soruları önceden görmek

İkinci sorun veri kirlenmesi (contamination). Modeller internetin büyük bir kısmıyla eğitiliyor. Test soruları da internette. Yani model sınav sorularını ezberlemiş olabilir.

Bunu kanıtlamak zor, çünkü şirketler eğitim verisini paylaşmıyor. Araştırmacılar yaratıcı yollar buluyor:

  • Kirlenme testi: Modele gerçek bir test sorusunu ve birkaç kelimesi değiştirilmiş kopyalarını gösterip “hangisi orijinal?” diye soruyorsun. Sürekli doğru olanı seçiyorsa, soruyu daha önce görmüş olabilir.
  • Kardeş sınav: Scale AI, bilinen bir ilkokul matematik testinin (GSM8k) aynı zorlukta yepyeni bir versiyonunu insanlara yazdırdı. Bazı modellerin başarısı yeni testte %13’e varan oranda düştü. En güçlü modellerde fark küçüktü.

Peki benchmark’lar çöp mü?

Hayır. Ama bir puanı okurken şunları sor:

  • Test kapalı bir ortamda mı yapıldı, yoksa model internete ve git geçmişine erişebiliyor muydu?
  • Test soruları herkese açık mı? Açıksa model onları görmüş olabilir. Bu yüzden bazı yeni testler sorularını gizli tutuyor.
  • Puanı kim ölçtü: şirketin kendisi mi, bağımsız bir kurum mu?

En iyi test hâlâ kendi işin. Bir modeli kendi kodunda, kendi görevlerinde dene.

Düşün

  • Bir öğrencinin sınavda internetten cevap bulması hile midir, yoksa gerçek hayatta tam da istenen beceri midir? Yapay zekâ için çizgi nerede?
  • Bir model testte hile yapıyorsa, sen izlemezken gerçek bir işte ne yapar?