Digital Intelligence Institute Benchmark Raporu
Büyük Dil Modellerinin Türkçe Performansı İçin Yüksek Bilişsel Değerlendirme Ölçütü
HCBfT-TR1000
High-Cognitive Benchmark for Turkish  ·  Türkçe sözel mantık, kültürel bağlam, yerel dil, gündelik pratik, alan bilgisi ve görsel kültürü ölçen LLM testi
Doğruluk Sıralaması
Doğruluk Sıralaması — Yüzdelik başarı oranı (%)
Üstün ≥%65
İyi %50–65
Orta %35–50
Düşük %20–35
Zayıf <%20
%20: rastgele işaretleme
Verimlilik — yanıt süresi vs. başarı oranı
Ücretsiz (:free)
Ücretli
↳ Balon büyüklüğü toplam çıktı tokenıyla orantılıdır. Sol üst köşe = hızlı ve isabetli.
Yanıt Bütünlüğü format uyumu, ayıklama ve hatalar
Yanıt Dökümü — doğru / yanlış / ayıklanamayan (soru)
Doğru
Yanlış
Ayıklanamayan / hatalı
↳ "Ayıklanamayan": model geçerli bir yanıt vermedi ya da istek kalıcı olarak başarısız oldu.
Talimat Takibi — yanıtın nasıl eşleştirildiği (%)
Kararlılık ve Kırılımlar hangi model nerede zayıf
Bölüm Skorları — çoktan seçmeli vs. kısa yanıt (%)
Çoktan seçmeli (A–E)
Kısa yanıt (açık uçlu)
↳ Çoktan seçmelide %20 rastgele taban vardır; kısa yanıtta taban sıfırdır. İki sütun arasındaki uçurum, modelin bilgiyi gerçekten hatırlamak yerine şıklardan eleyerek ilerlediğini gösterir.
Konu Bazında Doğruluk (%)
Hücreler doğruluk yüzdesi; parantez içi doğru/soru
Şık Yanlılığı modellerin harf tercihi vs. cevap anahtarı
Tahmin Dağılımı — her modelin A–E şıklarını işaretleme sayısı
↳ Gri sütunlar cevap anahtarının gerçek dağılımıdır. Bir modelin sütunları anahtardan belirgin şekilde saparsa, bu konum yanlılığına (position bias) işaret eder.
Ayrıntılı Model Karnesi
GA: Wilson %95 güven aralığı. Kapsam: sağlayıcıdan geçerli yanıt alınan soruların oranı; düşükse ana skor ölçüm değildir. Yanıtlananda: yalnızca yanıt alınan sorular üzerinden doğruluk. Katı format: modelin hiç açıklama yapmadan yalnızca istenen yanıtı yazdığı soruların oranı. Maliyet: OpenRouter'ın bildirdiği gerçek USD tutarı (ücretsiz modellerde 0).
Çalıştırma Künyesi yöntem ve sınırlılıklar