Büyük Dil Modellerinin Türkçe Performansı İçin Yüksek Bilişsel Değerlendirme Ölçütü
HCBfT-TR1000
High-Cognitive Benchmark for Turkish · Türkçe sözel mantık, kültürel bağlam, yerel dil, gündelik pratik, alan bilgisi ve görsel kültürü ölçen LLM testi
Bölüm 01Doğruluk Sıralaması
Doğruluk Sıralaması — Yüzdelik başarı oranı (%)
Üstün ≥%65
İyi %50–65
Orta %35–50
Düşük %20–35
Zayıf <%20
%20: rastgele işaretleme
Verimlilik — yanıt süresi vs. başarı oranı
Ücretsiz (:free)
Ücretli
↳ Balon büyüklüğü toplam çıktı tokenıyla orantılıdır. Sol üst köşe = hızlı ve isabetli.
Bölüm 02Yanıt Bütünlüğü format uyumu, ayıklama ve hatalar
Yanıt Dökümü — doğru / yanlış / ayıklanamayan (soru)
Doğru
Yanlış
Ayıklanamayan / hatalı
↳ "Ayıklanamayan": model geçerli bir yanıt vermedi ya da istek kalıcı olarak başarısız oldu.
Talimat Takibi — yanıtın nasıl eşleştirildiği (%)
Bölüm 03Kararlılık ve Kırılımlar hangi model nerede zayıf
Kararlılık Aralığı — hep doğru → çoğunluk → en az bir (%)
Hep doğru (alt sınır)
Çoğunluk oyu (raporlanan skor)
En az bir denemede doğru (üst sınır)
↳ Üç değer arasındaki açıklık genişse model kararsızdır: aynı soruya farklı denemelerde farklı yanıt veriyor demektir.
Tekrarlar Arası Tutarlılık (%)
Tüm denemelerde aynı yanıt
Ortalama isabet payı (tüm denemeler)
↳ Sıcaklık 0'da yüksek tutarlılık beklenir; düşük değerler sağlayıcı kaynaklı belirsizliğe ya da modelin kararsızlığına işaret eder.
Görsel Bölüm — metin vs. görsel başarı (%)
Metin bölümü
Görsel bölüm
↳ Görsel sorular yalnızca çok kipli modellere sorulur; görsel girdi alamayan modellerde bu bölüm atlanır ve skora hiç girmez. Modeller arası sıralama metin bölümü üzerinden yapılmalıdır.
Görsel Alt Türleri — hangi görev tipi zorluyor (%)
Bölüm Skorları — çoktan seçmeli vs. kısa yanıt (%)
Çoktan seçmeli (A–E)
Kısa yanıt (açık uçlu)
↳ Çoktan seçmelide %20 rastgele taban vardır; kısa yanıtta taban sıfırdır. İki sütun arasındaki uçurum, modelin bilgiyi gerçekten hatırlamak yerine şıklardan eleyerek ilerlediğini gösterir.
Konu Bazında Doğruluk (%)
Hücreler doğruluk yüzdesi; parantez içi doğru/soru
Bölüm 04Şık Yanlılığı modellerin harf tercihi vs. cevap anahtarı
Tahmin Dağılımı — her modelin A–E şıklarını işaretleme sayısı
↳ Gri sütunlar cevap anahtarının gerçek dağılımıdır. Bir modelin sütunları anahtardan belirgin şekilde saparsa, bu konum yanlılığına (position bias) işaret eder.
Bölüm 05Ayrıntılı Model KarnesiSütun başlıklarına tıklayarak sıralayın
↳ GA: Wilson %95 güven aralığı.
Kapsam: sağlayıcıdan geçerli yanıt alınan soruların oranı; düşükse ana skor ölçüm değildir.
Yanıtlananda: yalnızca yanıt alınan sorular üzerinden doğruluk. Katı format: modelin hiç açıklama yapmadan yalnızca istenen yanıtı yazdığı soruların oranı. Maliyet: OpenRouter'ın bildirdiği gerçek USD tutarı (ücretsiz modellerde 0).
Bölüm 06Çalıştırma Künyesi yöntem ve sınırlılıklar