Yapay Zeka Etiketlemesi Ne Kadar Güvenilir? Üç Çalışma

Beş makine aynı 100 sahneyi etiketledi. Tek bir kuralda 0, 1, 40, 72 ve 78 pozitif verdiler; insan 9 dedi. Üç çalışmalık kıyaslamanın tüm verisi açık.

Share
Yapay Zeka Etiketlemesi Ne Kadar Güvenilir? Üç Çalışma
Global AI Architecture & Advanced Data Visualization

Veri setinizin makine etiketlerine bir insan katılır mıydı?

Yayımlanan derlemler giderek daha sık, makine üretimi bir etiket katmanıyla birlikte dağıtılıyor: duygu skorları, üslup işaretleri, söylem kategorileri. Bir sezgisel kural ya da bir dil modeli tarafından üretilip metinle beraber paylaşılıyor, sonraki kullanıcılar da bunları gerçek referans gibi devralıyor. Nadiren sorulan soru şu: bağımsız bir insan bu etiketlere katılır mıydı?

Bu rapor, o soruyu kendi yayımladığım bir derlem için yanıtlıyor. Objective Projection veri seti, her sahne için altı zanaat özelliği üzerinde çalışan iki dilli kural tabanlı bir dedektörün ürettiği applied_rules alanını taşıyor. Bu işaretler derlemi tanımlamakta ve örnek seçmekte kullanılmıştı. Kimse doğruluğunu ölçmemişti.

Şimdi üç kez ölçtüm. Makalenin tamamı: 10.5281/zenodo.21740239. Bu sayfa bulguları özetliyor.

Daha önceki bir rapor yalnızca ikinci çalışmayı anlatıyordu: Bir makine "göster, anlatma"yı saptayabilir mi? O raporun iki sonucu aşağıda düzeltiliyor.

1. Altı özellik

Şema Nesnel İzdüşüm yönteminden geliyor ve iki yasağı dört olumlu teknikten ayırıyor.

  • Duygu ambargosu (yasak) — anlatıcının sesi bir duyguyu doğrudan adlandıramaz. Okurun duygusal yorumlayabileceği fiziksel eylem ihlal sayılmaz; diyalog kuralın dışındadır.
  • Benzetme yasağı (yasak) — açık benzetme işaretleyicisi kullanılamaz (gibi, sanki, adeta).
  • Maddeleşen metafor — soyut bir iç durumun adlandırılmak yerine somut ve ölçülebilir fiziksel bir ayrıntıya dönüştürülmesi.
  • Mikro odak — anlatının dar, küçük ve somut bir nesneye ya da ayrıntıya yoğunlaşması.
  • Zamansal çapa — somut bir zaman, süre ya da ölçü işareti.
  • Atmosfer çelişkisi — sahnenin genel durumuyla çelişen beklenmedik bir ayrıntı.

İlk ikisi, bir metin aramasının yaklaşık olarak yakalayabileceği yüzeysel özellikler. Son dördü yargı gerektiriyor; en çoğunu da maddeleşen metafor istiyor, çünkü fiziksel bir ayrıntının temsil işi yapıp yapmadığına karar vermeyi gerektiriyor — bu, metnin dizgisel bir özelliği değil.

2. Üç çalışma

Çalışmanİnsan referansıMakine etiketleyiciler
1120Tek kör etiketleyici — yöntemin yazarıkural tabanlı dedektör
2100Tek kör bağımsız etiketleyici (uzman değil)dedektör, Gemini 2.5 Flash, Grok
2baynı 100aynı kilitli referansClaude Fable 5 (High), ChatGPT 5.5

Birinci ve ikinci çalışmanın sahne kümeleri ayrık — sıfır örtüşme. İkinci çalışmanın sahneleri, birincinin dokunmadığı 180 sahnelik bir havuzdan çekildi, sonra karıştırıldı ve kimlikleri maskelendi. Bağımsız etiketleyicinin etiketleri, hiçbir makine koşmadan önce kilitlendi.

İki usul kuralı önceden sabitlendi. İlk koşu esastır: her blok için ilk yanıt veridir. Dejenere çıktı reddi: mekanik biçimde tekrar eden bir çıktı puanlanmaz, elenir — bir model, Gemini 3.6, otuz özdeş etiket satırı döndürdüğü için bu kural gereği reddedildi ve sonuçlarda yer almıyor. Blok tekrarları model içi kararlılığı ölçtü: ChatGPT 60 tekrar etiketinin 58'ini, Claude 60'ının 60'ını aynen yeniden üretti.

Held-out (ayrılmış) sözcüğü hakkında bir not: bu 100 sahne, etiketleyici ve dedektör geliştirmesinden ayrıldı, derlemden değil. Bunlar derlem sahneleri ve kimlik eşlemesi yayımlanmış durumda. Terim, var olandan daha fazla ayrışma ima etmek için kullanılmıyor.

3. Bulgu: tek kural, beş makine, beş ayrı cevap

Kilitli insan referansının 100 sahnede 9 pozitifine karşılık, beş makine etiketleyici şunu verdi:

EtiketleyiciPozitif / 100DP / YP / YNHam uyumCohen kappa
Grok00 / 0 / 9%91,00.000
Gemini 2.5 Flash11 / 0 / 8%92,00.185
ChatGPT 5.5404 / 36 / 5%59,00.019
Kural tabanlı dedektör727 / 65 / 2%33,00.015
Claude Fable 5 (High)788 / 70 / 1%29,00.027

DP: doğru pozitif · YP: yanlış pozitif · YN: yanlış negatif

Birinci çalışmada, farklı bir insan referansına karşı farklı sahnelerde, dedektörün aynı kuraldaki kappa değeri 0.004 idi. Bu, farklı etiketleyicilerden, farklı insanlara karşı, farklı sahnelerde elde edilmiş beş sıfıra yakın sonuç demek.

Gemini'nin 0.185'i tek istisna ve yüz sahnedeki tek bir pozitif yargıya dayanıyor.

Dağılım, mevcut aralığın neredeyse tamamını kaplıyor. Bu bir doğruluk sıralaması değil. Yetkin bir okurdan 0, bir diğerinden 78 çıkaran bir tanım, henüz tanım işlevi görmüyor.

Modeller yalnız insanla değil, birbirleriyle de anlaşamıyor

Açıklaması en zor kısım bu. Yalnızca anlatının küçük ve somut bir ayrıntıya yoğunlaşıp yoğunlaşmadığını soran mikro odak kuralında Gemini 9 sahne, Grok 82 sahne işaretledi — insan sayısı 96 iken. Aynı yazılı tanım, aynı yüz sahne, on kat fark.

Yapılar keskin olsaydı, bağımsız ve yetkin etiketleyicilerin yakınsaması beklenirdi. Ne insanla yakınsadılar ne birbirleriyle.

Ham uyum sayıları neden yanıltıcı

ChatGPT üç çalışmadaki en yüksek genel ham uyumu tutturdu — %84,5 — ama çıkarım kuralındaki kappa değeri 0.019 idi. Claude %81,0'e, Grok %86,3'e ulaştı; Grok'unki kısmen iki kuralda her sahneye "yok" demesinden geliyor.

İki olgu birlikte doğru, çünkü altı kuralın beşinde insan dağılımı ağır biçimde çarpık. İkinci çalışmada insanın pozitif sayıları 100 üzerinden 0, 1, 9, 96, 99 ve 44 idi. Bir etiketleyici 100 sahnenin 99'una "var" dediğinde uyum istatistiklerinin çalışacağı varyans kalmaz; kappa neredeyse bilgi taşımaz ve yüksek ham uyum, beceriyi değil dengesizliği yansıtır.

Altı kuralın dördü fiilen hiç test edilmedi. Bu, değerlendirilen sistemlerin değil benim değerlendirme kümemin kusuru. Neredeyse her sahnesinde zamansal çapa bulunacak biçimde kurulmuş bir derlem, herhangi bir şeyin zamansal çapayı saptayıp saptamadığını ölçmek için kullanılamaz. Yalnızca atmosfer çelişkisi (44 pozitif, 56 negatif) kullanılabilir bir dağılımda duruyor — iki modelin şanstan iyi olduğunu söylemeye yalnızca o kuralda razı olmamın sebebi de bu.

4. Önceki rapora düzeltme

Önceki rapor, makinelerin atmosfer çelişkisini neredeyse tamamen kaçırdığı sonucuna varmıştı. Bu, ikinci çalışmanın üç etiketleyicisi için doğruydu. Genellenebilir değil.

İnsanın 44 pozitifine karşı Claude 55 sahne işaretledi, 31'i doğruydu (kappa 0.269); ChatGPT 42 işaretledi, 23'ü doğruydu (kappa 0.184). İkisi de güvenilir uyumun çok gerisinde. İkisi de açıkça şansın üstünde — ve bu, sınıf dağılımı böyle bir yargıyı destekleyen tek kural. Yeni modeller, benim üzerini çizdiğim bir özellikte kısmi sinyal yakaladı.

İkinci ve daha küçük bir düzeltme: o raporda Grok'un atmosfer pozitifleri 3 olarak verilmişti. Grok 6 sahne işaretledi, bunların 3'ü doğruydu.

5. İki okuma ve neden hiçbiri seçilmiyor

Okuma (a) — özellik gerçekten çıkarımsal. Fiziksel bir ayrıntının dile getirilmemiş bir iç durumu taşıyıp taşımadığına karar vermek, metnin sakladığı şeyi yeniden inşa etmeyi gerektirir. Bu, metnin tarafında değil okurun tarafında bir işlemse, hiçbir yüzey dedektörü bunu bulamaz; göreve yeniden inşayla değil örüntüyle yaklaşan modeller de bulamaz. Bu okumaya göre düşük uyum, makineler hakkında bir bulgudur.

Okuma (b) — tanım operasyonel değil. Tamamen "durumları fiziksel olarak kodla" talimatından üretilmiş bir derlemde, gevşek bir okumayla neredeyse her sahne bu kurala uyar, katı bir okumayla çok azı. İnsanın 100'de 9'u da katı okumanın ürünü. Üstelik birinci çalışmada bu kural için kendi ölçütüm koşu ortasında kaydı: önceki ve sonraki sahneler farklı örtük standartlara göre yargılandığı için kuralın tamamını ayrı ve düzeltilmiş bir turda yeniden etiketlemek zorunda kaldım. Bu, ölçütün tek bir etiketleyicinin içinde bile kararsız olduğunun doğrudan kanıtı — kendi kuralımın aleyhine bir kanıt ve yayımlanmış etiket dosyasına kaydedilmiş durumda.

İki okuma tek bir ayırt edici öngörü üretiyor. (a) doğruysa, iki bağımsız insan etiketleyici birbiriyle, herhangi bir makinenin ikisinden biriyle uyuştuğundan belirgin biçimde daha iyi uyuşmalı. (b) doğruysa, iki bağımsız insan da anlaşamamalı.

Her çalışmada tek insan etiketleyicim var, dolayısıyla karar vermiyorum. Derlemin applied_rules alanını kullanmak isteyen biri şunu bilmeli: her iki okumaya göre de bu alan çıkarımsal özellikler için güvenilir değil. Okumalar kusurun nerede olduğunda ayrışıyor, pratik sonuçta değil.

Bir ekleme: iki insan da anlaşamazsa, bu kuralı otomatik olarak mahkûm etmez. Etiketleme yazınında ciddi bir görüş, yorumsal görevlerde insan etiket varyasyonunun asgariye indirilecek bir gürültü değil, görev hakkında gerçek bir sinyal olduğunu savunuyor. O zaman "kararsız tanım mı, meşru biçimde değişken yargı mı" sorusu kapanış değil, bir sonraki soru olurdu.

6. Yeniden kurulması gerekenler

İki köken uyarısı, okurun bağımsız olarak neyi doğrulayabileceğini etkiliyor; makalede gömülü bırakmak yerine burada da yazıyorum.

Gemini ve Grok'un sahne bazlı etiket dosyaları kayboldu. Kural bazlı kappa ve uyum değerleri korundu. Bunun yeterli olduğu ortaya çıktı: 100 sahnelik ikili bir kuralda, insan pozitif sayısı ve uyum sayısı biliniyorsa karışıklık matrisinin tamamı tek bir bilinmeyenin fonksiyonudur ve kappa o bilinmeyeni sabitler. Sayım, on iki kural-etiketleyici hücresinin on birinde tek çözüm verdi; on ikincisi özgün raporun bir cümlesiyle ayrıldı. Bu sayılar türetilmiş, ham değil. Sahne düzeyindeki nicelikler — bildirilen %85,7'lik Gemini–Grok uyumu dahil — bu yolla geri getirilemiyor.

Dedektörün ikinci çalışmadaki etiketleri yeniden kuruldu — derlemde zaten yayımlanmış olan applied_rules alanından, yayımlanmış kimlik eşlemesi üzerinden. Yeniden kurulan sütun, özgün sonuçları birebir üretiyor. Yine de bir yeniden kurulum.

Her iki türetme betiği de yayımlandı; aritmetiğe güvenmek yerine kontrol edilebilir.

7. Etiketli derlem kullananlar için ne anlama geliyor

  • Dağıtılan makine etiketlerini gerçek referans saymayın. Doğrulanmamış applied_rules türü alanlar sezgisel işaretlerdir. Görev bazında insan etiketine karşı doğrulayın; genel model yeteneği bu göreve aktarılmıyor.
  • Uyumun yanında sınıf dağılımını da bildirin. Yaygınlık ve yanlılık göstergeleri olmadan bildirilen bir kappa yanıltabilir. Dengesiz bir özellikte yüksek ham uyum bilimsel olarak bilgi taşımaz.
  • Koşulları kaydedin. Modelin tam sürümü, modu, arayüzü, oturum durumu, tarih. Buradaki bütün koşular, proje bağlamı ve hafıza olmadan açılmış taze oturumlarda, herkese açık web arayüzleri üzerinden yapıldı; dolayısıyla sıcaklık ve sistem istemi koşulları denetlenmedi. Bu bir sınırlama ve ima edilmek yerine yazılması gerekiyor.

8. Bunu ne çözer

  1. İkinci bağımsız insan etiketleyici — aynı 100 sahnede, yukarıdakilerin tamamına kör. (a) ile (b)'yi ayıran tek ölçüm bu. Hiçbir ek model koşusu yerine geçmiyor.
  2. Dengeli bir değerlendirme kümesi — dört çalışma kuralı için, her özellik sahnelerin kabaca yarısında bulunacak biçimde örneklenmiş. Bu olmadan, kaç sistem koşulursa koşulsun altı kuralın dördü test edilemez kalıyor.
  3. Maddeleşen metafor kuralının operasyonel olarak yeniden yazılması — sınırda duran olumlu ve olumsuz örneklerle, ardından yeniden etiketleme.

Birinci adım için gereken her şey açık: 100 sahne metni, altı tanım, kilitli insan etiketleri, her modelin etiket dosyası, on istem bloğu, kimlik eşlemesi ve puanlama betikleri — veri setinin evaluation/ klasöründe. O sahneleri etiketler ve benim gönüllümle anlaşmazsanız, o anlaşmazlık bu çalışma için koşabileceğim herhangi bir ek modelden daha faydalı olur.

Veri ve kaynaklar

Sık sorulan sorular

Ana bulgu ne?

En çok çıkarım gerektiren kural olan maddeleşen metaforda, beş makine etiketleyici 100 sahnenin 0 ile 78'i arasında değişen sayıda sahneyi pozitif işaretledi; insan sayısı 9'du. Cohen kappa değeri, iki insan referansı ve iki ayrık sahne kümesi boyunca altı etiketleyicinin beşinde şans düzeyinde ya da ondan ayırt edilemez çıktı.

Kappa sıfıra yakınken ham uyum neden yüksekti?

Sınıf dengesizliği. Bir özellik 100 sahnenin 96 ya da 99'unda bulunuyorsa, bir etiketleyici her seferinde çoğunluk sınıfını tahmin ederek çok yüksek ham uyuma ulaşabilir; buna karşılık şans düzeltmeli uyumu sıfırda kalır. Bu değerlendirmedeki altı kuralın beşi bu biçimde, dolayısıyla ham uyum esas olarak bir etiketleyicinin baskın sınıfı verme eğilimini ölçüyor.

Hangi sistemler değerlendirildi?

Beş makine etiketleyici: kural tabanlı iki dilli sezgisel dedektör, Gemini 2.5 Flash, Grok, ChatGPT 5.5 ve Claude Fable 5 (High). Altıncısı olan Gemini 3.6, dejenere tekrarlayan çıktı ürettiği için puanlanmadan önce reddedildi.

Dil modelleri atmosferik çelişkiyi ya da anlatı alt metnini saptayabiliyor mu?

Bu kanıta göre kısmen. Claude Fable 5 atmosfer çelişkisinde kappa 0.269'a, ChatGPT 5.5 0.184'e ulaştı — şansın üstünde, güvenilir uyumun epey gerisinde ve bu kümede böyle bir yargıyı destekleyen tek kuralda ölçülmüş durumda. İkinci çalışmadaki daha eski modeller aynı kuralda neredeyse hiç sinyal yakalayamamıştı.

Bu, makinelerin hikâye anlatımını anlayamadığını gösteriyor mu?

Hayır ve rapor bu sonucu açıkça reddediyor. Veriden iki okuma sağ çıkıyor: özelliklerin gerçekten mevcut otomatik etiketleyicilerin ötesinde çıkarım gerektirmesi ya da tanımların hiçbir etiketleyicinin tutarlı uygulayamayacağı kadar operasyonel olmaması. İkisini ayırmak ikinci bir bağımsız insan etiketleyici gerektiriyor ve bu çalışmada öyle biri yok.

Sonuçlar nasıl yeniden üretilir?

Bütün kilitli insan referans etiketleri, model etiket dosyaları, yeniden kurulan dedektör etiketleri, on istem bloğu, kimlik eşlemesi ve Python puanlama ile türetme betikleri, Hugging Face'teki Objective Projection veri setinin evaluation/ klasöründe CC BY-NC-ND 4.0 ile yayımlandı.

Atıf

@misc{bulut2026reliability,
  author       = {Bulut, Levent},
  title        = {Inter-Rater Reliability of LLM and Rule-Based Annotation for
                  Inferential Narrative Features: Three Studies on a Turkish Corpus},
  year         = {2026},
  month        = {August},
  howpublished = {Zenodo},
  doi          = {10.5281/zenodo.21740239},
  url          = {https://doi.org/10.5281/zenodo.21740239},
  note         = {Version 1.0. Independent Researcher.
                  ORCID: 0009-0007-7500-2261}
}

Levent Bulut — Bağımsız araştırmacı. ORCID 0009-0007-7500-2261. Veri ve kod CC BY-NC-ND 4.0 ile yayımlanmıştır.

G-Verified: Levent Bulut