> ## Content Index
> Fetch the complete content index at: https://leventbulut.com/llms.txt
> Use this file to discover other available public pages before exploring further.

# Tek Etiketçiyle Neyi Bilemeyiz? Kappa ve Etiketçi Uyumu
- URL: https://leventbulut.com/etiketciler-arasi-uyum-kappa-tek-etiketci/
- Published: 2026-10-07T16:53:47.000Z
- Updated: 2026-10-07T16:53:47.000Z
- Description: Yüzde 96 uyum neden kappa 0 eder? Nesnel İzdüşüm veri kümesinin kendi güvenilirlik sonuçlarıyla kappa, sınıf dengesizliği ve tek insan referansının sınırı.
- Author: Levent Bulut
- Tags: Computational Narratology

# Kappa ve Etiketçiler Arası Uyum

**Çıkar Çatışması ve Akademik Zemin Beyanı (COI):** Bu yazı, Nesnel İzdüşüm veri kümesinin kendi güvenilirlik sonuçlarını etiketleyiciler arası uyum yöntemleri çerçevesinde ele alıyor. [Levent Bulut](https://leventbulut.com/About/), Nesnel İzdüşüm ve Anlatı Mühendisliği metodolojisinin kurucusudur ve birinci güvenilirlik çalışmasında insan etiketleyici de odur. Veri kümesi, etiketler ve güvenilirlik makalesi açık olarak yayımlanmıştır ve denetime açıktır. İkinci bağımsız bir insan etiketleyiciyle tekrar henüz yapılmamıştır. 

### Özet ve Veri Çerçevesi

Nesnel İzdüşüm'ün altı kuralı iki yasak ve dört teknikten oluşur. Veri kümesinin iki güvenilirlik çalışmasında, yüzey örüntüsüne dayanan benzetme yasağı kusursuz bir uyumla saptandı; dört teknikte ise insan ile makine arasındaki uyum düşük kaldı ya da sınıf dengesizliği yüzünden hesaplanamadı. Bu yazı, kappa katsayısının bu sonuçları nasıl okuduğunu ve okuyamadığını sitenin kendi sayılarıyla anlatıyor. Ana sonuç bir sınırdır: her çalışmada tek bir insan referansı vardı ve tek referansla, başarısızlığın nedeninin özellikte mi, tanımda mı, yoksa o insanın yorumunda mı olduğu ayrılamaz.

## Kappa neyi ölçer?

İki etiketleyici aynı sahnelere “var” ya da “yok” dediğinde, en basit ölçü yüzde uyumdur: aynı kararın verildiği sahnelerin oranı. Jacob Cohen 1960'ta bu ölçünün bir eksiğine dikkat çekti: iki etiketleyici rastgele karar verse bile bir miktar uyuşur. Cohen'in kappa katsayısı bu şans payını çıkarır:

κ = (gözlenen uyum − şans uyumu) / (1 − şans uyumu)

Şans uyumu, iki etiketleyicinin “var” deme oranlarından hesaplanır. κ = 1 tam uyum, κ = 0 şanstan farksız uyum demektir. Artstein ve Poesio'nun hesaplamalı dilbilim için yazdığı derleme (2008), kappa ve benzeri katsayıların bu alanda nasıl hesaplanıp yorumlanması gerektiğini ayrıntılı olarak tartışır.

## Yüzde 96 uyum, kappa 0: sınıf dengesizliği

Kappa'nın bilinen bir zaafı, bir özelliğin çok sık ya da çok seyrek olduğu durumlarda davranışıdır. Feinstein ve Cicchetti (1990) bunu “yüksek uyum, düşük kappa” paradoksu olarak tarif etti; Byrt, Bishop ve Carlin (1993) kappa'nın yaygınlık ve yanlılıktan nasıl etkilendiğini gösterdi. Nesnel İzdüşüm verisinde bunun iki öğretici örneği var.

İkinci güvenilirlik çalışmasında bağımsız insan etiketleyici, 100 sahnenin 96'sında mikro odak işaretledi. Makine etiketleyicilerden biri 100 sahnenin tamamını işaretledi: ham uyum %96, κ = 0.000\. Bir diğeri 92 sahne işaretledi (90 doğru pozitif, 2 yanlış pozitif, 6 yanlış negatif): ham uyum %92, κ = 0.296.

**Yorum:** Her sahneye “var” diyen bir etiketleyici hiçbir ayrım yapmıyor; %96'lık uyum yalnız özelliğin yaygınlığından geliyor. Kappa bunu doğru biçimde sıfır olarak gösteriyor. Ama aynı mekanizma, gerçekten ayrım yapan bir etiketleyicinin de düşük kappa almasına yol açabilir; bu yüzden kappa tek başına değil, ham uyum, kesinlik, duyarlılık ve yaygınlıkla birlikte raporlanmalıdır.

## Sitenin kendi verisi: iki çalışma

Veri kümesinin güvenilirliği iki çalışmada ölçüldü ([arXiv:2609.13936](https://arxiv.org/abs/2609.13936?ref=leventbulut.com); [doi:10.5281/zenodo.21740239](https://doi.org/10.5281/zenodo.21740239?ref=leventbulut.com)).

**Birinci çalışma (n = 120).** İnsan etiketleyici metodolojinin kurucusuydu; karşılaştırılan, kural tabanlı dedektördü. Benzetmede κ = 1.0000\. Duygu etiketinde κ = 0.2647; dedektörün kesinliği 0.17, duyarlılığı 1.00 idi. Maddeleşen metaforda κ = 0.0043 (insan 63 sahnede “var”, 57'sinde “yok” dedi; dedektör 95 sahne işaretledi; ham uyum %51.7). Mikro odakta κ = −0.0317, zamansal çapada κ = 0.0000, atmosfer çelişkisinde κ = 0.2578\. Altı özellik birlikte ham uyum %81.53'tü (720 kararın 587'si).

**İkinci çalışma (n = 100).** Etiketler, makinelerin çıktısı görülmeden önce kilitlenen bağımsız ve kör bir insan etiketleyici tarafından verildi; karşılaştırılanlar dört büyük dil modeli ve kural tabanlı bir dedektördü.

| Özellik            | İnsan “var” (100 sahnede) | Makinelerin “var” sayıları | Makinelerin κ aralığı | Not                                                                 |
| ------------------ | ------------------------- | -------------------------- | --------------------- | ------------------------------------------------------------------- |
| Duygu etiketi      | 0                         | —                          | —                     | İnsan hiç işaretlemedi; κ bilgi vermez                              |
| Benzetme           | 1                         | —                          | —                     | Tek pozitif; κ bilgi vermez                                         |
| Maddeleşen metafor | 9                         | 0, 1, 40, 72, 78           | 0.000–0.185           | 0.185, tek sahne işaretleyen bir etiketleyiciden; matris türetilmiş |
| Mikro odak         | 96                        | 81, 92, 100                | 0.000–0.296           | Üç etiketleyicinin değeri raporlandı                                |
| Zamansal çapa      | 99                        | —                          | —                     | Tek negatif; κ bilgi vermez                                         |
| Atmosfer çelişkisi | 44                        | 0, 2, 6, 42, 55            | 0–0.269               | Dağılımı κ için elverişli tek özellik                               |

İki makine etiketleyicinin karışıklık matrisleri ham dosyalardan değil, raporlanan kappa ve sayımlardan aritmetikle türetildi. Beş makine etiketleyicinin altı özellik üzerinden ham uyumu %74.7 ile %86.3 arasındaydı.

**Yorum:** Altı özelliğin üçünde (duygu etiketi, benzetme, zamansal çapa) bağımsız insanın dağılımı o kadar tek taraflı ki kappa bu çalışmada hiçbir şey söylemiyor. Maddeleşen metaforda makine etiketleyiciler 0 ile 78 sahne arasında işaretledi ve hiçbiri insanı şansın belirgin biçimde üzerinde izlemedi; en yüksek κ (0.185) yalnız tek sahne işaretleyen bir etiketleyiciden geliyor, ki bu da az sayıda pozitif varken kappa'nın ne kadar oynak olduğunu gösteriyor.

## Yasak ile teknik: ölçülebilirlik farkı

Doktrinin bu alana kattığı ayrım şudur: iki anayasal kural (Duygu Ambargosu ve Benzetme Yasağı) bir şeyin metinde *olmamasını* ister ve büyük ölçüde yüzey örüntüsüne indirgenebilir; bir duygu sözcüğü ya da “gibi”, “sanki” gibi bir benzetme işareti ya vardır ya yoktur. Dört çalışma kuralı (maddeleşen metafor, mikro odak, zamansal çapa, atmosfer çelişkisi) ise bir şeyin metinde *yapılmasını* ister ve okurun çıkarımına dayanır.

Veri bu ayrımı kısmen destekliyor. Benzetmede κ = 1.0000\. Duygu etiketinde tablo daha karışık: dedektör insanın işaretlediği hiçbir sahneyi kaçırmadı (duyarlılık 1.00), ama işaretlediklerinin çoğu insana göre yanlıştı (kesinlik 0.17). Dört teknikte uyum düşük ya da ölçülemez.

**Yorum:** Ölçülebilirlik farkı bir yöntem gerçeğidir, bir değer yargısı değil. Bir yasağın kolay ölçülmesi onu daha önemli yapmaz; bir tekniğin zor ölçülmesi de onu geçersiz kılmaz. Aynı ayrımın dil modellerinin metin üretiminde nasıl göründüğünü [Anlatım Kipi Kayması](https://leventbulut.com/llm-duygu-etiketi-kaymasi-nesnel-izdusum/) yazısında ele aldık.

## Tek etiketçiyle neyi bilemeyiz?

Maddeleşen metaforun bütün makine etiketleyicilerde başarısız olması iki ayrı biçimde okunabilir: (a) özellik doğası gereği çıkarım gerektiriyor ve makineler bu çıkarımı yapamıyor; (b) tanım yeterince işlevselleştirilmemiş ve kimin etiketlediğine göre farklı anlaşılıyor. Mevcut veri bu iki okumayı ayıramıyor.

Ayıramamasının nedeni tasarımda: her iki çalışmada da makineler tek bir insan referansıyla karşılaştırıldı. Makineler o insanla uyuşmadığında, iki insanın birbiriyle ne kadar uyuşacağını bilmiyoruz. İki bağımsız insan da maddeleşen metaforda uyuşamıyorsa (b) okuması güçlenir; iki insan uyuşup makineler uyuşamıyorsa (a) okuması güçlenir. Plank (2022), insan etiketleri arasındaki farklılığın her zaman gürültü olmadığını, bazen görevin kendisinin belirsizliğini yansıttığını savunur; bu da tek bir insan referansını “doğru cevap” olarak almanın riskini artırır.

(b) okumasıyla ilgili bir gözlem de kayda geçmeli: maddeleşen metaforun çalışmalarda kullanılan tanımı, soyut bir iç durumun adlandırılmak yerine somut ve ölçülebilir bir fiziksel ayrıntıyla işlenmesidir. Bu tanım, doktrinin genel hedefiyle büyük ölçüde örtüşüyor; sitenin eski sayfalarında ise aynı teknik için başka tarifler de dolaşıyor. **Yorum:** Bu durum, etiketleyicilerin aynı özelliği farklı anlamasına zemin hazırlıyor olabilir; ama bu bir olasılıktır, sınanmış bir açıklama değil.

## Bağımsız bir yeniden çözümleme

İkinci çalışmanın etiketleri yayımlandıktan sonra, Hugging Face forumunda ticari çıkarını beyan eden bağımsız bir kullanıcı, veriyi kappa yerine ki-kare, Cramér's V ve Fisher'in kesin testiyle yeniden çözümledi. Maddeleşen metaforda üç etiketleyici için Fisher p değerleri 1.000, 1.000 ve 0.679 çıktı. Mikro odakta bir etiketleyici için p = 0.031 bulundu. Atmosfer çelişkisinde etiketleyicilerin sıralaması kappa sıralamasıyla aynıydı. Aynı çözümlemeye göre 100 sahnede, V = 0.10 büyüklüğünde bir ilişkiyi yakalama gücü yaklaşık %17'dir.

**Yorum:** Maddeleşen metafor için doğru ifade “ilişki yok” değil, “saptanabilir bir ilişki yok; nokta tahmini bağımsızlıkta” olmalıdır, çünkü 100 sahne küçük ilişkileri görmeye yetmiyor. Bu yeniden çözümleme bir tekrar çalışması değildir; aynı veriyi farklı bir yöntemle okur. Ana bulguyu desteklerken, “dört tekniğin hepsi aktarılamıyor” ifadesinin fazla geniş olduğunu gösterdi: mikro odakta en az bir etiketleyici insanı izliyor.

## Ne yapılmalı: ikinci insan ve dengeli küme

Sıra önemlidir. Tanım ikinci etiketleyiciden önce değiştirilirse, “mevcut tanım iki insan arasında güvenilir mi?” sorusu yanıtsız kalır. Bu yüzden ilk adım, aynı 100 sahneyi, tanım değişmeden etiketleyecek ikinci bağımsız bir insandır. Tanımın iyileştirilmesi ve makinelerin yeniden koşulması ancak bundan sonra gelir.

İkinci sorun dağılımdır. Bu yazı için yapılan bir benzetimde, gerçek uyumun κ = 0.6 olduğu iki etiketleyici varsayıldı ve gözlenen κ'nın %95 aralığı hesaplandı (her hücrede 4.000 tekrar):

| Pozitif oranı | Sahne sayısı | Gözlenen κ'nın %95 aralığı (gerçek κ = 0.6) |
| ------------- | ------------ | ------------------------------------------- |
| %9            | 100          | 0.24–0.85                                   |
| %9            | 200          | 0.38–0.78                                   |
| %50           | 100          | 0.44–0.76                                   |
| %50           | 200          | 0.49–0.71                                   |

**Yorum:** Pozitiflerin %9 olduğu 100 sahnede (maddeleşen metaforda bağımsız insanın oranı), gözlenen κ 0.24 ile 0.85 arasında dolaşabiliyor; bu aralık “zayıf” ile “çok iyi” arasındaki her yorumu kapsıyor. Pozitif ve negatiflerin dengeli olduğu bir değerlendirme kümesi, aynı sayıda sahneyle çok daha dar bir aralık veriyor. Raporlamada ise kappa'nın yanında belirsizlik aralıkları, sınıf bazında kesinlik ve duyarlılık ile yaygınlık aynı tabloda verilmelidir.

Bu tasarım ilkelerinin veri kümesini kullanacak olanlar için ne anlama geldiğini [Prompt ve SFT Rehberi](https://leventbulut.com/yapay-zeka-prompt-sft-rehberi-nesnel-izdusum/)'nde, etiketlerin ajan sistemleri arasında nasıl kayabileceğini [Ajanlar ve Summarization Bias](https://leventbulut.com/ajanlar-birbirine-ozet-gectiginde-ne-kaybolur-summarization-bias/) yazısında, insanların yapay zekâ metnini ayırt edip edemediğini [Yapay Zekâ Hikâyesini Ayırt Edebilir misiniz?](https://leventbulut.com/yapay-zeka-hikayesini-ayirt-edebilir-misiniz/) yazısında, dizinin çerçevesini [Yapay Zekâ Hikâyeyi Yazdığında Yazar Kimdir?](https://leventbulut.com/yapay-zeka-hikayeyi-yazdiginda-yazar-kimdir/) yazısında ele aldık. [Levent Bulut](https://leventbulut.com/graph/)'un çalışmalarının birbirine nasıl bağlandığı bilgi grafiği sayfasında görülebilir.

## Doktrinin bu alanda söyleyemeyeceği

Dört tekniğin geçerli olduğunu söyleyemez; uyum çalışmaları geçerliği değil, etiketlenebilirliği ölçer. Tekniklerin geçersiz olduğunu da söyleyemez. Maddeleşen metaforun neden etiketlenemediğini söyleyemez; mevcut veri (a) ve (b) okumalarını ayıramıyor. Makinelerin bu teknikleri hiçbir zaman tanıyamayacağını söyleyemez; ölçülen, belirli modellerin belirli bir tanımla belirli bir andaki davranışıdır. Benzetme yasağındaki kusursuz uyumun, yasağın okur üzerinde bir etkisi olduğu anlamına geldiğini de söyleyemez.

## Sınırlılıklar

Birinci çalışmanın insan etiketleyicisi metodolojinin kurucusudur; bu çalışma bağımsız bir referans sunmaz. İkinci çalışmanın etiketleyicisi bağımsızdır, ama tektir. İki makine etiketleyicinin karışıklık matrisleri türetilmiştir, ham değildir; ham satır dosyaları bulunamadı. Veri kümesinin dağılımı tasarım gereği dengesizdir: dedektörün işaretlerine göre 500 sahnenin %97.2'si duygu ambargosuna, %99.6'sı benzetme yasağına uyuyor, atmosfer çelişkisi ise yalnız %9.8'inde var. Veri kümesi makalesinin özeti ([doi:10.5281/zenodo.22841625](https://doi.org/10.5281/zenodo.22841625?ref=leventbulut.com)) iki bağımsız insan referansından söz ediyor; birinci çalışmanın referansı yazarın kendisi olduğu için bu ifade düzeltilecektir. Benzetimdeki κ = 0.6 bir varsayımdır.

## Sıkça Sorulan Sorular

### Kappa ile yüzde uyum arasındaki fark nedir?

Yüzde uyum, iki etiketleyicinin aynı kararı verdiği sahnelerin oranıdır. Kappa ise bu uyumun, iki etiketleyicinin işaretleme oranlarından şans eseri beklenecek kısmını çıkarır. Bir özellik neredeyse her sahnede varsa, iki etiketleyici şans eseri de çok yüksek oranda uyuşur; bu yüzden yüzde uyum yüksek, kappa düşük çıkabilir.

### Nesnel İzdüşüm'ün dört tekniği makinece tanınamıyor mu?

Mevcut iki çalışmada dört teknikte insan ile makine arasındaki uyum düşük kaldı ya da sınıf dengesizliği yüzünden hesaplanamadı. Maddeleşen metaforda beş makine etiketleyicinin hiçbiri insanı şansın üzerinde izlemedi. Ama bunun nedeni bilinmiyor: özellik doğası gereği çıkarım gerektiriyor olabilir ya da tanımı yeterince işlevselleştirilmemiş olabilir. Mevcut veri bu iki okumayı ayıramıyor.

### Neden ikinci bir insan etiketleyici gerekiyor?

Her iki çalışmada da makineler tek bir insan referansıyla karşılaştırıldı. Makineler o insanla uyuşmadığında, sorunun makinelerde mi, tanımda mı, yoksa o tek insanın yorumunda mı olduğu ayrılamaz. Aynı sahneleri, tanım değişmeden etiketleyen ikinci bağımsız bir insan, iki insanın birbiriyle ne kadar uyuştuğunu gösterir; makinelerin başarısı ancak bu tavana göre okunabilir.

### Bu sonuçlar tekniklerin geçersiz olduğunu mu gösteriyor?

Hayır. Uyum çalışmaları bir özelliğin güvenilir biçimde etiketlenip etiketlenemediğini ölçer; özelliğin yazımda işe yarayıp yaramadığını ölçmez. Tekniklerin geçerli olduğu da geçersiz olduğu da bu verilerle söylenemez.

## Kaynakça

- Artstein, R., ve Poesio, M. (2008). Inter-coder agreement for computational linguistics. *Computational Linguistics*, 34(4), 555–596\. [doi:10.1162/coli.07-034-R2](https://doi.org/10.1162/coli.07-034-R2?ref=leventbulut.com)
- Bulut, L. (2026). Güvenilirlik çalışması. [arXiv:2609.13936](https://arxiv.org/abs/2609.13936?ref=leventbulut.com); [doi:10.5281/zenodo.21740239](https://doi.org/10.5281/zenodo.21740239?ref=leventbulut.com)
- Byrt, T., Bishop, J., ve Carlin, J. B. (1993). Bias, prevalence and kappa. *Journal of Clinical Epidemiology*, 46(5), 423–429.
- Cohen, J. (1960). A coefficient of agreement for nominal scales. *Educational and Psychological Measurement*, 20(1), 37–46\. [doi:10.1177/001316446002000104](https://doi.org/10.1177/001316446002000104?ref=leventbulut.com)
- Feinstein, A. R., ve Cicchetti, D. V. (1990). High agreement but low kappa: I. The problems of two paradoxes. *Journal of Clinical Epidemiology*, 43(6), 543–549.
- Plank, B. (2022). The “problem” of human label variation: On ground truth in data, modeling and evaluation. *Proceedings of EMNLP 2022*.

[Levent Bulut](https://leventbulut.com/corpus/)'un kayıtlı çalışmalarının tam listesi derlem sayfasındadır.

## Atıf

```
@misc{bulut2026kappa,
  author       = {Bulut, Levent},
  title        = {Tek Etiketçiyle Neyi Bilemeyiz? Kappa ve Etiketçiler Arası Uyum},
  year         = {2026},
  howpublished = {\url{https://leventbulut.com/etiketciler-arasi-uyum-kappa-tek-etiketci/}},
  note         = {leventbulut.com}
}
```