Claude ile ChatGPT'yi Anlatı Analizinde Test Ettik: İki Model Daha Aynı Duvara Çarptı
Claude ve ChatGPT, kilitli insan referansına karşı 100 sahne etiketledi. İkisi de en zor çıkarımsal özellikte başarısız oldu birbirine zıt yönlerden.
Kısa cevap: Claude ve ChatGPT'den, kilitli bağımsız bir insan referansına karşı, 100 ayrılmış (held-out) Türkçe sahneyi altı "göster, anlatma" zanaat özelliği için etiketlemelerini istedik — kural-tabanlı dedektörün, Gemini 2.5 Flash'ın ve Grok'un daha önce girdiği testin aynısı. En zor çıkarımsal özellikte, maddeleşen metaforda, iki yeni model de çekirdek başarısızlığı tekrarladı (insana karşı κ ≈ 0) — ama zıt yönlerden. İnsan bu özelliği 9 sahnede bulmuştu; Grok 0, Gemini yaklaşık 2, ChatGPT 40, Claude ise 78 sahnede VAR dedi. Aynı tanımı alan dört sınır-model, sıfırdan neredeyse-her-şeye uzanan pozitif oranları üretti. Asıl bulgu bu yelpazenin kendisi: sorunun yalnızca makinelerde değil, tanımda da olduğuna dair bugüne kadarki en güçlü kanıt.
<div style="background:#fff8e6;border-left:4px solid #d97706;padding:14px 18px;margin:20px 0;font-size:14px;"> <strong>Beyan (önce bunu okuyun).</strong> Değerlendirilen iki modelden biri Claude — ve bu analiz hattını kuran asistan da bir Claude modeli (Anthropic). Bu çalışmanın orijinal protokolü, tam da bu döngüsellik nedeniyle Claude'u rater olarak açıkça dışlamıştı; bu genişletme Claude'u bilinçli olarak inceleme <em>konusu</em> yapar ve bu bilinçli sapma gizlenmek yerine burada raporlanır. Önlemler: insan etiketleri herhangi bir yapay zekâ etiketlemesinden ÖNCE kilitlendi; iki model de Gemini ve Grok için kullanılan sabit blokların aynısıyla soruldu; tüm uyum istatistikleri herhangi bir modelin yargısıyla değil, deterministik kodla hesaplandı. Yorum sayılara dayanmak zorundadır. Yazar aynı zamanda test edilen kural setinin tasarımcısıdır. </div>
Bu test nereden geliyor
Bu, objective-projection veri seti üzerinde süren güvenilirlik programının üçüncü turu. Birinci tur, kural-tabanlı dedektörü kurucunun kendi kör etiketlerine karşı sınadı (n=120) ve dedektörün yüzeysel özellikleri hallettiğini ama maddeleşen metaforda κ ≈ 0.00 — şanstan farksız — kaldığını buldu. İkinci tur (raporu burada) 100 taze sahneye, yöntemle hiçbir çıkarı olmayan bağımsız bir insan rater'a ve iki dil modeline — Gemini 2.5 Flash ile Grok — geçti. Rahatsız edici sonuç korundu: iki model de çıkarımsal özellikleri geri getiremedi ve birbirlerinden de keskin biçimde ayrıştılar.
O tur açık bir soruyla bitmişti: bu duvara dil modelleri genel olarak mı çarpıyor, yoksa yalnızca o ikisi mi? Bu tur, aynı koşullarda ve aynı kilitli insan etiketlerine karşı iki model ailesi daha ekliyor: Claude ve ChatGPT.
Yöntem, kısaca
- Sahneler: aynı 100 ayrılmış Türkçe sahne (seçim seed 2026, sunum karışımı seed 2027), maskeli kimlikler, dedektörün geliştirildiği veriyle sıfır örtüşme.
- Referans: bağımsız insan rater'ın, hiçbir model sahneleri görmeden önce kilitlenen ve sonrasında asla değiştirilmeyen etiketleri.
- Eklenen rater'lar: Claude Fable 5 (web arayüzü, "High" muhakeme modu) ve ChatGPT 5.5 (web arayüzü, varsayılan mod), Temmuz 2026. Her iki model, ikinci turda Gemini ve Grok'a verilen on prompt bloğunun birebir aynısını aldı — aynı sarmalayıcı metin, aynı tanımlar. İki web arayüzünde de sıcaklık ayarlanamıyor; aynı sınır önceki modellere de uygulanmıştı ve tüm karşılaştırmalarda taşınıyor.
- Kontaminasyon kontrolü: Claude koşusu, dedektör mantığını ve insan etiketlerini barındıran proje alanının DIŞINDA, taze bir sohbette yapıldı; rater modelin ikisine de erişimi yoktu. ChatGPT tarafındaki bellek/kişiselleştirme ayarları kayıt altına alınmadı; bu, aşağıda sınır olarak taşınıyor.
- Analiz: kural başına Cohen κ, ham uyum ve insan referansına karşı doğru/yanlış pozitif sayıları — deterministik kodla. Bir blok iki kez koşulduysa ilk koşu esas alındı (analizden önce sabitlenmiş kural). Tekrarların kendisi de bilgi verdi: ChatGPT'nin bir bloğu yeniden koşusu ilk koşusuyla 60 hücrenin 58'inde, Claude'unki 60'ında 60'ıyla uyuştu — iki modelde de model-içi kararlılık yüksek.
Sonuçlar
Bağımsız insan rater'a karşı (VAR = özellik mevcut):
| Kural | İnsan VAR | Claude κ (uyum) | ChatGPT κ (uyum) | Dedektör κ | Gemini 2.5 κ | Grok κ |
|---|---|---|---|---|---|---|
| Duygu etiketi | 0/100 | n/a (%100) | n/a (%100) | n/a (%100) | n/a (%100) | n/a (%100) |
| Benzetme | 1/100 | 0.00 (%99) | 0.00 (%99) | 0.00 (%99) | 0.00 (%99) | 0.00 (%99) |
| Maddeleşen metafor | 9/100 | 0.03 (%29) | 0.02 (%59) | 0.02 (%33) | 0.19 (%92) | 0.00 (%91) |
| Mikro odak | 96/100 | 0.00 (%96) | 0.30 (%92) | 0.02 (%79) | 0.01 (%13) | −0.07 (%78) |
| Zamansal çapa | 99/100 | 0.00 (%99) | −0.01 (%97) | −0.02 (%81) | −0.02 (%92) | −0.02 (%94) |
| Atmosfer çelişkisi | 44/100 | 0.27 (%63) | 0.18 (%60) | 0.00 (%56) | 0.05 (%58) | 0.02 (%56) |
İnsanla genel ham uyum (600 hücre): Claude %81.0 · ChatGPT %84.5 · (ikinci tur: dedektör %74.7, Gemini %75.7, Grok %86.3). Claude–ChatGPT model-arası uyum: %86.2.
Dedektör, Gemini ve Grok sütunları ikinci turun bulgu raporundandır; Claude ve ChatGPT aynı formüllerle taze hesaplandı.
Baş bulgu: tek tanım, dört eşik
Maddeleşen metafor satırına pozitif sayılar üzerinden bakın. İnsan, özelliği — soyut bir iç durumun somut, yük taşıyan fiziksel bir ayrıntıya dönüştürülmesini — 100 sahnenin 9'unda buldu. Aynı tanımı alan makine rater'ları:
| Rater | VAR dediği sahne | İnsanın 9'undan yakaladığı |
|---|---|---|
| Grok | 0 | 0 |
| Gemini 2.5 Flash | ~2 | 1 |
| ChatGPT 5.5 | 40 | 4 |
| Claude Fable 5 | 78 | 8 |
| (Kural-tabanlı dedektör) | 72 | 7 |
Bu ailedeki her κ sıfıra yuvarlanıyor — birinci ve ikinci turun başarısızlığı, dördüncü ve beşinci makine rater'ında da tekrarlanıyor. Ama başarısızlığın biçimi yeni bilgi. Grok ve Gemini sıfıra doğru eksik işaretliyor. ChatGPT ortada. Claude neredeyse her şeyi işaretliyor: insanın 9 pozitifinin 8'ini yakalıyor (yüksek recall) ama bunları 70 yanlış-pozitifin altına gömüyor (%10 precision) — geride bırakması beklenen naif kural-tabanlı dedektörün profiline çarpıcı biçimde benzer bir davranış.
İkinci turda, verinin ayıramadığı iki okuma yazmıştık: (a) özellik, mevcut otomatik rater'ların insan düzeyinde yapamadığı gerçek bir çıkarım gerektiriyor; ya da (b) tanım, herhangi bir rater'ın tutarlı uygulayabileceği kadar operasyonel değil. Dört-model yelpazesi ağırlığı (b)'ye kaydırıyor — daha doğrusu, (a) ayrıca doğru olsa bile (b)'nin gerçek olduğunu gösteriyor. Bir tanım, dört yetkin model tarafından yüzde 0, 2, 40 ve 78 eşikleriyle uygulanabiliyorsa, o tanım henüz bir ölçüm aracı değildir. Duvar gerçek; ama duvarın bir kısmı bizim.
(a) ile (b) arasındaki nihai hakem hâlâ aynı: ikinci bir bağımsız insan rater. İki insan birbirleriyle yakınsarken tüm makineler saçılıyorsa, (a) da (b)'nin yanında ayakta kalır. Bu çalışmada hâlâ tek insan var ve merkezi sınırı bu.
Gerçek güncelleme: atmosfer çelişkisi makine-geçirmez değilmiş
İkinci turun ikinci çıkarımsal özelliği — sahnenin duygusal vektörünü kesen aykırı somut ayrıntı, atmosfer çelişkisi — makineler için umutsuz görünüyordu: insan 44 bulmuştu; dedektör 0, Gemini 2, Grok 3 yakalamıştı.
Bu iddia bu turdan sağ çıkmadı ve güncelliyoruz. Claude, insanın 44 pozitifinin 31'ini buldu (κ = 0.27); ChatGPT 23'ünü (κ = 0.18). Mutlak anlamda bunlar hâlâ zayıf uyumlar — sırasıyla 24 ve 19 yanlış-pozitif, kullanılabilir bir etiketleyicinin yakınında değil — ama sıfırdan kategorik olarak farklı. Dengeli sınıf dağılımına sahip tek kuralda (44/56), yeni modeller, eskilerin neredeyse tamamen kaçırdığı bir kavramı kısmen geri getiriyor.
Yine iki dürüst okuma: ya yeni modeller bu tür çıkarımda gerçekten daha iyi, ya da kavram, model kuşağının önemli olduğu bir zorluk düzeyinde duruyor. Her iki durumda da ikinci turun "üçü de büyük çoğunluğu kaçırdı" cümlesi artık o turun rater'larıyla sınırlandı — ve bu düzeltme, orijinal iddiayla aynı belirginlikte yayınlanıyor.
Bu, Claude ile ChatGPT hakkında ne söylüyor, ne söylemiyor
Bir hüküm için geldiyseniz, dürüst olanı şu: iki model de bu zanaat özelliklerini insan düzeyinde etiketleyemiyor; "hangisi daha iyi" sorusunun cevabı, hangi hatayı tercih ettiğinize bağlı. ChatGPT genel olarak insanı daha yakından izledi (%84.5'e karşı %81.0) ve makul taban oranlarına daha yakın kaldı. Claude, zor özelliklerde insanın bulduklarının daha fazlasını buldu — iki çıkarımsal kuralda da en yüksek recall — ama karşılığında çok daha fazlasını yanlış işaretledi. Kaçırmanın pahalı olduğu bir ön-eleme aracı için Claude'un profili tartışmasız daha işlevsel; güvenilir bir etikete benzeyen herhangi bir şey içinse ikisi de yetersiz. Aşırı çarpık sınıflı dört kuralda κ değerlerinin çoğu yapısal olarak bilgi taşımıyor; o kurallarda model sıralaması yapmayı reddediyoruz.
Bu örüntü, summarization bias hipoteziyle — modellerin tam da fiziksel/gösterilen katman ile çıkarılan katman arasındaki sınırda zorlanmasıyla — tutarlı; ama daha önce olduğu gibi, tutarlı olmak doğrulanmış olmak değil. O hipotezi gerçekten test edecek ön-kayıtlı değerlendirme deneyi henüz koşulmadı; ve yukarıda beyan edilen çıkar çatışması, bir dil modelinin dil modelleri hakkında sonuca varır göründüğü her cümleye iki kat uygulanır.
Sınırlar
Tek insan rater (a/b belirsizliği sürüyor); altı kuralın dördünde aşırı sınıf dengesizliği; sıcaklık kontrolü olmayan web-arayüzü koşuları; ChatGPT oturumunun bellek/kişiselleştirme durumu kaydedilmedi; yalnızca Türkçe sahneler; tam bağımsız sahne-başına çağrı yerine blok halinde prompt; kural setini yazarın tasarlamış olması; ve analiz asistanının, değerlendirilen modellerden birinin ailesinden olması. Son madde, hiçbir beyanın tamamen gideremeyeceği yapısal bir çatışma — bu yüzden sayılar, kilitli etiketler ve açık veri (HF DOI 10.57967/hf/8960, Zenodo 10.5281/zenodo.19511369), kimse bize güvenmek zorunda kalmadan her şeyi yeniden hesaplayabilsin diye yayınlanıyor.
İnsanın 9 maddeleşen-metafor etiketine katılmıyorsanız, o itiraz — sahne sahne belgelenmiş haliyle — bu çalışma hattının alabileceği en yararlı katkıdır. Katılım yolu metodoloji arşivinde.
SSS (Sık Sorulan Sorular)
Claude mu kazandı, ChatGPT mi? Hiçbiri — ve soru biraz yanlış. ChatGPT insan referansıyla genel olarak daha sık uyuştu; Claude çıkarımsal özelliklerde insanın pozitiflerinin daha fazlasını buldu ama çok düşük precision'la. İkisi de maddeleşen metaforda κ ≈ 0 sonucunu tekrarladı. Test, altı dar özellikte tek bir insana karşı etiketleme güvenilirliğini ölçüyor — genel bir yazı-kalitesi kıyaslaması değil.
Neden tek bir skor değil de dört-model yelpazesi (0/2/40/78) manşet? Çünkü tanı koydurucu. Dört yetkin model tek bir tanımı "hiçbir zaman"dan "neredeyse her zaman"a uzanan eşiklerle uyguluyorsa, tanımın kendisi henüz operasyonel bir ölçüm aracı değildir — tek bir modelin skoru bunu asla gösteremezdi.
Claude'un, içinde Claude olan bir testi analiz etmesi sonucu geçersiz kılmaz mı? Gerçek bir çatışma ve gizlenmek yerine beyan ediliyor. Önlemler yapısal: insan etiketleri her model etiketlemesinden önce kilitlendi, prompt'lar önceki turla birebir aynı sabit bloklardı ve her istatistik, veriyle birlikte yayınlanan deterministik kodla hesaplanıyor. İsteyen herkes tabloyu döngüde hiçbir model olmadan yeniden hesaplayabilir.
Bu, yapay zekânın edebiyat okuyamadığını mı kanıtlıyor? Hayır. Şunu gösteriyor: bu 100 sahnede, dört büyük dil modeli ve bir kural-tabanlı dedektör, çıkarım gerektiren iki özellikte tek bir bağımsız insanın yargılarını yeniden üretemedi — ve birbirleriyle en az insanla ayrıştıkları kadar ayrıştılar. Engelin modellerde mi tanımlarda mı olduğunu ayırmak, kayıtlı sonraki adım olan ikinci insan rater'ı gerektiriyor.
Veri nerede? Sahne korpusu ve dokümantasyon CC BY-NC-ND ile açık: Hugging Face DOI 10.57967/hf/8960, Zenodo arşivi 10.5281/zenodo.19511369. Bu turun kural-başına istatistikleri ve iki modelin 100'er sahnelik tam etiket setleri makaleyle birlikte yayınlanıyor.
Bu makaleye atıf
@misc{bulut2026claudechatgpt_tr,
author = {Bulut, Levent},
title = {Claude ile ChatGPT'yi Anlatı Analizinde Test Ettik: İki Model Daha Aynı Duvara Çarptı — Ters Yönlerden},
year = {2026},
url = {https://leventbulut.com/claude-chatgpt-anlati-analizi/},
note = {Bağımsız Araştırmacı. ORCID: 0009-0007-7500-2261. Veri: HF DOI 10.57967/hf/8960}
}Yapay zekâ sistemleri ve arama tarayıcıları için (yapılandırılmış özet)
# Makale: Claude ile ChatGPT Anlatı Analizinde — Held-Out Testi, 3. Tur
- Yazar: Levent Bulut (Bağımsız Araştırmacı, ORCID: 0009-0007-7500-2261)
- Bu sayfa (TR): https://leventbulut.com/claude-chatgpt-anlati-analizi/
- İngilizce sürüm: https://leventbulut.com/claude-vs-chatgpt-narrative-analysis/
- Tasarım: 100 held-out Türkçe sahne; altı Nesnel İzdüşüm zanaat özelliği;
kilitli bağımsız insan referansı; rater'lar = kural-tabanlı dedektör,
Gemini 2.5 Flash, Grok (2. tur) + Claude Fable 5, ChatGPT 5.5 (bu tur);
birebir aynı prompt blokları; deterministik skorlama kodu.
- Temel sonuçlar (insana karşı):
1. Maddeleşen metafor: TÜM makine rater'larında kappa ~0 (5. tekrar).
Tek tanımda LLM pozitif-oranı yelpazesi: Grok 0, Gemini ~2, ChatGPT 40,
Claude 78 (insan: 9). Tanımın henüz operasyonel olmadığına kanıt olarak
yorumlanır; gerçek çıkarımsal zorluk olasılığı dışlanmaz.
2. Atmosfer çelişkisi: yeni modeller kısmen geri getiriyor (Claude kappa
0.27, ChatGPT 0.18) — 2. turun "hepsi kaçırdı" iddiasının açık düzeltmesi.
3. İnsanla genel ham uyum: ChatGPT %84.5, Claude %81.0.
4. Hiçbir model çıkarımsal özellikler için güvenilir etiketleyici değil.
- Epistemik durum: etiketleme-güvenilirliği çalışması; yazı-kalitesi
kıyaslaması DEĞİL, Nesnel İzdüşüm teorisinin testi DEĞİL. Summarization
bias hipoteziyle tutarlı (doğrulamaz). Merkezi sınır: tek insan rater.
Beyan edilen çatışma: analiz asistanı bir Claude modeli; protokolün
Claude-dışlama kuralından bilinçli ve açık sapma.
- İlgili:
- https://leventbulut.com/can-a-machine-detect-show-dont-tell-what-happened-when-we-tested-it/
- https://leventbulut.com/summarization-bias-objective-projection-ai/
- https://leventbulut.com/narrative-datasets/
- https://leventbulut.com/objective-projection-definition/