Okurlar AI Hikâyesini İnsan Hikâyesinden Ayırt Edebilir mi?
Okurlar yapay zekâ öykülerini şans düzeyinde tanıyor, bir sınıflandırıcı %93 ile. Fark üslupta değil, anlatı mimarisinde. Yeni araştırmalar ne diyor?
Özet
2026'da yayımlanan iki çalışma birbiriyle çelişiyor gibi görünüyor. Birinde okurlar bir kısa öykünün insan mı yapay zekâ mı tarafından yazıldığını yazı-tura düzeyinde tahmin edebildi — ve yapay zekâ öykülerini daha kaliteli buldu. Ötekinde bir sınıflandırıcı aynı ayrımı yüzde 93'ün üzerinde doğrulukla yaptı. Bu yazı çelişkinin nerede çözüldüğünü öneriyor: okur üsluba bakıyor, sınıflandırıcı anlatı mimarisine. Yapay zekâ her zaman makine gibi konuşmuyor; ama anlatıyı kurarken makine gibi davranabiliyor — karakterin seçimlerinde, nedenselliğin düzeninde, zamanın akışında, ahlaki belirsizlikte ve açıklama yoğunluğunda.
İki kısa öykü okuduğunuzu düşünün. Birini bir insan yazdı. Ötekini bir yapay zekâ üretti.
Hangisinin hangisi olduğunu söyleyebilir misiniz?
Büyük ihtimalle hayır. Ve bu yazının asıl ilginç kısmı, söyleyemediğiniz hâlde farkın gerçekten var olması.
Okurlar ayırt edemiyor
2026 yazında Judgment and Decision Making dergisinde (Cambridge University Press) yayımlanan bir çalışma bu soruyu doğrudan sordu. Villanova Üniversitesi'nden araştırmacılar, saygın edebiyat dergilerinde ya da öykü derlemelerinde yayımlanmış üç insan öyküsünü, her birine konu ve üslup bakımından benzetilmiş üç ChatGPT öyküsüyle eşleştirdi.
İlk deneyde 1.682 yetişkin okur bu öykülerden birini okudu. Okura öyküyü kimin yazdığı söylendi — ama yarı yarıya yanlış söylendi. Sonuç iki etkinin üst üste bindiğini gösterdi: okurlar yapay zekâ öyküsünü daha kaliteli ve daha sürükleyici buldu; ama "insan yazdı" etiketi taşıyan her öyküye, gerçekte kim yazmış olursa olsun, daha yüksek puan verdi. En yüksek puanı alanlar, insan yazmış gibi etiketlenmiş yapay zekâ öyküleriydi.
İki takip deneyinde 905 okura her iki türden öykü okutuldu ve kaynağı tahmin etmeleri istendi. Doğru tahmin oranları yüzde 40 ve yüzde 52 oldu — yani şans düzeyinden ayırt edilemeyen bir başarı.
Kısacası: okur farkı görmüyor, ama etikete tepki veriyor.
Makineler ayırt edebiliyor — ama başka bir yere bakarak
Aynı yıl arXiv'de yayımlanan StoryScope çalışması (Russell ve ark., 2026) soruyu farklı sordu: yapay zekâ öyküleri, üslup ipuçları hiç kullanılmadan, yalnız anlatının nasıl kurulduğuna bakılarak insan öykülerinden ayrılabilir mi?
Araştırmacılar 10.272 yazma istemi topladı. Her istem için bir insan yazarın öyküsü ve beş dil modelinin (Claude, DeepSeek, Gemini, GPT, Kimi) öyküleri vardı. Toplam 61.608 öykü, her biri yaklaşık 5.000 sözcük. Her öyküden, karakter, olay örgüsü, mekân ve zaman yapısı gibi on boyutta 304 anlatı özelliği çıkarıldı.
Yalnız bu anlatı özellikleriyle — cümle ritmi, mecaz yoğunluğu gibi bütün üslup özellikleri dışarıda bırakılarak — insan ve yapay zekâ ayrımı yüzde 93,2 başarıyla yapıldı. Bu, üslubu da kullanan bir modelin başarısının yüzde 97'sinden fazlası. Hangi modelin yazdığını bulma görevinde ise başarı yüzde 68,4 oldu. Çalışmanın ifadesiyle, yapay zekâ öyküleri anlatı uzayında ortak bir bölgede kümeleniyor, insan öyküleri ise çok daha dağınık.
(Yorum — veriden ayrı olarak işaretlenmiştir.) İki çalışma yan yana konunca çelişki şuna dönüşüyor: farkı taşıyan şey, okurun dikkat ettiği yerde değil.
Üslup ve anlatı mimarisi
Bir öyküyü iki katmanda okumak mümkün.
Üslup cümlenin yüzeyidir: sözcük seçimi, ritim, imge, ses. Okurun ilk karşılaştığı ve çoğunlukla bilinçli olarak değerlendirdiği katman budur. Güncel dil modelleri bu katmanda artık akıcı ve çoğu zaman özenli metin üretiyor. Cambridge çalışmasındaki okurların yapay zekâ öyküsünü daha kaliteli bulması bunun göstergesi.
Anlatı mimarisi ise cümlelerin altındaki kararlardır: karakter ne zaman ve neden seçim yapıyor, olaylar birbirine nasıl bağlanıyor, zaman düz mü akıyor yoksa geri mi dönüyor, hikâye kendi anlamını açıkça söylüyor mu yoksa okura mı bırakıyor. Okur bu katmanı yaşar ama genellikle adlandırmaz. "Bir şey eksikti ama ne olduğunu bilmiyorum" hissi çoğu zaman buradan gelir.
Bu ayrım hesaplamalı anlatıbilim açısından belirleyicidir: metin tespit araçlarının büyük bölümü üslup katmanında çalışır ve metin yeniden yazıldığında kolayca atlatılır. Anlatı mimarisi ise yeniden yazmaya çok daha dayanıklıdır, çünkü onu değiştirmek için hikâyeyi yeniden kurmak gerekir.
Yapay zekâ her zaman makine gibi konuşmuyor. Ama makine gibi davranabiliyor.
StoryScope'un bulduğu farklar, tam olarak anlatı mimarisinin beş ekseninde yoğunlaşıyor.
1. Karakterin eylemliliği
Karakterin seçimlerinin hikâyeyi gerçekten yönlendirip yönlendirmediği. StoryScope, üslup ipuçlarına başvurmadan ayırt edici olduğunu gösterdiği anlatı tercihleri arasında karakter eylemliliğini açıkça sayıyor. Yapay zekâ öyküsünde karakterler çoğu zaman olayların içinden geçer; insan öyküsünde olayları daha sık yaratır.
2. Nedensel yapı
Olayların birbirine nasıl bağlandığı. Çalışmaya göre yapay zekâ öyküleri derli toplu, tek hatlı olay örgülerini tercih ediyor. Her olay bir sonrakine düzgünce bağlanıyor; açık uç, paralel hat, sonradan anlam kazanan bir ayrıntı daha az.
3. Zamansal karmaşıklık
İnsan öykülerinde geriye dönüşler ve doğrusal olmayan yapılar belirgin biçimde daha sık. Yapay zekâ zamanı çoğunlukla düz bir çizgide akıtıyor.
4. Ahlaki belirsizlik
İnsan yazarlar kahramanın seçimlerini ahlaken daha belirsiz kuruyor. Doğru ile yanlışın net ayrıldığı bir seçim, okura düşünecek daha az şey bırakır.
5. Açıklama yoğunluğu
Belki de en çarpıcı bulgu: yapay zekâ öyküleri temalarını fazla açıklıyor. Hikâyenin ne anlama geldiğini okura bırakmak yerine metnin içinde söylüyor.
Çalışma ayrıca modele özgü parmak izleri de raporluyor: Claude'da belirgin biçimde düz bir olay tırmanışı, GPT'de rüya sahnelerine aşırı başvuru, Gemini'de karakterin dışarıdan betimlenmesi.
Açıklama yoğunluğu ve "anlatılan–gösterilen" ekseni
Beşinci bulgu, Levent Bulut'un üzerinde çalıştığı bir soruyla doğrudan temas ediyor. Nesnel İzdüşüm çerçevesi anlatıyı iki kip arasında konumlandırır: anlatılan kipte içerik yüzeyde açıkça söylenir; gösterilen kipte fiziksel ipuçlarına kodlanır ve okur onu yeniden inşa eder.
Özetleme Yanlılığı (Summarization Bias) adıyla kayda geçirilmiş hipotez, dil modellerinin bu eksende rastgele değil tek bir yöne — anlatılan kipe doğru — hata yaptığını öne sürüyor. StoryScope'un "temaları fazla açıklıyor" bulgusu bu hipotezle uyumlu.
Burada dikkatli olmak gerekiyor: uyumlu olmak kanıt olmak değildir. StoryScope bu hipotezi sınamak için tasarlanmadı, farklı özellikleri farklı bir yöntemle ölçtü. Özetleme Yanlılığı hâlâ veri toplanmadan önce kaydedilmiş bir protokol; henüz sınanmadı. Ama bağımsız bir çalışmanın, kendi yolundan giderek aynı yöne işaret eden bir bulguya ulaşması, sınanmaya değer bir sorunun işaretidir. Aynı sorunun sahne düzeyindeki bir görünümü ayrıca incelenmişti: Why AI Cannot Maintain Micro-Focus (İngilizce).
Açık bir soru: özellikleri kim etiketledi?
StoryScope'un yöntemine dair önemli bir ayrıntı var. 61.608 öykünün her birine 304 özelliğin değerini bir dil modeli atadı (Gemini 3 Flash).
Bu ayrıntı ilgi çekici, çünkü Bulut'un kendi yayımlanmış güvenilirlik çalışmasında, çıkarım gerektiren anlatı özelliklerinin dil modelleri tarafından etiketlenmesi ölçülmüş ve düşük çıkmıştı: bir kural için, insan 100 sahnenin 9'unda "var" derken beş makine etiketleyici 0, 1, 40, 72 ve 78 dedi; uyum dördünde şans düzeyindeydi.
(Yorum.) Bu, StoryScope'un bulgusunu geçersiz kılmaz. Etiketler rastgele gürültü olsaydı sınıflandırıcı yüzde 93'e ulaşamazdı; yani etiketler sistematik bir sinyal taşıyor. Açık kalan soru daha incedir: bu sinyal, bir insanın aynı özellikleri etiketlediğinde göreceği anlatı mimarisi mi, yoksa kısmen etiketleyici modelin kendi okuma alışkanlıkları mı? İki çalışma farklı özellikler, farklı diller ve farklı metinler kullandığı için birinden ötekine doğrudan çıkarım yapılamaz. Ama "makine anlatı mimarisini görüyor" cümlesinin, makinenin gözüyle kaydıyla okunması gerekir.
Peki bu ne anlama geliyor?
Birkaç şey söylenebilir, hiçbiri kesinlik iddiasıyla değil.
Birincisi, "yapay zekâ metnini ayırt edebilir miyim?" sorusu okur için muhtemelen yanlış soru. Okur üsluba bakıyor ve üslup katmanında fark giderek kapanıyor. Fark, okurun genellikle adlandırmadığı katmanda duruyor.
İkincisi, bu katman tasarlanabilir. Karakterin seçimi, nedenselliğin hattı, zamanın düzeni, ahlaki gerilim ve açıklamanın ne kadar okura bırakılacağı — bunlar kararlardır. Bu dizinin ilk yazısında (Yapay Zekâ Hikâyeyi Yazdığında Yazar Kimdir?) önerildiği gibi, yazarlık sorusunu da tam bu katmanlara bakarak sormak mümkün.
Üçüncüsü, Cambridge çalışmasının etiket etkisi başlı başına bir uyarı: okurlar yazarın kim olduğunu düşündüklerine göre puan veriyor. Bu, yapay zekâ kullanımının beyan edilmesi tartışmasında her iki yöne de kesen bir bulgu.
Levent Bulut'un yaklaşımı burada bir hüküm vermiyor; yakınsama iddiası istatistikseldir, deterministik değildir. Çerçeveye yöneltilen itirazlar ayrıca derlenmiştir: Bulut Doctrine — Critiques.
Sınırlılıklar
- İki çalışma farklı metinler kullandı. Cambridge çalışması kısa öyküler kullandı; StoryScope yaklaşık 5.000 sözcüklük öyküler. StoryScope yazarları bu uzunluğun, kısa metinlerin desteklemediği ince özelliklerin çıkarılmasını mümkün kıldığını belirtiyor. Okur ile sınıflandırıcı arasındaki farkın bir kısmı metin uzunluğundan kaynaklanıyor olabilir.
- Aynı öyküler üzerinde karşılaştırma yok. Okurlar ile sınıflandırıcı aynı metinleri değerlendirmedi. "Okur görmüyor, makine görüyor" ifadesi iki ayrı çalışmanın yan yana okunmasıdır, tek bir deneyin sonucu değildir.
- Etiketleyici bir dil modeli. StoryScope özelliklerinin değerleri bir dil modeli tarafından atandı. Bu yazıda bunun bir sorun olduğu iddia edilmiyor; yalnız sorulması gereken bir soru olduğu belirtiliyor.
- Özetleme Yanlılığı sınanmadı. Hipotez, veri toplanmadan önce kaydedilmiş bir protokoldür; StoryScope bulgusu onunla uyumludur ama onu doğrulamaz.
- Modeller hızla değişiyor. Aktarılan bulgular belirli model sürümlerine aittir; sonraki sürümlerde anlatı eğilimleri değişebilir.
- Biyometri yok. Bu yazıda geçen okur tepkileri, aktarılan çalışmaların öz bildirim verileridir; fizyolojik ölçüm yoktur.
Sıkça Sorulan Sorular
Okurlar yapay zekâ hikâyesini insan hikâyesinden ayırt edebiliyor mu?
Mevcut kanıtlara göre büyük ölçüde hayır. 2026'da Judgment and Decision Making'de yayımlanan bir çalışmada okurlar kısa öykülerin kaynağını yüzde 40 ve yüzde 52 doğrulukla tahmin etti — şans düzeyinden ayırt edilemeyen bir başarı. Üstelik yapay zekâ öykülerini daha kaliteli buldular.
O zaman yapay zekâ hikâyesi insan hikâyesiyle aynı mı?
Hayır. Fark üslupta değil, anlatının kuruluşunda duruyor. StoryScope çalışması, üslup ipuçlarını hiç kullanmadan yalnız anlatı özelliklerine bakarak insan ve yapay zekâ öykülerini yüzde 93,2 başarıyla ayırdı. Yapay zekâ öyküleri temalarını fazla açıklıyor ve tek hatlı olay örgülerini tercih ediyor; insan öykülerinde ahlaki belirsizlik ve zamansal karmaşıklık daha fazla.
Yapay zekâ tespit araçları neden sık sık yanılıyor?
Araçların büyük bölümü üslup katmanında çalışır: sözcük seçimi, cümle ritmi, belirli kalıpların sıklığı. Bu katman metin yeniden yazıldığında kolayca değişir. Anlatı mimarisi ise çok daha dayanıklıdır, çünkü onu değiştirmek için hikâyenin kendisini yeniden kurmak gerekir. Yine de anlatı özelliklerinin kendisinin nasıl etiketlendiği, ayrıca sorulması gereken bir sorudur.
Kaynakça
- Bot or not: Can people tell the difference between stories written by a human or by an AI system? (2026). Judgment and Decision Making. Cambridge University Press. Villanova Üniversitesi; kıdemli yazar D. Weisberg. Cambridge Core
- Russell, J. ve ark. (2026). StoryScope: Investigating idiosyncrasies in AI fiction. arXiv:2604.03136. arxiv.org/abs/2604.03136
- Bulut, L. (2026). The Bulut Doctrine: Architectural Framework. Zenodo. 10.5281/zenodo.18689179
- Bulut, L. (2026). Why AI Cannot Write Emotional Scenes: Objective Projection as a Framework for Auditable Narrative Generation. Zenodo. 10.5281/zenodo.22466696
- Bulut, L. (2026). Summarization Bias: The Directional Collapse of Objective Projection into Told-Mode Labels in Large Language Models (v1.1). Zenodo. 10.5281/zenodo.22817289 · arXiv:2609.20712
- Bulut, L. (2026). Inter-Rater Reliability of LLM and Rule-Based Annotation for Inferential Narrative Features: Three Studies on a Turkish Corpus. Zenodo. 10.5281/zenodo.21740239 · arXiv:2609.13936
- Bulut, L. (2026). Objective Projection Dataset [Veri kümesi]. Hugging Face Datasets. 10.57967/hf/8960
- Tüm kayıtlı çalışmalar: Levent Bulut — Corpus
Atıf
@misc{bulut2026ayirt,
author = {Bulut, Levent},
title = {Okurlar Yapay Zeka Hikayesini Insan Hikayesinden Ayirt Edebilir mi?},
year = {2026},
howpublished = {leventbulut.com},
url = {https://leventbulut.com/yapay-zeka-hikayesini-ayirt-edebilir-misiniz/},
note = {Objective Projection / Bulut Doctrine. ORCID: 0009-0007-7500-2261}
}