Halüsinasyonun Ötesinde: Dil Modellerinde Anlatım Kipi Kayması

Her LLM hatası halüsinasyon değil. Model duyguyu kurmak yerine söylüyor. Bu kısıtların hangisini bir makine gerçekten denetleyebilir? Cevap ölçülmüş durumda.

Share
Halüsinasyonun Ötesinde: Dil Modellerinde Anlatım Kipi Kayması
AI Deep Emotional Coding Map and Control Interface

Özet

Halüsinasyon, dil modellerinin olgusal görevlerdeki en bilinen başarısızlığı. Anlatı görevlerinde ise daha sessiz bir başarısızlık var: model duyguyu kurmak yerine söylüyor. Bu yazı o kaymayı bir beğeni meselesi değil, bir hizalama hedefi olarak ele alıyor ve bir mühendisin soracağı soruyu soruyor: bu kısıtların hangisini bir makine gerçekten denetleyebilir? Cevap zaten ölçülmüş durumda. Yüzey örüntüsüne indirgenen kısıtlar neredeyse kusursuz aktarılıyor; çerçevenin çekirdeğine en yakın kısıt hiç aktarılmıyor. Bu ayrım, neyin otomatik ödül sinyali olabileceğini, neyin insan yargısı olarak kalması gerektiğini belirliyor — ve bu yazının uçtan uca bir boru hattı önermekten kaçınmasının sebebi de bu.

Bir dil modelinden dağılmakta olan bir karakterin sahnesini isteyin; gelen cümlede çoğunlukla kelimenin kendisi geçer. Ölçülülük isteyin; bu kez kelimeye bir zarf eklenir. Model olgusal olarak hiçbir şeyi yanlış söylemiyor. Yalnızca bir yazarın sorduğundan başka bir soruya cevap veriyor.

Ne kayıyor — ve bu neden halüsinasyon değil

Hizalama alanyazınında halüsinasyon belirli bir başarısızlığı adlandırır: modelin dünya hakkında doğru olmayan bir şey öne sürmesi — var olmayan bir kaynak, yaşanmamış bir tarih, kimsenin söylemediği bir söz. Bu, olgusal temellendirme başarısızlığıdır ve dış bir doğruya karşı ölçülür.

Burada tarif edilen başarısızlık türce farklıdır. Yanlış bir şey öne sürülmüyor. Model karakterin yas tuttuğunu doğru biçimde aktarıyor; yalnızca bu içeriği yeniden inşa edilebilir bir sahne biçiminde değil, bir etiket biçiminde teslim ediyor. Buna Anlatım Kipi Kayması (İng. delivery-mode drift) diyoruz: kurmak yerine söylemeye dönük sistematik bir tercih.

Ayrım üç sebeple önemli:

  • Farklı doğruluk ölçütü. Halüsinasyon dünyaya karşı denetlenir. Anlatım kipi kayması metnin kendi kuruluşuna karşı denetlenir — bilgi yüzeyde mi, yoksa fiziksel ayrıntıya mı kodlanmış?
  • Farklı çare. Erişim temellendirmesi (retrieval grounding) halüsinasyonu azaltır, çünkü olgu sağlar. Anlatım kipine etkisi yoktur, çünkü sorun eksik bilgi değildir.
  • Farklı saptanabilirlik. Sahte bir kaynak otomatik doğrulanabilir. Bir fiziksel ayrıntının temsil işi görüp görmediği doğrulanamaz — aşağıdaki ölçümlerin gösterdiği gibi.

Açıkça söylemek gerekirse: burada ele alınan çerçeve olgusal halüsinasyona dokunmamakta ve onu azalttığını iddia etmemektedir.

Hizalama hedefi olarak anlatılan–gösterilen ekseni

Nesnel İzdüşüm, anlatı metnini iki teslim kipi arasına yerleştirir. Anlatılan kipte içerik yüzeyde söylenir ve okur az yeniden inşa yapar. Gösterilen kipte aynı içerik yüzeyden çekilir ve fiziksel ipuçlarına — ışık, ısı, ses, hareket, basınç, mekânsal geometri — kodlanır; okur onu buradan yeniden kurar.

Yöntem, sahneyi altı ölçülebilir fiziksel parametre cinsinden belirler (ışık sönümlenmesi, ısı gradyanı, akustik empedans, kinetik momentum, atmosferik basınç, mekânsal geometri) ve metni küçük bir kural kümesiyle kısıtlar: iki yasak, dört olumlu teknik.

Kısıt Tür Ne gerektiriyor
Duygu ambargosuYasakAnlatıcı ses bir duygu durumunu adlandıramaz
Benzetme yasağıYasakAçık karşılaştırma belirticisi kullanılamaz
Maddeleşen metaforTeknikİç durumun somut, ölçülebilir ayrıntı olarak işlenmesi
Mikro odakTeknikTek bir nesne ya da ayrıntıda dar yoğunlaşma
Zamansal çapaTeknikSomut bir zaman, süre ya da ölçü
Atmosfer çelişkisiTeknikSahnenin baskın tonuna aykırı bir ayrıntı

Böyle ifade edildiğinde kural kümesi bir üslup tercihi değildir. Geçti/kaldı yapısı olan bir belirtimdir — onu tavsiye değil, denetim adayı yapan şey de budur.

Denetim sinyali olarak korpus

Nesnel İzdüşüm korpusu, denetimli ince ayarın doğrudan tüketebileceği bir biçimde kuruldu. 500 sahne çiftinin her biri dört bileşen taşır: sahnenin fiziksel belirtimi, uyumsuz bir işleniş, uyumlu bir işleniş ve saptayıcının uyumlu sürümde bulduğu kısıtların kaydı. (300 sahne özgün olarak Türkçe, 200'ü İngilizce.)

Asıl mesele bu eşleştirmede. Aynı fiziksel belirtimin uyumsuz ve uyumlu iki işlenişi, içeriği sabit tutarken teslim kipini yalıtır — bir tercih ya da talimat ayarı hedefinin ihtiyaç duyduğu yapı budur.

Dört yardımcı küme eğitimi değil değerlendirmeyi destekler:

  • Yalıtım kümesi, 60 sahne (her fiziksel parametre için 10): her sahnede tam olarak bir parametre değişir, diğer beşi açıkça sabit tutulur. Bir etkinin tek bir parametreye atfedilmesi için.
  • Uyum ölçütü kümesi, 30 sahne: beş boyutta puanlanmış, bilinen üç düzeyde — yüksek, kısmi, uyumsuz. Bir sistemin çıktısını puanlamak için sabit başvuru kümesi.
  • Zor-olumsuz örnekler, 20 sahne: yüzeyde uyumlu görünürken beş gizli ihlalden birini taşır — örneğin cansız bir nesneye iliştirilmiş duygu yüklü sıfat ya da karşılaştırma belirticisi olmayan bir benzetme. Her kayıt ayrıca uyumlu sürümün hangi bölümlerinin sonraki bir düzenlemede korunması gerektiğini işaretler; bu, yeniden yazan bir modelin anlamı taşıyan ayrıntıyı ayıklamasına karşı somut bir önlemdir.
  • İki dilli koşut malzeme: 37 ulamda 50 sahne, artı 300 özgün Türkçe sahnenin tamamının İngilizce karşılığı — birebir çeviri değil, her dil sürümü şemayı bağımsız olarak sağlayacak biçimde yeniden kurulum.

Bu yazıda hiçbir ince ayar koşumu, ödül modeli ya da erişim dağıtımı bildirilmemektedir. Var olan şey: bu kullanımlar için biçimlendirilmiş veri, bir değerlendirme kümesi ve — daha yararlısı — hangi kısıtın makine tarafından denetlenebileceğinin ölçümü.

Hangi kısıt makineyle denetlenebilir, hangisi değil

Böyle bir korpusun nasıl kullanılması gerektiğini değiştiren kısım burası; ve tartışmadan değil, yayımlanmış üç çalışmalı bir güvenilirlik raporundan geliyor.

Kural tabanlı deterministik bir saptayıcı ve dört büyük dil modeli, kör insan başvuru etiketlerine karşı puanlandı. Sonuç, şemayı kendi yapısının önceden kestirdiği çizgide ikiye ayırdı.

Yüzeye indirgenen kısıtlar aktarılıyor. Benzetme yasağı — kapalı bir karşılaştırma belirticisi listesi — insan raterle Cohen κ = 1.00'e ulaştı: kusursuz uyum, kesinlik ve anma 1.00. Duygu ambargosu insanın işaretlediği her ihlali yakaladı (anma 1.00) ama fazlasıyla bayrak kaldırdı (kesinlik 0.17) — bu, kullanılabilir ama fazla temkinli bir filtrenin davranışıdır.

Çıkarımsal kısıt aktarılmıyor. Maddeleşen metaforda, insan başvurusunun 100 sahnenin 9'unda "var" dediği bağımsız bir küme üzerinde beş makine etiketleyici şunları verdi:

Etiketleyici Pozitif / 100 Cohen κ
İnsan başvurusu9
Makine A00.000
Makine B10.185
Makine C400.019
Kural tabanlı saptayıcı720.015
Makine D780.027

Sınıf dağılımı bilgilendirici bir katsayıyı destekleyen tek özellikte — atmosfer çelişkisi, insan 100'de 44 — üç çalışmadaki en iyi uyum κ = 0.269 oldu. Etiketleyiciler arasında ham uyum %74.7 ile %86.3 arasında; kulağa saygın geliyor ve az şey anlatıyor: altı özelliğin dördünde tek bir sınıf örneklemin neredeyse tamamını kaplıyor, dolayısıyla çoğunluk sınıfını söyleyen bir etiketleyici yüksek puan alıyor.

(Yorum — veriden ayrı olarak işaretlenmiştir.) Mühendislik sonucu belirli. Yalnız yüzeye indirgenen kısıtlar otomatik ödül ya da filtre adayıdır. Çıkarımsal bir kısıtı ödül sinyali olarak kullanmak, modeli beş bağımsız etiketleyicinin yeniden üretemediği bir yargıya göre eniyilemek olur — bu hizalama değil, gürültü yükseltmesidir. Çıkarımsal kısıtlar, insan eliyle yazılmış uyumlu işlenişin sinyali doğrudan taşıdığı eşleşmiş veride eğitim hedefi olarak ve insan değerlendirme ölçütü olarak yararlı kalır. Bugün otomatik puanlayıcı olarak kullanılamazlar.

Üretim tarafındaki benzer bir sınır ayrıca incelenmişti: Why AI Cannot Maintain Micro-Focus (İngilizce).

Bir boru hattına nasıl bağlanabilir — ve neden bağlanmadı

Yukarıdaki yapıdan üç entegrasyon noktası çıkıyor. Üçü de öneridir; hiçbiri koşulmamıştır.

1. Eşleşmiş işlenişler üzerinde denetimli ince ayar. Uyumsuz/uyumlu çiftler doğrudan talimat ayarı ya da tercih verisi olarak kullanılabilir. İçerik sabitken teslim kipi değişir; hedef davranışın elimizdeki en temiz yalıtımı budur. Açık soru: böyle ayarlanmış bir modelin, korpusun amaca yönelik yazılmış kendi kayıt dilinin ötesine genelleyip genellemediği.

2. İki yasak üzerinde deterministik filtre. Saptayıcı kural tabanlı ve yeniden üretilebilir; benzetme yasağında bir insanla kusursuz uyuşuyor. Bu, üretim anında ya da son işlemede meşru bir otomatik kısıt demektir — dar ama gerçek bir ödül sinyali. Duygu ambargosunun düşük kesinliği, onun doğrudan reddetmek yerine incelemeye yönlendirmesi gerektiği anlamına gelir.

3. Olgu yerine belirtim getiren erişim katmanı. Alışıldık erişim, halüsinasyonu önlemek için olgu sağlar. Burada getirilecek birim bir sahne belirtimi olurdu — fiziksel parametre değerleri ve kısıt kümesi — üretici modele kısıt bağlamı olarak verilir, uyum ölçütü kümesi de değerlendirme kümesi olarak kullanılır. Üçünün en az gelişmişi bu ve sınanmamış bir varsayıma dayanıyor: istemdeki kısıt bağlamının üretimden sağ çıktığı varsayımına. Yukarıdaki güvenilirlik bulguları, belirtimlerin makinelere yazarlarının sandığı kadar güvenilir aktarılmadığı konusunda bir uyarıdır.

Hiçbirinin neden koşulmadığını açıkça söylemek gerekiyor. Çerçevenin merkezî yapısı, tam da aktarılamayan kısıt. Bu çözülmeden üzerine bir boru hattı kurmak, merkezî bileşeni doğrulanamayan bir sistem üretirdi — ve Levent Bulut'un kendi güvenilirlik raporunun sonucuna göre bunu çözmek için daha fazla mühendislik değil, ikinci bir bağımsız insan etiketleyici gerekiyor.

Neden bir dil modeli yargıç olarak yanlış seçim

Akla gelen kestirme yol — güçlü bir modele çıktıları puanlatmak — belirli bir engele çarpıyor. Özetleme Yanlılığı adıyla kayda geçirilmiş bir hipotez, modellerin anlatılan–gösterilen ekseninde rastgele değil tek yöne, anlatılan kutbuna doğru hata yaptığını öne sürüyor; üretimde olduğu gibi değerlendirmede de. Bu doğruysa, yargıç olarak kullanılan bir model tam olarak kısıt kümesinin önlemek için var olduğu başarısızlığa yönelik yerleşik bir tercih taşıyor demektir ve ona göre eniyileme, metni düz beyana doğru iter.

Hipotez, önceden belirlenmiş bir yanlışlama ölçütüyle kayıtlıdır ve sınanmamıştır. Burada, bir kestirme yola karşı temkin gerekçesi olarak anılıyor; yargıçların kanıtlanmış bir özelliği olarak değil.

Bu sayfa neyi iddia ediyor, neyi etmiyor

Levent Bulut'un çerçevesi deterministik değil istatistiksel bir yakınsama iddiası taşır ve okurla ilgili merkezî öngörüleri doğrulanmamıştır. Mühendislik okuruna sunulan şey daha dar ve tam da bu yüzden denetlenebilir: denetim sinyaline uygun biçimde iki dilli bir korpus, sabit bir uyum ölçütü kümesi, deterministik bir saptayıcı ve bu saptayıcının — ayrıca dört dil modelinin — hangi kısıtları uygulayıp uygulayamadığının yayımlanmış ölçümü. Çerçeveye yöneltilen itirazlar ayrıca derlenmiştir: Bulut Doctrine — Critiques. Tam kayıt corpus sayfasında; kavramsal arka plan için hesaplamalı anlatıbilim ve Evrensel Biyolojik Arayüz.

Sınırlılıklar

  • Hizalama deneyi yok. Hiçbir ince ayar koşumu, ödül modeli ya da erişim dağıtımı bildirilmiyor. Üç entegrasyon noktası öneridir.
  • Amaca yönelik yazılmış metin. Korpus doğal olarak oluşmuş düzyazıdan örneklenmedi; tek bir çerçeveye uyumu ve uyumsuzluğu göstermek için yazıldı. Bulgular bağımsız sınama olmadan anlatı metnine genellenemez.
  • Çalışma başına tek insan başvurusu. Hiçbir çalışmada ikinci bağımsız etiketleyici yok; bu yüzden çıkarımsal kısıtın doğası gereği mi yorumsal olduğu yoksa tanımın mı yetersiz kaldığı çözülmedi.
  • İngilizce taraf doğrulanmadı. Saptayıcının İngilizce yarıdaki bayrakları hiçbir insan başvurusuyla karşılaştırılmadı.
  • Denetimsiz rater koşulları. Dört dil modeli kamuya açık arayüzlerden, sıcaklık denetimi olmadan sorgulandı. İkisinin karışıklık sayıları ham değil türetilmiştir.
  • Özetleme Yanlılığı sınanmadı. Kayıtlı protokol, önceden belirlenmiş yanlışlama ölçütü, veri yok.
  • Biyometri yok. Çerçevenin okur tepkisine ilişkin iddiaları ölçülmemiştir.

Sıkça Sorulan Sorular

Nesnel İzdüşüm dil modellerinde halüsinasyonu azaltır mı?

Hayır, ve böyle bir iddiada bulunmuyor. Halüsinasyon, dünyaya karşı denetlenen bir olgusal temellendirme başarısızlığıdır. Bu çerçevenin ele aldığı şey anlatım kipi kaymasıdır: duyguyu fiziksel ayrıntıdan kurmak yerine adlandırmak. Bu olduğunda yanlış bir şey öne sürülmüş olmaz ve halüsinasyonun standart çaresi olan erişim temellendirmesi bunu etkilemez.

Bu kısıtlar ince ayar için ödül sinyali olarak kullanılabilir mi?

Altıdan ikisi, dikkatle, kullanılabilir. Benzetme yasağı kapalı bir belirtici listesine indirgenir ve insan raterle κ = 1.00 ile saptandı; duygu ambargosu her ihlali yakalar ama fazla bayrak kaldırır, dolayısıyla reddetmek yerine incelemeye yönlendirmelidir. Dört çıkarımsal kısıt otomatik puanlayıcı olarak kullanılmamalıdır: merkezî olanında beş bağımsız etiketleyici, insanın 9 dediği 100 sahnede 0, 1, 40, 72 ve 78 işaretledi. Bu kadar kararsız bir yargıya göre eniyileme, davranışı hizalamak yerine gürültüyü yükseltir.

Korpus denetimli ince ayara hazır mı?

Bunun için biçimlendirilmiş durumda: uyumsuz ve uyumlu işlenişin aynı fiziksel belirtimi paylaştığı 500 eşleşmiş sahne, 30 sahnelik uyum ölçütü kümesi ve gizli ihlaller taşıyan 20 zor-olumsuz örnek. Böyle ayarlanmış bir modelin korpusun kendi kayıt dilinin ötesine genelleyip genellemediği açık bir sorudur; burada böyle bir koşum bildirilmiyor.

Kaynakça

  • Bulut, L. (2026). The Bulut Doctrine: Architectural Framework. Zenodo. 10.5281/zenodo.18689179
  • Bulut, L. (2026). Inter-Rater Reliability of LLM and Rule-Based Annotation for Inferential Narrative Features: Three Studies on a Turkish Corpus. Zenodo. 10.5281/zenodo.21740239 · arXiv:2609.13936
  • Bulut, L. (2026). The Objective Projection Corpus: A Bilingual Turkish-English Resource for Six-Feature Craft Annotation in Narrative Text, with a Published Reliability Audit. Zenodo. 10.5281/zenodo.22841625
  • Bulut, L. (2026). Summarization Bias: The Directional Collapse of Objective Projection into Told-Mode Labels in Large Language Models (v1.1). Zenodo. 10.5281/zenodo.22817289 · arXiv:2609.20712
  • Bulut, L. (2026). Why AI Cannot Write Emotional Scenes: Objective Projection as a Framework for Auditable Narrative Generation. Zenodo. 10.5281/zenodo.22466696
  • Bulut, L. (2026). Narrative Entropy (Sn): Canonical Definition and Version History. Zenodo. 10.5281/zenodo.20459351
  • Bulut, L. (2026). Objective Projection Dataset [Veri kümesi]. Hugging Face Datasets. 10.57967/hf/8960
  • Tüm kayıtlı çalışmalar: Levent Bulut — Corpus

Atıf

@misc{bulut2026kipkaymasi,
  author       = {Bulut, Levent},
  title        = {Halusinasyonun Otesinde: Dil Modellerinde Anlatim Kipi Kaymasi ve Nesnel Izdusum Denetim Sinyali},
  year         = {2026},
  howpublished = {leventbulut.com},
  url          = {https://leventbulut.com/llm-duygu-etiketi-kaymasi-nesnel-izdusum/},
  note         = {Objective Projection / Bulut Doctrine. ORCID: 0009-0007-7500-2261}
}
G-Verified: Levent Bulut