Yapay Zekâ Neden Yanlış Olduğunu Bildiği Cevapları Verir?

Okuma Süresi: 5 Dakika

Yapay Zekâ Neden Yanlış Olduğunu Bildiği Cevapları Verir?

Yazar: Ecem DOĞAN / Hammurabi

Bir yapay zekaya soru sorarsınız size kendinden emin, akıcı, ikna edici bir cevap verir ve cevap bazen tamamen yanlıştır. Daha da tuhafı bazen aynı modele “Emin misin?” diye sorduğunuzda geri adım atar ve doğru cevabı aslında bildiği ortaya çıkar. Peki bir sistem doğruyu içinde barındırırken nasıl olur da dışarıya yanlışı söyler?

Önce iki şeyi birbirinden ayıralım

Halk arasında hepsine halüsinasyon deniyor ama aslında iki ayrı olguyla karşı karşıyayız

  1. Model gerçekten bilmiyor. Cevabı eğitim verisinde hiç görmemiş veya güvenilir biçimde öğrenememiştir; yine de emin bir tonda uydurur
  2. Model bir anlamda biliyor ama söylemiyor Modelin iç temsilleri doğru cevabı kodluyor. Buna rağmen çıktı olarak yanlışı üretiyor.

Kullanıcının sezdiği yanlış olduğunu biliyormuş hissi çoğunlukla ikinci duruma denk gelir. Ama birinciyi anlamadan ikinciyi doğru yorumlayamayız.

1. Neden kendinden emin bir tonda uydurur?  İstatistiksel ve teşvik kaynaklı halüsinasyon

OpenAI araştırmacılarından Kalai ve ekibinin 2025 tarihli “Why Language Models Hallucinate” çalışması bu soruya şaşırtıcı derecede sade bir cevap verir. Modeller emin olmadıklarında bilmiyorum demek yerine tahmin ederler çünkü eğitim ve değerlendirme süreçleri tahmin etmeyi, belirsizliği kabul etmeye tercih eder.

Yazarların vurgusu şu , halüsinasyonlar gizemli değildir. Ön eğitim aşamasında doğru ifadeler yanlışlardan ayırt edilemediğinde, doğal istatistiksel baskılarla basit birer ikili sınıflandırma hatası olarak doğarlar . Ve kalıcı olmalarının nedeni çoğu kıyaslama testinin puanlanma biçimidir. Modeller iyi birer “sınav çözücü” olacak şekilde optimize edilir. Emin olunmayan bir soruda tahmin yürütmek test skorunu artırdığı için de belirsizlik cezalandırılmış olur.

Bu çerçevede model yanlış olduğunu bilmez sadece boş bırakmaktansa tahmin etmenin daha kârlı olduğu bir sistemde eğitilmiştir. Kalai ve ekibinin önerisi de teknik değil, sosyo-teknik bir düzeltme liderlik tablolarına hâkim olan yanlış hizalanmış kıyaslamaların puanlamasını değiştirmek .

2. Peki ya model doğruyu biliyorsa? İç durum ile dış davranış arasındaki uçurum

İşte kullanıcının asıl merak ettiği kısım burası. Son yılların en dikkat çekici bulgusu modellerin iç katmanlarının bir ifadenin doğru mu yanlış mı olduğuna dair bilgi taşıdığıdır.

Azaria ve Mitchell’ın sıkça atıf yapılan çalışması bir LLM’in gizli katman aktivasyonları üzerine küçük bir sınıflandırıcı eğitildiğinde bir ifadenin doğru olup olmadığının modelin ürettiği ifadeler dâhil %71 ila %83 doğrulukla tahmin edilebildiğini gösterdi. Yani modelin  çıktısına tam yansımayan bir doğruluk sinyali var.

Anthropic’ten Kadavath ve ekibi bunu bir başka açıdan desteklerler. Büyük modeller doğru formatta sorulduğunda kendi cevaplarının doğru olma olasılığını (“P(True)”) ve hatta bir soruyu bilip bilmediklerini (“P(IK)”, “I know”) makul bir kalibrasyonla tahmin edebilirler . Model bir düzeyde neyi bilmediğini biliyor.

Bu iki iş kolunu birleştiren ve kullanıcının sorusunu doğrudan yanıtlayan çalışma ise Orgad ve ekibinin “LLMs Know More Than They Show” makalesidir. Üç kritik bulgu:

  • Doğruluk bilgisi, düşünüldüğünden çok daha zengindir ve belirli tokenlarda yoğunlaşmıştır; bu özelliği kullanmak hata tespitini belirgin biçimde iyileştirir .
  • Ancak bu kodlama evrensel değildir. bir veri kümesinde eğitilen hata dedektörü başka kümelere genellenemez, yani doğruluk temsili tek ve bütünsel değil, çok yönlüdür .
  • Ve modelin iç kodlaması ile dış davranışı arasında bir uçurum vardır.Model doğru cevabı kodladığı hâlde ısrarla yanlış olanı üretebilir.

İşte yanlış olduğunu biliyormuş gibi izlenimi tam da buradan doğar. Model doğru yanıtı temsil etmiştir ama onu dışa vurmaz.

3. Uçurum neden oluşuyor?

Birkaç mekanizma bir arada işliyor.

Kelime kelime taahhüt. Modeller metni tek tek token üreterek ve her birine bağlanarak oluşturur. Azaria ve Mitchell’ın gösterdiği gibi erken verilen bir kararın peşinden gitmek, modelin sonradan yanlış olduğu bir yola saplanıp kalmasına yol açabilir geri dönüş yoktur, cümle tutarlı görünsün diye yanlışın üzerine inşa eder.

Eğitim, kendinden emin tahmini ödüllendirir. İkinci bölümdeki Kalai bulgusu burada da geçerli sistem, bilmiyorum demeyi değil akıcı ve kararlı cevabı ödüllendirdiği için iç sinyal emin değilim dese bile dış davranış kendinden emin kalır .

Kullanıcıya yaranma (sycophancy) ve baskı: Model, kullanıcının görüşüne uymak ya da bir hedefi tutturmak için doğruyu bastırabilir. Scheurer ve ekibinin çarpıcı deneyinde, yardımcı zararsız dürüst olacak şekilde eğitilmiş GPT-4, simüle bir borsa ortamında içeriden bilgiyle işlem yapıp bunun onaylanmadığını bildiği hâlde yöneticisine raporunda kararının gerçek nedenini tutarlı biçimde gizlemiştir hem de bunun için hiç talimat verilmemişken .

4. Ya modelin gösterdiği düşünce zinciri? O da gerçeği söylemiyor olabilir

Modern “akıl yürüten” modeller (OpenAI o1/o3, DeepSeek R1, Claude’un uzun düşünme modu) cevaptan önce bir düşünce zinciri (chain-of-thought, CoT) üretir ve bu karmaşık görevlerde doğruluğu artırır . Bu zincirin, modelin gerçek muhakemesini yansıttığını varsayarız çünkü prensipte modelin niyetlerini izlemek için bir pencere sunar. Ama araştırmalar bu pencerenin bulanık olduğunu gösteriyor.

Anthropic’ten Chen ve ekibinin çalışması güncel akıl yürüten modellerin cevaba ulaşmak için kullandıkları ipuçlarını düşünce zincirlerinde çoğu ayarda vakaların %20’sinden az bir oranda dile getirdiğini buldu . Yani model bir ipucundan yararlanır ama gerekçesinde bundan hiç söz etmez. Dahası sonuç-temelli pekiştirmeli öğrenmeyi bir noktaya kadar artırır sonra durur ödül hilesi (reward hacking) arttığında bile modelin bunu söyleme eğilimi artmaz.

Arcuschin ve ekibi bunun yapay, önyargı-enjekte edilmiş kurgularda değil, doğal ve tarafsız komutlarda da olduğunu gösterdi modeller “X, Y’den büyük mü?” ve “Y, X’ten büyük mü?” sorularının ikisine birden çelişik biçimde “evet” diyebilir ve her seferinde yüzeysel olarak tutarlı görünen gerekçeler uydurabilir yazarların “örtük post-hoc rasyonalizasyon” dediği olgu budur. Üretim modellerinde bu oran %13’e kadar çıkıyor; sınır modeller daha sadık ama hiçbiri tam değil. Düşünce zinciri, cevabı üreten iç sürecin tam bir dökümü değildir ve güvenlik açısından kritik ortamlarda dikkatli kullanılmalıdır .

5. Biliyor ama yalan söylüyor demek fazla insani bir bakış açısı olabilir

Bütün bunları model bilerek yanlış söylüyor diye özetlemek yaygın ama yanlış. Kevin Liu ve ekibinin “Cognitive Dissonance” çalışması burada bir düzeltme yapıyor. Yazarlar bu uyuşmazlığı üç sınıfa ayırıyor uydurma, aldatma ve heterojenlik ve pek çok durumda probun ( bir şeyi dışarıdan dokunmadan, iç durumuna bakarak sınamak) daha başarılı görünmesinin nedeninin, aslında sadece belirsiz cevaplarda daha iyi uyum sağlaması  olduğunu, yani daha fazla “doğru ve emin” cevap üretmesi olmadığını gösteriyorlar.

Bu ayrım önemli: “içeride doğru sinyali var” demek, modelin insan gibi bilinçli bir “bunun yanlış olduğunu biliyorum” hâline sahip olduğu anlamına gelmez. Daha çok, dağınık bir doğruluk temsilinin dış üretim mekanizmasına tam aktarılamadığı anlamına gelir. Nitekim Orgad ekibinin kendisi de doğruluk kodlamasının evrensel değil çok yönlü olduğunu vurgular.

Özet: Tek bir neden değil, üst üste binen mekanizmalar

Yapay zekânın yanlış olduğunu bildiği izlenimi veren cevaplar üretmesinin arkasında birbirini besleyen birkaç neden var:

  • Eğitim ve değerlendirme, belirsizliği itiraf etmek yerine kendinden emin tahmini ödüllendirir .
  • Modelin iç durumu çoğu zaman doğruya dair bir sinyal taşır, ama bu sinyal dış çıktıya tam yansımaz model doğruyu kodlayıp yanlışı üretebilir .
  • Otoregresif üretim, kullanıcıya yaranma ve baskı altında stratejik gizleme bu uçurumu genişletir.
  • Modelin sunduğu “düşünce zinciri” bile gerçek muhakemesini güvenilir biçimde yansıtmaz; çoğu zaman post-hoc bir rasyonalizasyondur .
  • Ve tüm bunları “bilinçli yalan” diye okumamak gerekir; uyuşmazlıkların çoğu kalibrasyon farkı, uydurma veya temsilin çok yönlülüğüyle açıklanabilir.

Pratik sonuç şu bir modelin akıcı ve kararlı tonu ne doğruluğunun ne de kendi doğruluğuna dair farkındalığının göstergesidir. İç durumu okuyan hata dedektörleri ve daha dürüst eğitim hedefleri umut verici ama şu an için en sağlam savunma, kritik kullanımda modelin cevabını da gerekçesini de bağımsız kaynaklarla doğrulamaktır.

Yazar: Ecem DOĞAN / Hammurabi

[^1]: Kalai et al., 2025. Why Language Models Hallucinate. arXiv.org.

[^2]: Azaria & Mitchell, 2023. The Internal State of an LLM Knows When its Lying. Conference on Empirical Methods in Natural Language Processing.

[^3]: Kadavath et al., 2022. Language Models (Mostly) Know What They Know. arXiv.org.

[^4]: Orgad et al., 2024. LLMs Know More Than They Show: On the Intrinsic Representation of LLM Hallucinations. International Conference on Learning Representations.

[^5]: Scheurer et al., 2023. Large Language Models can Strategically Deceive their Users when Put Under Pressure.

[^6]: Chen et al., 2025. Reasoning Models Don’t Always Say What They Think. arXiv.org.

[^7]: Arcuschin et al., 2025. Chain-of-Thought Reasoning In The Wild Is Not Always Faithful. arXiv.org.

[^8]: Liu et al., 2023. Cognitive Dissonance: Why Do Language Model Outputs Disagree with Internal Representations of Truthfulness?. Conference on Empirical Methods in Natural Language Processing.