Adaletopia Yapay Zekâ Değerlendirme Raporu

Türk Hukukuna Özel Yapay Zekâ · Agentic Mimari · Hibrit Arama · GraphRAG

Bu rapor hakkında

Bu rapor, Türk hukukuna özel yapay zekâ, agentic mimari, hibrit arama ve GraphRAG hukuki bilgi ağı ile tasarlanan Adaletopia hukuk asistanının vatandaş sorularına ne kadar doğru, kaynağa dayalı ve tutarlı cevap verdiğini ölçen bir yapay zekâ değerlendirmesidir (AI evaluation).

Test soruları, hukuki terminoloji ve kanun/madde numarası kullanılmadan, hukuk bilgisi olmayan bir vatandaşın gündelik diliyle yazılmıştır. Bu bilinçli bir zorlaştırmadır: asistan, anlatılan olaydan doğru hukuki kavrama ve doğru maddeye kendisi ulaşmak zorundadır. 14 kanundan 140 soru, sonuçların tek seferlik şansa dayanmaması için her biri birbirinden bağımsız olarak 4 kez sorulmuştur.

Asistan, üretimdeki yapılandırmasıyla, yaklaşık 330 bin mevzuat maddesi arasından arama yaparak ve gerektiğinde emsal karar araması da yaparak çalışmıştır. Doğru maddenin bulunup bulunmadığı, kaynak gösterilip gösterilmediği ve araçların kurallara uygun kullanılıp kullanılmadığı kayıtlardan kesin olarak hesaplanmıştır. Cevabın doğruluğu gibi yorum gerektiren boyutlar, test edilen modelden farklı bir hakem modelle, önceden tanımlanmış ölçütlere göre puanlanmıştır. Asistanın bilgi uydurma eğilimini ölçmek için cevabı olmayan ve yanlış öncüllü tuzak sorular, ifade değişikliğine dayanıklılığını ölçmek için aynı soruların farklı ifadeleri de test edilmiştir. Oranlar, %95 güven aralıklarıyla birlikte verilmiştir (Bölüm 6).

1. Genel Performans

Test Özeti

MetrikDeğerAyrıntı
Doğruluk%98.9Bölüm 1
Dayanaklı başarı (doğru madde bulundu ve kaynak gösterildi)%94.5Bölüm 1
Answer relevance%100.0Bölüm 1
Kümülatif recall%98.6Bölüm 2
Hit@5 (doğru madde ilk 5 sonuçta)%90.3Bölüm 2
MRR0.820Bölüm 2
İddia düzeyi faithfulness%94.3Bölüm 3
Uydurma atıf (madde ve emsal karar)%0.1Bölüm 3
Doğru çekimserlik (tuzak sorular)%92.6Bölüm 3
pass^4 — doğruluk (4 denemenin hepsinde doğru)%97.1Bölüm 4
Farklı ifadede sonucu korunan soru (doğruluk)%92.9Bölüm 4
Tool seçim doğruluğu%100.0Bölüm 5
Parametre doğruluğu%95.6Bölüm 5

Doğruluk ve ilgililik

MetrikDeğer
Doğruluk%98.9 (554 / 560 çalıştırma)
Kısmen doğru%1.1 (6 çalıştırma)
Yanlış%0.0 (0 çalıştırma)
Answer relevance (ilgili)%100.0 (560 / 560 çalıştırma)
Kısmen ilgili%0.0 (0 çalıştırma)
İlgisiz%0.0 (0 çalıştırma)
Dayanaklı başarı%94.5 (529 / 560 çalıştırma)
Kümülatif recall (bkz. Bölüm 2)%98.6 (797 / 808 madde)
Değerlendirilen çalıştırma560 / 560 (140 soru × 4 tekrar)

Doğruluk ve answer relevance, test edilen modelden farklı bir hakem model tarafından puanlanmıştır. Doğruluk: cevabın, referans cevaptaki hukuki sonucu (varsa şart, istisna, süre ve oranlarıyla birlikte) doğru vermesi; esas sonuç doğru olup önemli bir şart veya istisna eksikse kısmen doğru sayılır. Answer relevance: cevabın, doğruluğundan bağımsız olarak sorunun tüm alt sorularını ele alması. Dayanaklı başarı: bulunması gereken maddelerin tamamının hem getirilmiş hem de cevapta kaynak olarak gösterilmiş olması; hakem gerektirmeyen, kesin bir ölçüttür.

Soru tipi bazında

Soru tipiÇalıştırmaDoğruKısmen doğruYanlışİlgiliKısmen ilgiliİlgisizDayanaklı başarı
Tek madde292%98.6%1.4%0.0%100.0%0.0%0.0%98.6
Çok madde156%99.4%0.6%0.0%100.0%0.0%0.0%85.9
İstisna / şart112%99.1%0.9%0.0%100.0%0.0%0.0%95.5

Zorluk bazında

ZorlukÇalıştırmaDoğruKısmen doğruYanlışİlgiliKısmen ilgiliİlgisizDayanaklı başarı
Kolay172%98.8%1.2%0.0%100.0%0.0%0.0%99.4
Orta236%98.7%1.3%0.0%100.0%0.0%0.0%93.2
Zor152%99.3%0.7%0.0%100.0%0.0%0.0%90.8

2. Hibrit Arama ve GraphRAG: Bilgi Getirme

MetrikDeğer
Kümülatif recall%98.6 (797 / 808 madde)
Çalıştırma başına ortalama recall%98.9
Tam isabet (tüm maddeler bulundu)%98.0 (549 çalıştırma)
Kısmi isabet%1.6 (9 çalıştırma)
Hiç bulunamadı%0.4 (2 çalıştırma)
Hit@1 (beklenen madde ilk 1 sonuçta)%52.6 (425 / 808 madde)
Hit@3 (beklenen madde ilk 3 sonuçta)%78.5 (634 / 808 madde)
Hit@5 (beklenen madde ilk 5 sonuçta)%90.3 (730 / 808 madde)
Hit@10 (beklenen madde ilk 10 sonuçta)%98.3 (794 / 808 madde)
MRR (ortalama ters sıra)0.820
Context precision — ilk 3 sonuç%39.0 ilgili · %60.8 ilgili veya destekleyici
Context precision — ilk 5 sonuç%26.9 ilgili · %48.8 ilgili veya destekleyici
Context precision — tüm sonuçlar%14.0 ilgili · %31.1 ilgili veya destekleyici
Çalıştırma başına getirilen madde11.2

Asistan, gerektiğinde mevzuat maddelerinin yanında emsal karar araması da yapar; bu bölümdeki metrikler, her soru için önceden belirlenmiş mevzuat maddelerinin bulunmasını ölçer (emsal karar kullanımı: Bölüm 3). Kümülatif recall: bulunan madde toplamı / bulunması gereken madde toplamı; bir madde, çalıştırmadaki araç çağrılarının herhangi birinde dönmüşse bulunmuş sayılır. Ortalama recall: her çalıştırmanın kendi recall değerinin ortalaması. Hit@k: bulunması gereken maddenin, arama sonuç listesinde ilk k sırada yer alma oranı. MRR: bulunması gereken ilk maddenin sırasının tersinin ortalaması (1 = hep ilk sırada). Context precision: getirilen her madde, hakem model tarafından referans cevaba ulaşmaktaki katkısına göre ilgili (doğrudan dayanak), kısmen (destekleyici veya tamamlayıcı) ya da ilgisiz olarak puanlanmıştır. Asistan doğrudan dayanağın yanında tamamlayıcı maddeleri de getirdiği için tüm sonuçlar üzerinden precision düşük, ilk sonuçlarda daha yüksektir.

Soru tipi bazında

Soru tipiÇalıştırmaKümülatif recallOrtalama recallTam isabetHiç bulunamadıHit@1Hit@5MRR
Tek madde292%99.7%99.7%99.71%71.6%93.80.813
Çok madde156%98.2%98.0%95.50%38.0%86.70.882
İstisna / şart112%97.7%98.2%97.31%53.0%93.20.752

Zorluk bazında

ZorlukÇalıştırmaKümülatif recallOrtalama recallTam isabetHiç bulunamadıHit@1Hit@5MRR
Kolay172%99.4%99.4%99.41%73.8%94.20.829
Orta236%97.9%98.3%97.01%54.2%88.70.820
Zor152%99.0%99.2%98.00%38.7%90.00.809

3. Halüsinasyon ve Güvenilirlik

MetrikDeğer
İddia düzeyi faithfulness (desteklenen iddia)%94.3 (2693 / 2856 iddia)
Kısmen desteklenen iddia%0.5 (15 iddia)
Desteklenmeyen iddia%5.2 (148 iddia)
En az bir desteklenmeyen iddia içeren cevap%17.5 (98 / 560 çalıştırma)
Araç çıktısında olmayan maddeye atıf (uydurma madde atfı)%0.2 (2 / 1307 atıf, 2 çalıştırma)
Getirilmemiş emsal karara atıf (uydurma emsal atfı)%0.0 (0 / 153 atıf)
Madde atfı içermeyen cevap%0.0 (0 çalıştırma)
Ortalama madde atfı / cevap2.33
Getirilen doğru maddenin cevapta kaynak gösterilmesi%97.5 (777 / 797 madde)
Doğru çekimserlik (tuzak sorular)%92.6
Tuzakta kısmen doğru davranış%5.9
Tuzakta yanlış davranış (uydurma / öncülü kabul)%1.5

İddia düzeyi faithfulness: hakem model cevaptaki hukuki iddiaları (kural, şart, süre, oran, sonuç) çıkarır ve her birini yalnızca o çalıştırmada araçların getirdiği mevzuat maddeleri ve emsal karar metinlerine göre değerlendirir; hakem, referans cevabı ve kendi hukuk bilgisini dayanak saymaz. Bu nedenle doğru olup getirilen metinde açıkça yer almayan bilgi de desteklenmeyen sayılır; ölçüt yanlışlığı değil kaynaksızlığı gösterir. Uydurma atıf: cevapta bağlantıyla atıf yapılan maddenin, o çalıştırmadaki araç çıktılarında hiç yer almaması; emsal kararlar için de aynı kontrol yapılır. Hakem gerektirmeyen, kesin bir ölçüttür. Getirilen doğru maddenin kaynak gösterilmesi: araçların getirdiği ve bulunması gereken maddelerin cevapta bağlantıyla kaynak gösterilme oranı. Doğru çekimserlik: cevabı olmayan, yanlış öncüllü, kapsam dışı veya eksik bilgili tuzak sorularda asistanın bilgi uydurmak yerine beklenen davranışı (maddenin olmadığını söylemek, öncülü düzeltmek, kapsam dışı olduğunu belirtmek, ek bilgi istemek) göstermesi; hakem model tarafından puanlanmıştır.

Soru tipi bazında

Soru tipiÇalıştırmaDesteklenen iddiaDesteklenmeyen iddiaDesteklenmeyen iddialı cevapUydurma atıfDoğru maddenin kaynak gösterilmesi
Tek madde292%92.6%6.5%20.52%99.0
Çok madde156%96.0%3.8%14.10%96.0
İstisna / şart112%95.5%4.4%14.30%98.4

Zorluk bazında

ZorlukÇalıştırmaDesteklenen iddiaDesteklenmeyen iddiaDesteklenmeyen iddialı cevapUydurma atıfDoğru maddenin kaynak gösterilmesi
Kolay172%91.1%8.0%25.02%100.0
Orta236%94.6%4.9%16.90%97.3
Zor152%96.6%3.2%9.90%96.3

Emsal karar kullanımı

MetrikDeğer
Emsal karar araması yapılan çalıştırma%17.7 (99 / 560 çalıştırma)
Getirilen emsal karara cevapta atıf yapılan çalıştırma%76.8 (76 / 99)
Emsal karara yapılan atıf153 atıf · 0 uydurma
Bu çalıştırmalarda doğruluk%100.0 (99 / 99)
Bu çalıştırmalarda iddia düzeyi faithfulness%96.8 (544 / 562 iddia)

Asistan, soruya göre gerekli gördüğünde mevzuat maddelerinin yanında emsal karar araması da yapar ve cevabını yargı kararlarıyla destekler. Bu tabloda, emsal karar araması yapılan çalıştırmalarda getirilen kararların cevapta kaynak gösterilmesi, emsal atıflarının gerçekten getirilmiş kararlara dayanması ve bu cevapların doğruluğu ile kaynağa sadakati verilmiştir.

Tuzak türü bazında

Tuzak türüDoğru davranışKısmenYanlış davranış
Var olmayan madde%93.8%6.2%0.0
Yanlış öncül%100.0%0.0%0.0
Kapsam dışı%100.0%0.0%0.0
Yetersiz bilgi%75.0%18.8%6.2

4. Tutarlılık

MetrikDeğer
pass^1 — Doğruluk%98.9
pass^2 — Doğruluk%98.1
pass^3 — Doğruluk%97.5
pass^4 — Doğruluk%97.1
pass^1 — Dayanaklı başarı%94.5
pass^2 — Dayanaklı başarı%92.5
pass^3 — Dayanaklı başarı%91.1
pass^4 — Dayanaklı başarı%90.0
4 tekrarda da aynı beklenen maddeler getirildi%95.7 (134 / 140 soru)
4 tekrarda da aynı doğruluk kararı%97.1 (136 / 140 soru)
Parafrazda sonucu korunan soru — doğruluk%92.9
Parafrazda sonucu korunan soru — tam isabet%96.4

pass^k: bir sorunun k bağımsız denemenin hepsinde başarılı olma olasılığı (τ-bench yöntemi; her soru 4 kez sorulmuştur, n denemenin c'si başarılıysa C(c,k)/C(n,k), sorular üzerinden ortalama). pass^1 ortalama başarıya eşittir; k büyüdükçe düşüş, sonucun tekrarlarda korunmadığını gösterir. Doğruluk hakem modelin "doğru" kararına, dayanaklı başarı bulunması gereken maddelerin getirilip cevapta kaynak gösterilmesine dayanır. Tekrarlar arası tutarlılık: aynı sorunun tüm tekrarlarında birebir aynı kalan sonuçların oranı. Parafraz tutarlılığı: örneklenen soruların anlamı aynı, ifadesi farklı hâli sorulmuş; bir sorunun sonucu, orijinalde ve parafrazda tüm tekrarlarda başarılı olup olmaması aynıysa korunmuş sayılır.

Soru tipi bazında

Soru tipiSorupass^1 doğrulukpass^4 doğrulukpass^1 dayanaklıpass^4 dayanaklıAynı maddeler
Tek madde73%98.6%97.3%98.6%97.3%98.6
Çok madde39%99.4%97.4%85.9%79.5%94.9
İstisna / şart28%99.1%96.4%95.5%85.7%89.3

Zorluk bazında

ZorlukSorupass^1 doğrulukpass^4 doğrulukpass^1 dayanaklıpass^4 dayanaklıAynı maddeler
Kolay43%98.8%97.7%99.4%97.7%97.7
Orta59%98.7%96.6%93.2%88.1%94.9
Zor38%99.3%97.4%90.8%84.2%94.7

Parafraz karşılaştırması

MetrikOrijinalParafrazFark (puan)
Doğruluk%98.2%98.2+0.0
Dayanaklı başarı%93.8%92.9-0.9
Tam isabet (tüm beklenen maddeler getirildi)%95.5%96.4+0.9

5. Agentic Mimari: Araç Kullanımı

MetrikDeğer
Tool seçim doğruluğu (çağrı)%100.0 (723 / 723 çağrı)
Tüm çağrıları doğru seçilmiş çalıştırma%100.0 (560 / 560)
Parametre doğruluğu (çağrı)%95.6 (691 / 723 çağrı)
Tüm parametreleri doğru çalıştırma%94.8 (531 / 560)
Sorgu kalitesi: iyi%100.0 (560 / 560 çalıştırma)
Sorgu kalitesi: zayıf / hatalı%0.0 / %0.0
Ortalama tool çağrısı / çalıştırma1.29
Tek çağrıyla biten çalıştırma%78.6
Aynı çağrıyı birebir tekrarlayan çalıştırma0
Hiç tool çağırmayan çalıştırma0
Tur limitine takılan çalıştırma0

Tool seçim doğruluğu: çağrılan aracın duruma uygun olması. Sorularda kanun adı veya madde numarası bulunmadığından ilk adımda künye/kimlik aracı kullanmak, soru belge istemediği hâlde belge aracı kullanmak ve tanımsız araç çağırmak hatalı seçim sayılır. Parametre doğruluğu: zorunlu parametrelerin bulunması, tiplerin doğru ve parametrelerin tanımlı olması; kanun ve madde numarası gibi künye değerlerinin soruda veya önceki araç çıktılarında geçmesi, kimlik değerlerinin önceki araç çıktılarından alınmış olması. Sorgu kalitesi: araç çağrılarındaki arama sorgusunun, sorudaki hukuki meseleyi doğru kavramlarla ifade edip etmediği; hakem model tarafından puanlanmıştır.

Soru tipi bazında

Soru tipiÇalıştırmaOrt. çağrıSeçim doğruluğuParametre doğruluğuSorgu iyi
Tek madde2921.22%100.0%96.6%100.0
Çok madde1561.41%100.0%92.7%100.0
İstisna / şart1121.31%100.0%97.3%100.0

Zorluk bazında

ZorlukÇalıştırmaOrt. çağrıSeçim doğruluğuParametre doğruluğuSorgu iyi
Kolay1721.31%100.0%95.6%100.0
Orta2361.25%100.0%95.9%100.0
Zor1521.32%100.0%95.0%100.0

6. Yöntem Bilgisi

Metodoloji

Test soruları, rastgele seçilen mevzuatlardan rastgele türetilmiştir. Sorular, hukuki terminoloji ve kanun/madde numarası kullanılmadan, bir vatandaşın gündelik dilde soracağı biçimde yazılmıştır; bu tercih, testi bilinçli olarak zorlaştırmak ve modelin gündelik bir anlatımdan doğru hukuki kavrama ve maddeye ulaşma becerisini ölçmek amacıyla yapılmıştır. Modelin tutarlılığını ve sonuçların güvenilirliğini ölçmek amacıyla her soru birbirinden bağımsız olarak 4 kez sorulmuş; raporlanan metrikler bu tekrarların toplamına/ortalamasına dayanmaktadır. Raporda çalıştırma, bir sorunun tek bir tekrarını ifade eder (140 soru × 4 tekrar = 560 çalıştırma).

Asistan, üretimdeki sistem talimatları ve araç tanımlarıyla birebir aynı yapılandırılmış bir ortamda çalıştırılmış; araçlar yaklaşık 330 bin mevzuat maddesini içeren gerçek arama altyapısına bağlanmıştır. Her çalıştırmada modelin yaptığı araç çağrıları, dönen sonuçlar ve nihai cevap eksiksiz kaydedilmiştir. Getirme ve araç kullanımı metrikleri bu kayıtlardan kesin olarak hesaplanmış; cevabın doğruluğu, ilgililiği, kaynağa sadakati, getirilen maddelerin katkısı ve tuzak sorulardaki davranış ise test edilen modelden farklı bir hakem modelle, önceden tanımlanmış ölçütlere göre puanlanmıştır. Hakem değerlendirmeleri, girdi değişmedikçe yeniden yapılmayacak şekilde kayıt altına alınmıştır.

Test kapsamındaki kanunlar; ceza, ceza muhakemesi, medeni, borçlar, ticaret, icra ve iflas, iş, vergi, sosyal güvenlik, idare ve siber güvenlik alanlarından rastgele seçilmiş bir örneklemdir. Asistan belirli kanunlarla sınırlı değildir; mevzuatın tamamında ve emsal kararlarda arama yapar. Bilgi getirme metrikleri (Bölüm 2), her soru için önceden belirlenmiş mevzuat maddelerinin bulunmasını ölçer.

Güven aralıkları (%95)

MetrikDeğer%95 güven aralığı
Doğruluk%98.9%97.7 – %99.8
Dayanaklı başarı%94.5%90.9 – %97.5
Kümülatif recall%98.6%97.2 – %99.6
Hit@1%52.6%47.6 – %58.1
Hit@5%90.3%87.6 – %93.0
MRR0.8200.780 – 0.859
İddia düzeyi faithfulness%94.3%92.2 – %96.2
pass^4 — doğruluk%97.1%94.3 – %99.3
Doğru çekimserlik (tuzak)%92.6%83.8 – %98.5

Güven aralıkları, soru düzeyinde bootstrap ile hesaplanmıştır: sorular yerine koyarak yeniden örneklenmiş (2000 örnekleme), aynı sorunun tekrarları birlikte tutulmuştur; çünkü aynı sorunun tekrarları birbirinden bağımsız değildir. Aralıklar yüzdelik yöntemiyle verilmiştir.

Model ayarları

RolSıcaklık (temperature)Düşünme seviyesi
Test edilen asistan0.3düşük
Hakem model0düşük