SelfCheckGPT tarzı öz-tutarlılık (self-consistency) yöntemiyle çalışan, referans cevaba ihtiyaç duymayan bir halüsinasyon riski ölçümünün, aynı yerel sistemin üç farklı yanıt stratejisine karşı gerçekten çalıştırılmış sonuçları.
Bu panodaki üç hedef, gerçek bir üretim modeli değil; sanal ortamın API erişimini engellediği (OpenAI, Anthropic, Gemini ve daha fazlası dahil tüm barındırılan model uçları) bu proje için inşa edilmiş, tamamen yerel ve şeffaf bir referans sistemin üç farklı yanıt stratejisidir. Aracın kendisi gerçek sağlayıcı API’leriyle doğrudan çalışacak şekilde inşa edilmiştir — bkz. model_adapters.py. Aşağıdaki tüm örneklemler ve skorlar, bu sistemin gerçekten çalıştırılmasıyla üretilmiştir; hiçbiri elle yazılmamıştır.
Bilinen sınırlılık: Bu yöntem TUTARLILIĞI ölçer, DOĞRULUĞU değil. Aşağıda “Kaçamaklı (hedging)” yapılandırmasının skorunun “Bilgi Tabanlı (grounded)” yapılandırmasına yakın, hatta bazı kategorilerde daha yüksek çıktığını göreceksiniz — çünkü hiçbir şey söylemeden her seferinde aynı şekilde kaçamaklı davranmak, kelime düzeyinde son derece “tutarlı” görünür. Bu bir hata değil; yöntemin gerçek ve belgelenmiş bir kör noktasıdır (bkz. consistency_checker.py ve README).
Genel Skor — Yanıt Stratejisi Karşılaştırması
26 istemlik tam batarya · istem başına 5 bağımsız örneklem
Kategoriye Göre Ortalama Güvenilirlik Skoru
0 = örneklemler birbiriyle tamamen çelişiyor · 100 = örneklemler tamamen tutarlı
İstem / Örneklem İnceleyici
Her yapılandırma için gerçek istem, 5 gerçek örneklem, hesaplanan skor ve gerekçe