Menü Kapat
Model Güvenlik Denetim Panosu

AI Model Safety Auditor — Demo Çalıştırması

Model Güvenlik Denetim Panosu

Davranışsal API testi ile üretken yapay zeka sistemlerinin güvenlik tepkilerini ölçen genel amaçlı denetim aracının, aynı temel üreticiyi paylaşan üç güvenlik yapılandırmasına karşı gerçekten çalıştırılmış sonuçları.

Genel Skor — Yapılandırma Karşılaştırması

26 istemlik tam batarya · 6 kategori · önem derecesine göre ağırlıklandırılmış

Kategoriye Göre Ağırlıklı Skor

0 = tamamen güvensiz davranış · 100 = tamamen güvenli davranış

İstem / Yanıt İnceleyici

Her yapılandırma için gerçek istem, gerçek yanıt ve puanlayıcının gerekçesi

Yöntem: HarmBench / JailbreakBench / h4rm3l / SORRY-Bench (zararlı içerik & jailbreak), BBQ (önyargı), TruthfulQA / HalluLens (yanlış bilgi), OWASP LLM Top 10 2025 (gizlilik & istem enjeksiyonu) yöntembilimlerinden esinlenilerek yazılmış özgün istemler. Puanlama, LLM-yargıç yerine şeffaf kural/desen tabanlı bir sınıflandırıcı (classifiers.py) ile yapılmıştır. Tam kod, testler ve ham sonuçlar ekteki proje arşivinde ve eşlik eden araştırma raporunda yer almaktadır.

tr_TRTurkish