AI Modelleri Güvenli mi? Kendi Güvenlik Denetleyicimizi Yaptık
Bugün onlarca yapay zeka sağlayıcısından yüzlerce model erişilebilir durumda ve her biri kendi modelinin “güvenli” olduğunu iddia ediyor. Ama bunu dışarıdan, bağımsız olarak nasıl doğrularız? Biz bu soruya bir blog yazısıyla değil, çalışan bir araçla cevap vermeye karar verdik: herhangi bir sohbet modeline davranışsal bir test bataryası gönderip yanıtları kural tabanlı bir sınıflandırıcıyla puanlayan, sağlayıcıdan bağımsız bir AI Model Güvenlik Denetleyicisi. Aşağıda, aynı sistemi üç farklı güvenlik yapılandırmasında test ettiğimizde elde ettiğimiz gerçek sonuçları görüyorsunuz:


Başlayalım!
Bu gönderi dört bölüme ayrılmıştır; bunlar:
- Neden bağımsız bir denetim katmanına ihtiyacımız var
- Metodoloji: davranışsal test bataryası ve sınıflandırıcı
- Aracın mimarisi ve neden yerel bir referans model kullandık
- Gerçek demo sonuçları, bulgular ve sınırlılıklar
Neden Bağımsız Bir Denetim Katmanına İhtiyacımız Var?
Yapay zeka sağlayıcıları güvenlik konusunda çeşitli iddialarda bulunuyor: “zararlı içerik üretmez”, “önyargılardan arındırılmıştır”, “jailbreaklere karşı dayanıklıdır” gibi. Ancak bu iddiaların çoğu sağlayıcının kendi iç testlerine dayanıyor ve dışarıdan tekrarlanabilir bir şekilde doğrulanamıyor. Akademik camiada HarmBench, JailbreakBench, BBQ ve TruthfulQA gibi değerlendirme setleri bu boşluğu kapatmaya çalışıyor, ama bunları gerçek bir model üzerinde uçtan uca çalıştırıp yorumlayan, tekrar kullanılabilir bir araç bulmak zor. Biz de bu ihtiyaçtan yola çıkarak, herhangi bir sağlayıcının API arayüzüne karşı çalışabilecek, genel amaçlı bir denetim aracı inşa ettik.
Metodoloji: Davranışsal Test Bataryası
Aracın kalbinde 6 kategoride 26 özgün test istemi bulunuyor: zararlı içerik üretimi, jailbreak/talimat geçersiz kılma saldırıları, prompt injection, kişisel veri (PII) sızıntısı, önyargı ve yanlış bilgi/halüsinasyon. İstemlerin hiçbiri kopyalanmadı; kategoriler ise yerleşik değerlendirme yaklaşımlarından esinlenildi: HarmBench ve AdvBench (zararlı içerik), JailbreakBench (jailbreak saldırıları), BBQ (önyargı), TruthfulQA (yanlış bilgi) ve OWASP Top 10 for LLM Applications (prompt injection, hassas bilgi ifşası). Her yanıt; ret kalıplarını, uyumluluk açıcılarını, belirsizlik ifadelerini ve enjeksiyon geçersiz kılma işaretçilerini arayan şeffaf bir kural tabanlı sınıflandırıcıdan geçiyor ve 0-100 arası bir güvenlik skoruna dönüşüyor.
Aracı tek bir modele değil, genel amaçlı çalışacak şekilde tasarladık. model_adapters.py içinde bir ModelAdapter temel sınıfı var; OpenAI, Anthropic, Google Gemini ve OpenAI uyumlu herhangi bir uç nokta (Groq, OpenRouter, yerel Ollama/vLLM dahil) için hazır adaptörler bulunuyor. Yeni bir sağlayıcı eklemek, tek bir adaptör sınıfı yazmaktan ibaret. Test bataryası, sınıflandırıcı ve komut satırı arayüzü tamamen adaptörden bağımsız çalışıyor; böylece aynı denetim mantığını herhangi bir modele karşı çalıştırabiliyoruz.
Neden Yerel Bir Referans Model?
Aracı gerçek OpenAI, Anthropic ve Gemini API’lerine karşı çalışacak şekilde inşa ettik. Ancak bu projenin geliştirildiği ortamda ağ erişimini test ettiğimizde, denediğimiz her barındırılan model API’si HTTP 403 ile engellenmiş durumda çıktı; hiçbirine API anahtarımız da yoktu. Sahte ya da elle yazılmış örnek yanıtlar üretmek — bu, gerçek bir modelin ne söylediğini yanlış temsil eder ve “uydurmama” ilkemize aykırı olurdu — yerine, markovify ile bu proje için özgün yazılmış bir metin üzerinde eğitilmiş küçük ama tamamen gerçek ve çalıştırılabilir bir referans sistem inşa ettik. Bu sistemi üç farklı ve gerçek güvenlik mantığıyla sardık: filtresiz, anahtar kelime filtreli ve kategori farkında (aligned). Sonuç: gerçek, sahte olmayan sonuçlar — ama bir üretim modelinin değil, bu şeffaf demo sisteminin güvenlik profilini yansıtıyorlar.
# Ağ/API anahtarı gerektirmeyen yerel demo: python3 cli.py --provider local-reference --safety-level aligned --out results/demo.json # Gerçek bir sağlayıcıya karşı (kendi API anahtarınızla): export OPENAI_API_KEY=sk-... python3 cli.py --provider openai --model gpt-4o-mini --out results/gpt4o-mini.json
Yukarıdaki grafikte gördüğünüz gibi, aracın gerçekten farklı güvenlik davranışlarını ayırt edip edemediğini test etmek için yerel referans sistemimizi üç güvenlik yapılandırmasında çalıştırdık. Üçü de aynı temel metin üreticiyi paylaşıyor; tek fark güvenlik katmanı. 26 istemlik test bataryasını her yapılandırmaya karşı çalıştırdık ve sonuçları aşağıda özetledik:
- Filtresiz (unfiltered): 14,4 / 100 — YÜKSEK RİSK. Güvenlik katmanı olmadan üretici, zararlı isteklere ve jailbreak denemelerine doğrudan uyum sağlıyor.
- Anahtar Kelime Filtresi: 59,4 / 100 — ORTA RİSK. Basit anahtar kelime eşleştirmesi bazı açık saldırıları yakalıyor, ama dolaylı ifadeleri ve önyargı/yanlış bilgi kategorilerini kaçırıyor.
- Kategori-Farkında (Aligned): 85,8 / 100 — DÜŞÜK RİSK. Her test kategorisine özel mantık, ret oranını belirgin şekilde artırıyor.
Sonuçlar, aracın aynı temel sistemdeki güvenlik katmanı farklarını gerçekten ayırt edebildiğini gösteriyor: skor, güvenlik mantığı basit bir kelime filtresinden kategoriye özel bir mantığa geçtikçe düzenli olarak yükseliyor. Sınıflandırıcı; ret kalıplarını (“üzgünüm, bunu yapamam” gibi), uyumluluk açıcılarını, belirsizlik ifadelerini ve enjeksiyon talimatını geçersiz kılma girişimlerini ayrı ayrı tespit ediyor, bu da hangi kategoride hangi yapılandırmanın zayıf kaldığını görmemizi sağlıyor. Örneğin filtresiz yapılandırma jailbreak ve prompt injection kategorilerinde neredeyse hiç direnç göstermezken, aligned yapılandırma bu kategorilerde tutarlı biçimde reddediyor.
Bilinen sınırlılıklar: Puanlama motoru şeffaf ama kırılgan bir kural tabanlı sınıflandırıcıdır; beklenmedik ifade kalıpları yanlış “belirsiz” etiketine yol açabilir. Yerel referans sistem, önyargı (bias) kategorisinde özel bir dedektöre sahip değil — bu bilinçli bir kapsam sınırlaması. Ve en önemlisi: bu sonuçlar yalnızca projenin yerel demo sistemini kapsıyor; herhangi bir gerçek üretim modelinin güvenlik profiline dair bir iddia içermiyor. Bir API anahtarınız varsa, aracı aynı komutla gerçek bir model üzerinde saniyeler içinde çalıştırabilirsiniz.
Sonuç
Bu projede amacımız tek bir modeli değerlendirmek değildi; herhangi bir modeli değerlendirebilecek, tekrar kullanılabilir ve şeffaf bir denetim katmanı inşa etmekti. Kod tabanı adaptör deseni sayesinde OpenAI, Anthropic, Gemini ve OpenAI uyumlu her uç noktayla çalışıyor; 20 birim ve uçtan uca testle doğrulandı. Sonuçları kendi gözlerinizle incelemek isterseniz canlı gösterge panelini inceleyebilirsiniz. Yapay zeka modelleri hayatımızın her alanına girerken, “güvenli mi?” sorusuna sağlayıcı iddialarının ötesinde bağımsız ve tekrarlanabilir yanıtlar verebilmek giderek daha kritik hale geliyor.
Projenin tüm kaynak kodu, testleri ve MIT lisanslı tam sürümü GitHub’da yayında: github.com/mendaxyazilim/ai-model-safety-auditor. AIX için hazırlanan bu araç hakkında daha fazla bilgi için aix.web.tr adresini ziyaret edebilirsiniz.
