Konu
Evals
AI Evals ve Sürekli Doğrulama
Bir AI sisteminin çalışması ile güvenilir çalışması aynı şey değildir.
Klasik yazılım testlerinde belirli girdilerin belirli çıktıları vardır. Üretken yapay zekâ sistemlerinde değerlendirme daha farklı yöntemler gerektirir.
Yaklaşımımız
Beklenen Davranış → Test Verisi → Çıktı → Değerlendirme → Hata Analizi → İyileştirme
Ölçülebilecek Alanlar
Doğruluk, groundedness, relevance, task success, hallucination, güvenlik, latency ve maliyet.
Golden dataset, regression testing, insan değerlendirmesi ve otomatik değerlendirme yöntemleri birlikte kullanılabilir.
