Yapay zekâ sonucunu “güzel cevap” ile ölçmeyin
Akıcı bir yanıtın doğru, kaynaklı ve işe yarar olduğunu ayrıca kontrol etmek gerekir.
Gerçek sorularla başlayın
Test sorularını sadece geliştirme ekibi yazmasın. Sistemi kullanacak kişilerden sık gelen soruları, eksik bilgili örnekleri ve zor durumları toplayın. Bu küçük değerlendirme kümesi, sürümler arasında aynı beklentiyi korur.
Beklentiyi açıklaştırın
Bir belge sorusunda kaynak doğruluğunu; sınıflandırmada doğru kategoriyi; işlem hazırlamada gerekli alanların tamamlanmasını kontrol edin. Her görevde başarı ölçüsü farklı olabilir. Bilgi yokken yanıt uydurmamak da başarının bir parçasıdır.
Değişiklikleri karşılaştırın
Model, talimat veya belge kaynağı değiştiğinde aynı örnekleri yeniden çalıştırın. İyi sonucu geliştirmek kadar, daha önce çalışan bir durumun bozulmadığını görmek de önemlidir. İnsan değerlendirmesiyle sistem kayıtlarını birlikte kullanın.
