EN ▸ How to evaluate LLMs before production
LLM'leri Üretim Öncesi Değerlendirme Yöntemleri
GitHub Blog ·

Bir dil modeli, temiz bir benchmarkta iyi performans gösterebilir ancak üretim aşamasında önemli durumlarla başa çıkmakta zorlanabilir. Gerçek girdiler genellikle belirsizdir ve etiketler tutarsız olabilir. GitHub'un gizli tarama sistemi için LLM tabanlı bir sistem değerlendirirken, yanlış pozitifleri azaltmak ve güvenlik akışında yeterli geri çağrım sağlamak amacıyla çeşitli stratejiler benimsendi. Bu yazıda, prototip sonuçlarından üretime geçişteki en iyi uygulamalar ve öğrenilen dersler paylaşılmaktadır. Takımlar, her değişiklikte offline değerlendirmeyi tekrarlamalı ve üretimle benzerlik göstermelidir. Ayrıca, üretim etiketleri güvenilir bir gerçeklik yerine sinyal olarak değerlendirilmeli ve kaplama boşluklarını doldurmak için sentetik ve açık veri setleri kullanılmalıdır.
