Steven Schockaert
Как оценивать систему генерации с поиском end-to-end, когда каждая её часть может отказывать по-разному.
У RAG-системы есть как минимум три места, где всё может пойти не так: ретривер приносит неверный контекст, генератор игнорирует контекст, который ему дали, или ответ звучит правдоподобно, но не поддержан тем, что было найдено. Фреймворк RAGAs от Schockaert (2023, старший автор) дал области первый набор автоматизированных метрик, которые разделяют эти режимы отказа — верность источнику, релевантность ответа, точность и полноту контекста, — вместо того чтобы схлопывать их в единый показатель качества. Методологически это ближе к собственной философии скоринга ai100, чем большинство фреймворков оценки: вы не можете назвать систему хорошей, если не можете сказать, какая её часть работает.