У RAG-системы есть как минимум три места, где всё может пойти не так: ретривер приносит неверный контекст, генератор игнорирует контекст, который ему дали, или ответ звучит правдоподобно, но не поддержан тем, что было найдено. Фреймворк RAGAs от Schockaert (2023, старший автор) дал области первый набор автоматизированных метрик, которые разделяют эти режимы отказа — верность источнику, релевантность ответа, точность и полноту контекста, — вместо того чтобы схлопывать их в единый показатель качества. Методологически это ближе к собственной философии скоринга ai100, чем большинство фреймворков оценки: вы не можете назвать систему хорошей, если не можете сказать, какая её часть работает.

Стоит читать, когда
вам нужно оценивать RAG-пайплайн и атрибутировать отказ поиску, генерации или интеграции между ними.
Темы
автоматизированные метрики оценки RAG; разделение отказов на стороне поиска и генерации; дизайн метрик для многостадийных пайплайнов.
Ключевые работы
RAGAs: Automated Evaluation of Retrieval Augmented Generation (2023, старший автор); продолжающаяся работа Cardiff NLP по RAG и knowledge-augmented LLMs.