Литература по оценке LLM росла быстрее, чем методология, позволяющая делать эти статьи сопоставимыми: разные prompt-формулировки, разный скоринг, разные определения «успеха» давали противоречивые утверждения об одних и тех же моделях. Wang возглавил самую цитируемую синтезирующую работу этого ландшафта — "A Survey on Evaluation of LLMs" 2023 года, написанную с соавторами, — и построил PromptBench, открытый фреймворк для стресс-тестирования устойчивости моделей к вариациям prompt. Именно в этой части области живёт разрыв между «модель работает» и «модель работает на тех точных словах, которые мы протестировали».

Стоит читать, когда
вы хотите спроектировать оценку LLM с нуля и сначала понять, какие конвенции уже существуют, прежде чем изобретать их заново.
Темы
систематический синтез исследований по оценке LLM; устойчивость к вариациям prompt и состязательным prompt-формулировкам; разрыв между benchmark-баллами и поведением после развёртывания.
Ключевые работы
"A Survey on Evaluation of LLMs" (2023, ведущий автор); фреймворк PromptBench (2023).