← Назад к списку
Jindong Wang
Что вообще означает «оценивать LLM» как исследовательскую процедуру — и как это стандартизировать.
Литература по оценке LLM росла быстрее, чем методология, позволяющая делать эти статьи сопоставимыми: разные prompt-формулировки, разный скоринг, разные определения «успеха» давали противоречивые утверждения об одних и тех же моделях. Wang возглавил самую цитируемую синтезирующую работу этого ландшафта — "A Survey on Evaluation of LLMs" 2023 года, написанную с соавторами, — и построил PromptBench, открытый фреймворк для стресс-тестирования устойчивости моделей к вариациям prompt. Именно в этой части области живёт разрыв между «модель работает» и «модель работает на тех точных словах, которые мы протестировали».