Jindong Wang
Standardiser ce que « évaluer un LLM » veut même dire comme procédure de recherche.
La littérature sur l'évaluation des LLM a crû plus vite que la méthodologie nécessaire pour rendre ces articles comparables — prompts différents, notation (scoring) différente, définitions différentes de la « réussite » : tout cela a produit des affirmations contradictoires sur les mêmes modèles. Wang a dirigé la synthèse la plus citée de ce paysage (le "Survey on Evaluation of LLMs" de 2023, avec des collaborateurs) et construit PromptBench, un cadre ouvert pour tester sous contrainte la robustesse des modèles à travers des variations de prompt — la partie du domaine où se loge l'écart entre « le modèle fonctionne » et « le modèle fonctionne sur les mots exacts que nous avons testés ».