La littérature sur l'évaluation des LLM a crû plus vite que la méthodologie nécessaire pour rendre ces articles comparables — prompts différents, notation (scoring) différente, définitions différentes de la « réussite » : tout cela a produit des affirmations contradictoires sur les mêmes modèles. Wang a dirigé la synthèse la plus citée de ce paysage (le "Survey on Evaluation of LLMs" de 2023, avec des collaborateurs) et construit PromptBench, un cadre ouvert pour tester sous contrainte la robustesse des modèles à travers des variations de prompt — la partie du domaine où se loge l'écart entre « le modèle fonctionne » et « le modèle fonctionne sur les mots exacts que nous avons testés ».

À lire lorsque
vous voulez concevoir une évaluation de LLM à partir de zéro et savoir quelles conventions existent déjà avant de les réinventer.
Thèmes
synthèse systématique de la recherche sur l'évaluation des LLM; robustesse aux prompts et prompts adversariaux; écart entre scores de benchmark et comportement en déploiement.
Travaux clés
"A Survey on Evaluation of LLMs" (2023, auteur principal); cadre PromptBench (2023).