La literatura sobre evaluación de LLM creció más rápido que la metodología necesaria para hacer comparables esos artículos: distintos prompts, distintas formas de puntuación y distintas definiciones de «éxito» produjeron afirmaciones contradictorias sobre los mismos modelos. Wang lideró la síntesis más citada de ese panorama (el "Survey on Evaluation of LLMs" de 2023, con colaboradores) y construyó PromptBench, un marco abierto para hacer pruebas de estrés de la robustez de los modelos ante variaciones de prompt: la parte del campo donde vive la brecha entre «el modelo funciona» y «el modelo funciona con las palabras exactas que probamos».

Vale la pena seguirlo cuando
se quiere diseñar desde cero una evaluación de LLM y saber qué convenciones ya existen antes de reinventarlas.
Temas
síntesis sistemática de la investigación sobre evaluación de LLM; robustez de prompt y prompts adversariales; brecha entre puntuaciones de benchmark y comportamiento desplegado.
Obras clave
"A Survey on Evaluation of LLMs" (2023, autor principal); marco PromptBench (2023).