← Volver a la lista
Jindong Wang
Estandarizar qué significa siquiera «evaluar un LLM» como procedimiento de investigación.
La literatura sobre evaluación de LLM creció más rápido que la metodología necesaria para hacer comparables esos artículos: distintos prompts, distintas formas de puntuación y distintas definiciones de «éxito» produjeron afirmaciones contradictorias sobre los mismos modelos. Wang lideró la síntesis más citada de ese panorama (el "Survey on Evaluation of LLMs" de 2023, con colaboradores) y construyó PromptBench, un marco abierto para hacer pruebas de estrés de la robustez de los modelos ante variaciones de prompt: la parte del campo donde vive la brecha entre «el modelo funciona» y «el modelo funciona con las palabras exactas que probamos».