Jian-Guang Lou
Si un modelo de lenguaje que produce código produce realmente código que hace lo que la solicitud pedía, y cómo se ve la evaluación cuando la corrección, por una vez, tiene una respuesta definida.
La línea de investigación de Lou en MSR Asia ha trabajado en el raro problema de evaluación de LLM donde la corrección es inequívoca: generación de código. O el programa generado compila, se ejecuta y produce la salida correcta, o no lo hace; eso significa que la metodología de evaluación puede esquivar la mayoría de los problemas de LLM como juez que lastran la evaluación de generación abierta. Las contribuciones de su grupo a la evaluación de in-context learning y a benchmarks de síntesis de programas se construyeron sobre esta ventaja: una literatura que sabe qué significa «correcto» y usa esa claridad como palanca para interrogar otras partes del comportamiento del modelo.