La línea de investigación de Lou en MSR Asia ha trabajado en el raro problema de evaluación de LLM donde la corrección es inequívoca: generación de código. O el programa generado compila, se ejecuta y produce la salida correcta, o no lo hace; eso significa que la metodología de evaluación puede esquivar la mayoría de los problemas de LLM como juez que lastran la evaluación de generación abierta. Las contribuciones de su grupo a la evaluación de in-context learning y a benchmarks de síntesis de programas se construyeron sobre esta ventaja: una literatura que sabe qué significa «correcto» y usa esa claridad como palanca para interrogar otras partes del comportamiento del modelo.

Vale la pena seguirlo cuando
se quiere estudiar metodología de evaluación de LLM en el raro entorno donde la verdad de referencia es inequívoca, y ver qué compra esa claridad que la evaluación abierta no tiene.
Temas
metodología de evaluación de síntesis de programas; rigor de in-context learning para generación de código; contraste entre verdad de referencia inequívoca y evaluación abierta.
Obras clave
trayectoria de trabajo sobre síntesis de programas y evaluación de generación de código en Microsoft Research Asia (2018 en adelante); publicaciones de evaluación de in-context learning; contribuciones como ACM Distinguished Member a investigación aplicada de LLM.