Lous Forschungslinie bei MSR Asia arbeitet an dem seltenen LLM-Evaluationsproblem, bei dem Korrektheit eindeutig ist: Codegenerierung. Entweder kompiliert das erzeugte Programm, läuft und produziert die richtige Ausgabe, oder es tut es nicht — was bedeutet, dass die Bewertungsmethodik die meisten LLM-as-Judge-Probleme umgehen kann, die Evaluation offener Generierung plagen. Die Beiträge seiner Gruppe zur Evaluation von in-context learning und zu Benchmarks der Programmsynthese bauten auf diesem Vorteil auf: eine Literatur, die weiß, was „korrekt“ bedeutet, und diese Klarheit nutzt, um andere Teile des Modellverhaltens zu untersuchen.

Lesenswert, wenn
man LLM-Bewertungsmethodik in dem seltenen Setting studieren will, in dem die Ground Truth eindeutig ist — und sehen möchte, was diese Klarheit leistet, das der Evaluation offener Generierung fehlt.
Themen
Bewertungsmethodik für Programmsynthese; methodische Strenge des in-context learning bei Codegenerierung; der Kontrast zwischen eindeutiger Ground Truth und offener Evaluation.
Zentrale Arbeiten
Werkkomplex zur Evaluation von Programmsynthese und Codegenerierung bei Microsoft Research Asia (seit 2018); Publikationen zur Evaluation von in-context learning; Beiträge als ACM Distinguished Member zur angewandten LLM-Forschung.