Jian-Guang Lou
Ob ein Sprachmodell, das Code erzeugt, tatsächlich Code erzeugt, der tut, was die Anfrage verlangt hat — und wie Evaluation aussieht, wenn Korrektheit ausnahmsweise eine eindeutige Antwort hat.
Lous Forschungslinie bei MSR Asia arbeitet an dem seltenen LLM-Evaluationsproblem, bei dem Korrektheit eindeutig ist: Codegenerierung. Entweder kompiliert das erzeugte Programm, läuft und produziert die richtige Ausgabe, oder es tut es nicht — was bedeutet, dass die Bewertungsmethodik die meisten LLM-as-Judge-Probleme umgehen kann, die Evaluation offener Generierung plagen. Die Beiträge seiner Gruppe zur Evaluation von in-context learning und zu Benchmarks der Programmsynthese bauten auf diesem Vorteil auf: eine Literatur, die weiß, was „korrekt“ bedeutet, und diese Klarheit nutzt, um andere Teile des Modellverhaltens zu untersuchen.