Исследовательская линия Lou в MSR Asia работала над редкой задачей оценки LLM, где корректность однозначна: генерацией кода. Либо сгенерированная программа компилируется, запускается и выдаёт правильный результат, либо нет — а значит, методология оценки может обойти большинство проблем LLM как судья, которые мучают оценку открытой генерации. Вклад его группы в оценку in-context learning и benchmark для синтеза программ опирался именно на это преимущество: это литература, которая знает, что значит «правильно», и использует эту ясность как рычаг для проверки других частей поведения модели.

Стоит читать, когда
вы хотите изучать методологию оценки LLM в редкой постановке, где эталон однозначен, — и увидеть, что эта ясность даёт по сравнению с оценкой открытой генерации.
Темы
методология оценки синтеза программ; строгость in-context learning для генерации кода; контраст между оценкой с однозначным эталоном и оценкой открытой генерации.
Ключевые работы
корпус работ по оценке синтеза программ и генерации кода в Microsoft Research Asia (с 2018 года); публикации по оценке in-context learning; вклад ACM Distinguished Member в прикладные исследования LLM.