Jian-Guang Lou
Производит ли языковая модель, генерирующая код, код, который действительно делает то, что просили, — и как выглядит оценка, когда у корректности наконец есть определённый ответ.
Исследовательская линия Lou в MSR Asia работала над редкой задачей оценки LLM, где корректность однозначна: генерацией кода. Либо сгенерированная программа компилируется, запускается и выдаёт правильный результат, либо нет — а значит, методология оценки может обойти большинство проблем LLM как судья, которые мучают оценку открытой генерации. Вклад его группы в оценку in-context learning и benchmark для синтеза программ опирался именно на это преимущество: это литература, которая знает, что значит «правильно», и использует эту ясность как рычаг для проверки других частей поведения модели.