Igor Mordatch
Что означает оценивать языковую модель, которая через свой текст совершает действия с последствиями, — не только выдаёт ответы, но и действует в средах, которые отвечают.
Исследовательская линия Mordatch — embodied reinforcement learning, multi-agent emergent communication, language-conditioned agents — находилась на пересечении LLM и сред, в которых они потенциально могут действовать. По мере того как LLM превращаются в агентные системы, совершающие действия с последствиями (просматривают веб, выполняют код, обращаются к API, изменяют документы), вопрос оценки меняет форму: измерять надо то, что произошло в мире в результате последовательности действий, а не только поверхностную корректность произведённого текста. Его более ранние работы в OpenAI по multi-agent emergent language и текущие работы в DeepMind по language-conditioned action policies находятся на методологическом фронтире оценки агентного уровня. Для ai100 переход к агентам уже на горизонте: когда AI-движки перейдут от ответов на вопросы о брендах к действиям от имени пользователей, методология оценки должна будет измениться вместе с ними.