Исследовательская линия Mordatch — embodied reinforcement learning, multi-agent emergent communication, language-conditioned agents — находилась на пересечении LLM и сред, в которых они потенциально могут действовать. По мере того как LLM превращаются в агентные системы, совершающие действия с последствиями (просматривают веб, выполняют код, обращаются к API, изменяют документы), вопрос оценки меняет форму: измерять надо то, что произошло в мире в результате последовательности действий, а не только поверхностную корректность произведённого текста. Его более ранние работы в OpenAI по multi-agent emergent language и текущие работы в DeepMind по language-conditioned action policies находятся на методологическом фронтире оценки агентного уровня. Для ai100 переход к агентам уже на горизонте: когда AI-движки перейдут от ответов на вопросы о брендах к действиям от имени пользователей, методология оценки должна будет измениться вместе с ними.

Стоит читать, когда
вы хотите понимать методологию оценки AI-агентных систем, где единица анализа — последовательность действий и её последствия, а не один только текст.
Темы
language-conditioned RL-агенты; многоагентная эмерджентная коммуникация; методологический переход от оценки текстового вывода к оценке последовательности действий.
Ключевые работы
корпус работ по multi-agent emergent communication и language-conditioned RL (OpenAI 2017–2020, затем Google DeepMind); публикации по embodied RL; текущие исследования языковых агентов в DeepMind.