La ligne de recherche de Mordatch — apprentissage par renforcement incarné, communication émergente multi-agent, agents conditionnés par le langage — se situe à l'intersection des LLM et des environnements sur lesquels ils pourraient potentiellement agir. À mesure que les LLM évoluent en systèmes d'agents qui prennent des actions aux conséquences réelles (naviguer, exécuter du code, parler à des API, manipuler des documents), la question d'évaluation change de forme : ce qu'il faut mesurer, c'est ce qui s'est passé dans le monde à la suite de la séquence d'actions, au-delà de la correction de surface du texte produit. Ses travaux antérieurs à OpenAI sur le langage émergent multi-agent et ses travaux actuels à DeepMind sur les politiques d'action conditionnées par le langage se situent à la frontière méthodologique de l'évaluation au niveau agent. Pour ai100, la transition vers les agents est à l'horizon — lorsque les moteurs IA passeront de la réponse à des questions sur les marques à l'action pour le compte des utilisateurs, la méthodologie d'évaluation devra évoluer en conséquence.

À lire lorsque
vous voulez comprendre la méthodologie d'évaluation des systèmes d'agents IA — où l'unité d'analyse est la séquence d'actions et ses conséquences, et non le texte seul.
Thèmes
agents d'apprentissage par renforcement conditionnés par le langage; communication émergente multi-agent; transition méthodologique de l'évaluation de sorties textuelles à l'évaluation de séquences d'actions.
Travaux clés
ensemble de travaux sur la communication émergente multi-agent et l'apprentissage par renforcement conditionné par le langage (OpenAI 2017–2020, puis Google DeepMind); publications sur le RL incarné; recherches en cours sur les agents de langage à DeepMind.