Igor Mordatch
Ce que signifie évaluer un modèle de langage qui prend des actions à conséquences par le biais du texte — non seulement produire des réponses, mais opérer dans des environnements qui répondent.
La ligne de recherche de Mordatch — apprentissage par renforcement incarné, communication émergente multi-agent, agents conditionnés par le langage — se situe à l'intersection des LLM et des environnements sur lesquels ils pourraient potentiellement agir. À mesure que les LLM évoluent en systèmes d'agents qui prennent des actions aux conséquences réelles (naviguer, exécuter du code, parler à des API, manipuler des documents), la question d'évaluation change de forme : ce qu'il faut mesurer, c'est ce qui s'est passé dans le monde à la suite de la séquence d'actions, au-delà de la correction de surface du texte produit. Ses travaux antérieurs à OpenAI sur le langage émergent multi-agent et ses travaux actuels à DeepMind sur les politiques d'action conditionnées par le langage se situent à la frontière méthodologique de l'évaluation au niveau agent. Pour ai100, la transition vers les agents est à l'horizon — lorsque les moteurs IA passeront de la réponse à des questions sur les marques à l'action pour le compte des utilisateurs, la méthodologie d'évaluation devra évoluer en conséquence.