La línea de investigación de Mordatch —aprendizaje por refuerzo encarnado, comunicación emergente multiagente, agentes condicionados por lenguaje— ha estado en la intersección entre LLM y los entornos sobre los que podrían llegar a actuar. A medida que los LLM evolucionan hacia sistemas de agentes que toman acciones consecuenciales (navegar, ejecutar código, hablar con APIs, manipular documentos), la pregunta de evaluación cambia de forma: lo que hay que medir es qué ocurrió en el mundo como resultado de la secuencia de acciones, más allá de la corrección superficial del texto producido. Su trabajo anterior en OpenAI sobre lenguaje emergente multiagente y su trabajo actual en DeepMind sobre políticas de acción condicionadas por lenguaje se sitúan en la frontera metodológica de la evaluación a escala de agente. Para ai100, la transición agéntica está en el horizonte: cuando los motores de IA pasen de responder preguntas sobre marcas a tomar acciones en nombre de usuarios, la metodología de evaluación tendrá que evolucionar para estar a la altura.

Vale la pena seguirlo cuando
se quiere entender la metodología de evaluación para sistemas de agentes de IA, donde la unidad de análisis es la secuencia de acciones y sus consecuencias, no solo el texto.
Temas
agentes de aprendizaje por refuerzo condicionados por lenguaje; comunicación emergente multiagente; transición metodológica de la evaluación de salida textual a la evaluación de secuencias de acción.
Obras clave
trayectoria sobre comunicación emergente multiagente y RL condicionado por lenguaje (OpenAI 2017–2020, luego Google DeepMind); publicaciones de RL encarnado; investigación en curso sobre agentes de lenguaje en DeepMind.