Igor Mordatch
Qué significa evaluar un modelo de lenguaje que toma acciones consecuenciales a través de su texto, no solo produciendo respuestas sino operando en entornos que responden.
La línea de investigación de Mordatch —aprendizaje por refuerzo encarnado, comunicación emergente multiagente, agentes condicionados por lenguaje— ha estado en la intersección entre LLM y los entornos sobre los que podrían llegar a actuar. A medida que los LLM evolucionan hacia sistemas de agentes que toman acciones consecuenciales (navegar, ejecutar código, hablar con APIs, manipular documentos), la pregunta de evaluación cambia de forma: lo que hay que medir es qué ocurrió en el mundo como resultado de la secuencia de acciones, más allá de la corrección superficial del texto producido. Su trabajo anterior en OpenAI sobre lenguaje emergente multiagente y su trabajo actual en DeepMind sobre políticas de acción condicionadas por lenguaje se sitúan en la frontera metodológica de la evaluación a escala de agente. Para ai100, la transición agéntica está en el horizonte: cuando los motores de IA pasen de responder preguntas sobre marcas a tomar acciones en nombre de usuarios, la metodología de evaluación tendrá que evolucionar para estar a la altura.