node2vec (2016), de Leskovec, fue uno de los primeros métodos en hacer que los datos estructurados como grafos funcionaran como entrada para pipelines estándar de ML: representar nodos como vectores que preservan información de vecindad y luego usar esos embeddings como características en cualquier lugar donde pueda ir un vector. Los conjuntos de datos y métodos del Stanford Network Analysis Project (SNAP) que siguieron se convirtieron en el sustrato por defecto para la investigación en ML sobre grafos. Para ai100, donde la pregunta «cómo sabe un modelo qué marca mencionar» pertenece al territorio del razonamiento estructurado como grafo —qué entidades están conectadas con qué contextos en los datos de entrenamiento—, la perspectiva de grafos es un ángulo útilmente ortogonal sobre lo que la evaluación actual de LLM tiende a medir solo en la superficie.

Vale la pena seguirlo cuando
se quiere pensar el conocimiento y el comportamiento de razonamiento de los LLM en términos de estructura de grafos subyacente al texto, en lugar de tratarlos como propiedades del texto en sí.
Temas
aprendizaje automático sobre grafos y embeddings de nodos (node2vec); Stanford Network Analysis Project (SNAP); razonamiento estructurado como grafo como lente sobre el comportamiento de los LLM.
Obras clave
node2vec: Scalable Feature Learning for Networks (2016, coautor); conjuntos de datos y herramientas del Stanford Network Analysis Project (2007 en adelante); contribuciones a libros de texto y currículos de ML sobre grafos.