El artículo de Microsoft Research "Sparks of Artificial General Intelligence", que Horvitz coescribió en 2023, fue la evaluación cualitativa de GPT-4 más citada del campo: más de cien páginas de ejemplos que mostraban al modelo haciendo cosas que sus predecesores no podían hacer, enmarcadas como evidencia preliminar de capacidades cercanas a la inteligencia general. El artículo recibió críticas inmediatas por su falta de protocolo sistemático, pero esas críticas pasaron por alto en gran medida lo que hizo influyente al documento: dio a la industria un vocabulario para lo que estaba viendo antes de que nadie hubiera construido instrumentos rigurosos para medirlo. La carrera más larga de Horvitz —IA probabilística, apoyo a la decisión médica, presidencia de AAAI, desarrollo de la infraestructura de IA responsable de Microsoft— le da una autoridad que el lector casual de "Sparks" suele perder de vista.

Vale la pena seguirlo cuando
se quiere leer la perspectiva industrial sénior sobre de qué son capaces los LLM actuales, incluso cuando —especialmente cuando— esa perspectiva es metodológicamente informal de formas frente a las cuales la propia evaluación de ai100 funciona como antídoto.
Temas
evaluación cualitativa de capacidades de LLM (Sparks); IA probabilística y métodos de teoría de la decisión; infraestructura de IA responsable dentro de grandes laboratorios de modelos (Aether).
Obras clave
"Sparks of Artificial General Intelligence: Early experiments with GPT-4" (2023, autor sénior); décadas de publicaciones sobre IA probabilística y apoyo a la decisión médica; Aether Working Group on responsible AI.