A quién leer sobre IA
Un navegador curado — no es un ranking ni un top-N — de 109 investigadores cuyo trabajo se cruza con lo que mide ai100.
109 investigadores · 14 áreas temáticas · 3 enfoques
Qué es esto y cómo usarlo
A quién leer en IA — y por qué
La lista de abajo no es un ranking. No hay parte alta ni parte baja, ni ordenación por h-index. La investigación en IA no es una tabla de posiciones, y el trabajo que perdura rara vez es el que se vuelve tendencia.
Qué es esta página: un mapa de trabajo de los investigadores que ai100 lee cuando necesitamos entender cómo se comportan los modelos de lenguaje bajo presión: cómo se puntúan, dónde fallan, qué tipo de evidencia sobre ellos es fiable y cuál no. Las personas aquí incluidas han dado forma a cómo se hacen realmente la evaluación, la recuperación y la fiabilidad de la IA, no a cómo se habla de ellas en redes sociales.
Para cada nombre indicamos la dirección del trabajo, una breve nota sobre qué hace que esa persona merezca su tiempo, los temas para los que sus escritos son la puerta de entrada y algunas obras concretas por las que empezar. No enumeramos empleadores actuales ni cargos: cambian cada uno o dos años; el trabajo, no. Cuando alguien está afiliado a una empresa cuyos modelos evaluamos, lo decimos explícitamente en una línea de divulgación: la metodología de ai100 depende de que seamos honestos sobre los conflictos de interés, y en esta lista hay conflictos.
El análisis principal —lo que encontramos cuando sometemos los principales motores de IA a 200 auditorías cada uno, en cinco idiomas— se publica por separado. Esta página es la capa previa: las personas cuyo trabajo hace posible diseñar ese análisis.
- Akari Asai Cómo un modelo de lenguaje decide que su propio conocimiento interno es insuficiente y que debe acudir a una fuente externa.
- Amir Globerson Usar un modelo de lenguaje como interrogador adversarial de otro para sacar a la superficie errores factuales que ninguno de los dos podría encontrar por sí solo.
- Ari Holtzman Cómo generan texto realmente los modelos de lenguaje a partir de sus distribuciones de probabilidad, y qué efecto tiene la elección del método de muestreo sobre los resultados de evaluación.
- Ashish Sabharwal Qué puede aportar la investigación clásica en razonamiento formal a la evaluación de si los LLM modernos razonan realmente, y cómo distinguir eso de un lenguaje con forma de razonamiento que casualmente llega a la respuesta correcta.
- Benno Stein Construir infraestructura de evaluación que convierta el desacuerdo entre investigadores en algo técnicamente resoluble.
- Björn Schuller Qué tiene que evaluar la tecnología del lenguaje cuando la entrada no es texto sino habla, incluidos los signos emocionales, paralingüísticos y propios de cada hablante que los métodos de solo texto descartan.
- Charles L. A. Clarke Qué requiere una evaluación sistemática y replicable de sistemas de respuesta a preguntas ahora que los sistemas evaluados son modelos de lenguaje y no recuperadores.
- Chelsea Finn Cómo los sistemas de lenguaje y aprendizaje se adaptan a una tarea nueva con muy pocos ejemplos, y qué dice la estructura teórica de esa adaptación sobre lo que realmente han aprendido o no.
- Chris Callison-Burch Si los lectores humanos pueden distinguir el texto producido por un modelo de lenguaje del producido por humanos — y cómo esa capacidad de distinguir se erosiona a medida que los modelos mejoran.
- Christof Monz Evaluación sistemática año tras año de la traducción automática entre decenas de pares lingüísticos — y qué revela ese seguimiento sobre qué problemas de traducción se están resolviendo y cuáles no.
- Christopher Manning El argumento de que el significado, tal como los humanos usan la palabra, no es aquello con lo que operan los grandes modelos de lenguaje.
- Christopher Potts Qué estructura lingüística representan realmente los modelos de lenguaje, y cuál solo parecen representar.
- Colin Raffel Si un único modelo de lenguaje puede hacer todas las tareas de NLP a la vez cuando todas se formulan como text-in-text-out — y si esa unificación se mantiene entre lenguas.
- Dan Jurafsky Convertir el procesamiento del lenguaje natural en una disciplina enseñable, y usar esa perspectiva para leer dónde encajan —y dónde no— las prácticas actuales de evaluación del campo dentro de su historia más larga.
- Danqi Chen Si un modelo de lenguaje que produce una respuesta con citas realmente ancla la respuesta en esas citas — o simplemente adjunta referencias plausibles después del hecho.
- David Jurgens Si los modelos de lenguaje que manejan bien las preguntas factuales también pueden manejar el tipo de conocimiento social que determina lo que los humanos realmente quieren decir cuando dicen cosas.
- Daxin Jiang Cómo preentrenar un codificador para que los embeddings que produce sean buenos para recuperación — sin supervisarlo nunca en una tarea de recuperación.
- Diyi Yang Cómo se comportan los modelos de lenguaje cuando la tarea es social y no informacional: persuasión, apoyo, conflicto, cortesía.
- Dragan Gašević Si las herramientas de IA usadas en contextos educativos ayudan realmente a los aprendices para quienes se construyen, y qué tipo de infraestructura de evaluación exige esa pregunta más allá de los benchmarks convencionales de ML.
- Ee-Peng Lim Si pedir a un modelo de lenguaje que haga un plan antes de resolver un problema produce mejor razonamiento que decirle que piense paso a paso.
- Emma Strubell Si el coste computacional y energético de entrenar y servir modelos de lenguaje debe figurar en el titular de una evaluación, donde actualmente la exactitud aparece sola.
- Emmanuel Candès Cómo poner intervalos válidos de incertidumbre estadística alrededor de las predicciones de cualquier modelo —incluidos los modelos de lenguaje— sin asumir que se sabe qué tipo de distribución de errores esperar.
- Eric Horvitz La forma cualitativa de la capacidad de los modelos de lenguaje: qué aspecto tiene como fenómeno, y si tenemos vocabulario para describirla antes de tener metodología para medirla.
- Furu Wei Usar el propio conocimiento paramétrico de un modelo de lenguaje para hacer que la recuperación encuentre el documento que el usuario realmente buscaba.
- George J. Pappas Con qué rapidez un atacante automatizado puede encontrar prompts que rompen la alineación de seguridad de un modelo de lenguaje, y qué implica eso para evaluar la robustez del modelo como tal.
- Gideon Mann Cómo son los modelos de lenguaje cuando se entrenan para una vertical única de alto valor —finanzas, en este caso— y qué evaluación exige esa especialización más allá de los benchmarks generalistas.
- Graham Neubig Conectar recuperación, generación y evaluación en un único sistema que funcione — y preguntar cuándo esas conexiones realmente se sostienen.
- Hannaneh Hajishirzi Cuándo un modelo de lenguaje debería recurrir a una fuente externa de conocimiento, y cuándo basta su propia memoria paramétrica.
- Igor Mordatch Qué significa evaluar un modelo de lenguaje que toma acciones consecuenciales a través de su texto, no solo produciendo respuestas sino operando en entornos que responden.
- Ion Stoica La infraestructura de computación distribuida sobre la que casi todo LLM moderno se entrena, se sirve o se evalúa.
- Iryna Gurevych Construir la infraestructura de codificadores que convierte «encontrar frases similares a esta consulta» en una operación rápida y fiable entre idiomas y tareas.
- James Zou Qué aspecto tiene la evaluación cuando la IA evaluada tiene que superar barreras regulatorias antes del despliegue, y qué debería aprender la evaluación general de LLM de un campo que lleva años haciendo esto.
- Jamie Callan Qué aspecto tiene la generación aumentada por recuperación (RAG) cuando quien la mira conoce de verdad los treinta años de historia de la recuperación de información que está reinventando.
- Jared Kaplan Si la pérdida de un modelo de lenguaje es una función suave de cómputo, datos y tamaño del modelo, y qué permite predecir (y no predecir) esa suavidad sobre capacidades a mayor escala.
- Jennifer Wortman Vaughan Cómo las personas entienden y usan realmente los resultados de evaluación de modelos de lenguaje, y dónde aparece la brecha entre lo que se midió y lo que termina creyéndose.
- Jesse Dodge Qué tiene que contener un artículo sobre un modelo de lenguaje para que otro laboratorio pueda verificar el resultado.
- Ji-Rong Wen Organizar la literatura sobre LLM en algo que otros investigadores de NLP en chino puedan navegar realmente desde dentro del ecosistema académico.
- Jian-Guang Lou Si un modelo de lenguaje que produce código produce realmente código que hace lo que la solicitud pedía, y cómo se ve la evaluación cuando la corrección, por una vez, tiene una respuesta definida.
- Jian-Yun Nie Cómo se comporta de manera distinta la búsqueda cuando la consulta es una conversación en una lengua no inglesa — y cómo los modelos de lenguaje están cambiando ese panorama.
- Jianfeng Gao Qué son los grandes modelos de lenguaje como clase de sistemas: taxonómica y arquitectónicamente, y en cuanto a lo que realmente heredan de la historia más larga del NLP neuronal.
- Jie Zhou Si se puede confiar en que los modelos de lenguaje evalúen otros modelos de lenguaje en pipelines NLP de producción.
- Jimmy Lin Hacer que la recuperación de información sea lo bastante reproducible como para que un investigador de LLM y un investigador de IR puedan ejecutar el mismo experimento y obtener la misma respuesta.
- Jimmy Xiangji Huang Cómo escala la recuperación de información sobre los datos operativos desordenados que poseen las organizaciones reales, frente a los corpus limpios de benchmark sobre los que el campo realmente publica.
- Jindong Wang Estandarizar qué significa siquiera «evaluar un LLM» como procedimiento de investigación.
- Jochen Wirtz Qué ocurre cuando la IA de servicios orientada al cliente reemplaza, aumenta o compite con trabajadores humanos de servicio, y qué tipos de evaluación exige realmente ese cambio.
- Jonathan Berant Si un modelo de lenguaje está haciendo realmente los pasos de razonamiento necesarios para responder a una pregunta — o solo produciendo una respuesta que resulta ser correcta.
- Juanzi Li Combinar el conocimiento estructurado de grafos de conocimiento con los patrones estadísticos que los modelos de lenguaje aprenden del texto — y qué aporta esa combinación a la evaluación.
- Julian McAuley Si los modelos de lenguaje entrenados en la web abierta ya están haciendo recomendación — y qué implica eso para productos que compiten con recomendadores tradicionales.
- Junichi Yamagishi Si los oyentes humanos —o los detectores automatizados— pueden distinguir el habla generada por IA del habla humana real, y cómo cambia esa distinguibilidad a medida que mejora la síntesis del habla.
- Jure Leskovec Qué añade la estructura de grafos a los problemas de razonamiento y recuperación que los modelos de lenguaje actualmente manejan sin ella, y qué se pierde cuando las relaciones en los datos se aplanan en texto.
- Kevin Chen-Chuan Chang Organizar la literatura de crecimiento rápido sobre razonamiento en modelos de lenguaje en algo que un investigador nuevo en el área pueda navegar realmente.
- Kyle Lo Qué hay realmente en un corpus de entrenamiento cuando uno se sienta a mirarlo documento por documento.
- Luke Zettlemoyer Si pueden construirse modelos de lenguaje de pesos abiertos a escala de frontera y si su factualidad puede medirse a resolución fina.
- Maarten de Rijke Si la recuperación de información debería hacerla un sistema que «escribe el ID del documento» en lugar de uno que busca en un índice vectorial.
- Maarten Sap Si los modelos de lenguaje pueden producir conocimiento social o razonar sobre él con la misma competencia que muestran en tareas factuales, y qué está en juego cuando no pueden.
- Maosong Sun Qué aspecto tiene el ecosistema abierto de LLM cuando crece desde el NLP académico chino y no desde organizaciones occidentales sin ánimo de lucro como AI2.
- Marco Baroni Si los modelos de lenguaje neuronales pueden componer lo aprendido en combinaciones nuevas que nunca han visto — o si en realidad solo hacen una interpolación sofisticada dentro de su distribución de entrenamiento.
- Mari Ostendorf Qué aspecto tiene la tecnología del lenguaje cuando se ha sido responsable de ella como ingeniería desplegable durante treinta años antes de que los LLM llegaran a rehacer el campo.
- Mark Gales Detectar alucinaciones en un modelo de lenguaje sin acceso a sus pesos ni a la verdad de referencia.
- Martin Potthast Si los modelos de lenguaje pueden usarse para juzgar si un documento es relevante para una consulta — y qué cambia cuando sustituyen a evaluadores humanos en ese rol.
- Mengnan Du Qué tipos de explicaciones pueden obtenerse para las salidas de modelos de lenguaje, y cuáles de esas explicaciones resultan ser fiables.
- Michihiro Yasunaga Si un modelo de lenguaje puede traducir correctamente una pregunta en lenguaje natural a una consulta estructurada precisa, y qué revela esa traducción sobre el razonamiento sobre conocimiento.
- Minlie Huang Si las categorías de «dañino» usadas para evaluar la seguridad de modelos de lenguaje se transfieren de contextos occidentales a contextos de despliegue en chino, donde el marco regulatorio y las categorías culturales son diferentes.
- Mohit Bansal Si los métodos que usamos para evaluar modelos solo de lenguaje siguen funcionando cuando el mismo modelo tiene que manejar imágenes, habla u otras modalidades a la vez, y qué falla primero cuando se combinan modalidades.
- Nan Duan Reescribir la consulta del usuario antes de la recuperación para que el recuperador tenga alguna posibilidad de devolver documentos útiles.
- Nathan Lambert Qué le ocurre a un modelo de lenguaje entre «entrenado en internet» y «responder a una pregunta de la forma en que lo hace», y cómo estudiar ese paso en público.
- Noah A. Smith Si un modelo de lenguaje puede producir sus propios datos de entrenamiento, y cuáles son las consecuencias metodológicas cuando eso se convierte en la práctica estándar.
- Norbert Fuhr Lo que la evaluación de recuperación de información lleva décadas haciendo mal —documentado por escrito— y por qué cada nueva generación de investigadores comete los mismos errores.
- Omer Levy Si un modelo de lenguaje puede inferir la tarea solo a partir de ejemplos — sin que se le diga qué hacer — y qué revela esa capacidad sobre cómo representa las instrucciones.
- Pang Wei Koh Qué ocurre cuando un modelo de lenguaje encuentra el tipo de datos que no vio durante el entrenamiento, y cómo medir esa brecha con rigor, no solo advertirla después del despliegue.
- Paolo Rosso Construir campañas de evaluación que funcionen para las lenguas iberorromances —español, catalán, portugués— en lugar de trasladar metodología anglocéntrica y aceptar los puntos ciegos resultantes.
- Pascale Fung Si el mismo modelo de lenguaje realiza el mismo tipo de trabajo en distintas lenguas, y si la metodología de evaluación construida para el inglés nos está engañando sobre lo que hacen los modelos en todo lo demás.
- Percy Liang Cómo medir los modelos de lenguaje de modo que una medición hecha hoy siga significando algo el año próximo.
- Peter Henderson Dónde importan realmente los hallazgos técnicos sobre el comportamiento de modelos de lenguaje: en auditorías, regulación y responsabilidad legal, y cómo se ve la brecha entre «medimos esto» y «esto cambia lo que está permitido».
- Philip S. Yu Tender un puente entre cuatro décadas de metodología de minería de datos y la pregunta de cómo evaluar grandes modelos de lenguaje sin reinventar técnicas que el campo ya tiene.
- Prateek Mittal Cómo las entradas visuales se convierten en una nueva superficie de ataque para modelos de lenguaje con alineación de seguridad que aceptan consultas con multimodalidad.
- Qiang Yang Si puede haber aprendizaje automático útil cuando los datos con los que se entrenaría o evaluaría no pueden trasladarse a un único lugar por razones legales, de privacidad o comerciales.
- Quoc V. Le Los bloques arquitectónicos y las recetas de entrenamiento sobre los que se construyó la era moderna de los LLM.
- Rishi Bommasani Qué nos están diciendo —y qué no— los desarrolladores de modelos de lenguaje sobre sus propios modelos, y cómo medirlo sistemáticamente.
- Roi Reichart Qué significa «dominio» para un modelo de lenguaje — cuando su distribución de entrenamiento deja de coincidir con su contexto de despliegue — y cómo evaluar rigurosamente ese desajuste.
- Seungone Kim Si el campo puede contar con una alternativa de evaluador de LLM con pesos abiertos, para que «una caja negra juzgando a otra caja negra» deje de ser la única opción disponible.
- Shafiq Joty Metodología de evaluación para modelos de lenguaje cuando el contexto de despliegue es software empresarial y no una demo de investigación.
- Shayne Longpre Qué hay realmente dentro de los datos con los que entrenan los modelos de lenguaje, y quién puede o no puede saberlo.
- Shinji Watanabe La infraestructura de código abierto de procesamiento del habla que permite a grupos académicos e industriales entrenar, evaluar y comparar sistemas de lenguaje con entrada o salida de voz en igualdad de condiciones.
- Shuming Shi Qué aspecto tiene la alucinación de los modelos de lenguaje cuando se es responsable de lanzar productos basados en LLM a una plataforma con mil millones de usuarios.
- Steven Schockaert Cómo evaluar un sistema de generación aumentada por recuperación (RAG) de extremo a extremo cuando cada una de sus partes puede fallar de maneras distintas.
- Tatsunori Hashimoto Si los números reportados sobre los modelos de lenguaje son hallazgos estadísticos o artefactos metodológicos.
- Tom Mitchell Si un modelo de lenguaje tiene una representación interna de si está diciendo la verdad — separable de lo que realmente emite.
- Torsten Hoefler Generalizar el razonamiento de modelos de lenguaje más allá de cadenas de razonamiento lineales — hacia ramificación, retroceso y recombinación de pasos intermedios de razonamiento.
- Tushar Khot Qué significa realmente «capacidad de razonamiento» como algo que se puede poner en un benchmark, y qué cambia cuando también se intenta guiar al modelo para que razone mediante prompting estructurado.
- Wayne Xin Zhao El lado de síntesis de la investigación en LLM: lo que implica leer todos los artículos del momento y producir algo que otros investigadores puedan navegar.
- Weijia Shi Hacer que la generación aumentada por recuperación funcione cuando el propio modelo de lenguaje es una caja cerrada a la que no se puede aplicar ajuste fino (fine-tuning).
- Wen-tau Yih Hacer que el paso de recuperación dentro de sistemas aumentados por recuperación sea lo bastante bueno como para que el paso de generación tenga algo con lo que trabajar.
- Wenjie Li Cómo se relaciona la recuperación generativa con las demás tareas de generación —resumen, respuesta a preguntas— que la misma arquitectura de sistema tiene que manejar.
- Xia Hu Si el estado del arte académico en modelos de lenguaje puede convertirse en algo que un profesional —no un laboratorio de investigación— pueda desplegar y en lo que pueda confiar.
- Xing Xie Conectar la tradición de los sistemas de recomendación, dedicada a medir el comportamiento de la IA de cara al usuario, con los nuevos retos de evaluación que plantean los LLM modernos.
- Xipeng Qiu Construir un gran modelo de lenguaje abierto en chino que la comunidad académica pueda estudiar realmente por dentro — y las herramientas a su alrededor.
- Xueqi Cheng Qué ha estado argumentando la investigación en recuperación de información desde dentro de la tradición china de IR — y en qué difiere su ángulo sobre la recuperación generativa del canon occidental.
- Yang Liu Si un modelo de lenguaje más capaz puede usarse para calificar las salidas de uno menos capaz — y cómo hacerlo sin engañarse a uno mismo.
- Yann LeCun Cómo deberían ser los sistemas de aprendizaje automático, contrapuesto a cómo son actualmente.
- Yarin Gal Cuantificar cuándo los modelos de lenguaje no saben de qué están hablando.
- Yejin Choi Qué haría falta para que un modelo de lenguaje tuviera lo que a los humanos les sobra y a los LLM les falta de forma fiable: sentido común.
- Yoav Goldberg Si la cadena de razonamiento que produce un modelo de lenguaje es la cadena de razonamiento que realmente siguió.
- Yoav Shoham Qué puede medirse sobre el estado de la IA desde fuera de cualquier empresa individual — y cómo se ve el aumento por recuperación cuando no hace falta reentrenar nada.
- Yonatan Belinkov Qué hay realmente dentro de las representaciones ocultas de un modelo de lenguaje — y cuáles de esos estados internos se corresponden con cosas que los humanos reconocerían como conocimiento.
- Yue Zhang Organizar lo que el campo llama «alucinación» en categorías que de verdad significan cosas distintas.
- Yulia Tsvetkov Qué formas adoptan el sesgo y el daño en las salidas de modelos de lenguaje a través de idiomas, especialmente en las lenguas y comunidades que la evaluación estándar del campo ha ignorado históricamente.
- Zhaochun Ren Si se puede confiar a un modelo de lenguaje el trabajo que actualmente hace un sistema de recuperación de información — y qué partes de ese trabajo hace realmente bien.
- Zhiting Hu Tratar un modelo de lenguaje como un componente dentro de un sistema de planificación más amplio, en lugar de pedirle que haga razonamiento de extremo a extremo dentro de su propia cabeza.