1. Akari Asai Cómo un modelo de lenguaje decide que su propio conocimiento interno es insuficiente y que debe acudir a una fuente externa. Generación aumentada por recuperación (RAG) Metodología de evaluación
  2. Amir Globerson Usar un modelo de lenguaje como interrogador adversarial de otro para sacar a la superficie errores factuales que ninguno de los dos podría encontrar por sí solo. Alucinación y factualidad Metodología de evaluación
  3. Ari Holtzman Cómo generan texto realmente los modelos de lenguaje a partir de sus distribuciones de probabilidad, y qué efecto tiene la elección del método de muestreo sobre los resultados de evaluación. Metodología de evaluación Figuras fundacionales
  4. Ashish Sabharwal Qué puede aportar la investigación clásica en razonamiento formal a la evaluación de si los LLM modernos razonan realmente, y cómo distinguir eso de un lenguaje con forma de razonamiento que casualmente llega a la respuesta correcta. Razonamiento y descomposición Figuras fundacionales
  5. Benno Stein Construir infraestructura de evaluación que convierta el desacuerdo entre investigadores en algo técnicamente resoluble. Recuperación de información Transparencia y gobernanza Metodología de evaluación
  6. Björn Schuller Qué tiene que evaluar la tecnología del lenguaje cuando la entrada no es texto sino habla, incluidos los signos emocionales, paralingüísticos y propios de cada hablante que los métodos de solo texto descartan. Metodología de evaluación Habla y multimodalidad Seguridad y robustez
  7. Charles L. A. Clarke Qué requiere una evaluación sistemática y replicable de sistemas de respuesta a preguntas ahora que los sistemas evaluados son modelos de lenguaje y no recuperadores. Recuperación de información Metodología de evaluación
  8. Chelsea Finn Cómo los sistemas de lenguaje y aprendizaje se adaptan a una tarea nueva con muy pocos ejemplos, y qué dice la estructura teórica de esa adaptación sobre lo que realmente han aprendido o no. Razonamiento y descomposición Figuras fundacionales Sistemas y escalado
  9. Chris Callison-Burch Si los lectores humanos pueden distinguir el texto producido por un modelo de lenguaje del producido por humanos — y cómo esa capacidad de distinguir se erosiona a medida que los modelos mejoran. Metodología de evaluación Evaluación multilingüe Figuras fundacionales
  10. Christof Monz Evaluación sistemática año tras año de la traducción automática entre decenas de pares lingüísticos — y qué revela ese seguimiento sobre qué problemas de traducción se están resolviendo y cuáles no. Metodología de evaluación Evaluación multilingüe
  11. Christopher Manning El argumento de que el significado, tal como los humanos usan la palabra, no es aquello con lo que operan los grandes modelos de lenguaje. Metodología de evaluación Figuras fundacionales Interpretabilidad
  12. Christopher Potts Qué estructura lingüística representan realmente los modelos de lenguaje, y cuál solo parecen representar. Metodología de evaluación Figuras fundacionales
  13. Colin Raffel Si un único modelo de lenguaje puede hacer todas las tareas de NLP a la vez cuando todas se formulan como text-in-text-out — y si esa unificación se mantiene entre lenguas. Evaluación multilingüe Figuras fundacionales
  14. Dan Jurafsky Convertir el procesamiento del lenguaje natural en una disciplina enseñable, y usar esa perspectiva para leer dónde encajan —y dónde no— las prácticas actuales de evaluación del campo dentro de su historia más larga. Metodología de evaluación Figuras fundacionales
  15. Danqi Chen Si un modelo de lenguaje que produce una respuesta con citas realmente ancla la respuesta en esas citas — o simplemente adjunta referencias plausibles después del hecho. Generación aumentada por recuperación (RAG) Alucinación y factualidad Figuras fundacionales
  16. David Jurgens Si los modelos de lenguaje que manejan bien las preguntas factuales también pueden manejar el tipo de conocimiento social que determina lo que los humanos realmente quieren decir cuando dicen cosas. Metodología de evaluación Figuras fundacionales Seguridad y robustez
  17. Daxin Jiang Cómo preentrenar un codificador para que los embeddings que produce sean buenos para recuperación — sin supervisarlo nunca en una tarea de recuperación. Generación aumentada por recuperación (RAG) Recuperación de información
  18. Diyi Yang Cómo se comportan los modelos de lenguaje cuando la tarea es social y no informacional: persuasión, apoyo, conflicto, cortesía. Metodología de evaluación Diálogo y agentes
  19. Dragan Gašević Si las herramientas de IA usadas en contextos educativos ayudan realmente a los aprendices para quienes se construyen, y qué tipo de infraestructura de evaluación exige esa pregunta más allá de los benchmarks convencionales de ML. Transparencia y gobernanza Metodología de evaluación Figuras fundacionales
  20. Ee-Peng Lim Si pedir a un modelo de lenguaje que haga un plan antes de resolver un problema produce mejor razonamiento que decirle que piense paso a paso. Razonamiento y descomposición Metodología de evaluación
  21. Emma Strubell Si el coste computacional y energético de entrenar y servir modelos de lenguaje debe figurar en el titular de una evaluación, donde actualmente la exactitud aparece sola. Transparencia y gobernanza Metodología de evaluación
  22. Emmanuel Candès Cómo poner intervalos válidos de incertidumbre estadística alrededor de las predicciones de cualquier modelo —incluidos los modelos de lenguaje— sin asumir que se sabe qué tipo de distribución de errores esperar. Metodología de evaluación Figuras fundacionales
  23. Eric Horvitz La forma cualitativa de la capacidad de los modelos de lenguaje: qué aspecto tiene como fenómeno, y si tenemos vocabulario para describirla antes de tener metodología para medirla. Transparencia y gobernanza Metodología de evaluación Figuras fundacionales
  24. Furu Wei Usar el propio conocimiento paramétrico de un modelo de lenguaje para hacer que la recuperación encuentre el documento que el usuario realmente buscaba. Generación aumentada por recuperación (RAG) Metodología de evaluación
  25. George J. Pappas Con qué rapidez un atacante automatizado puede encontrar prompts que rompen la alineación de seguridad de un modelo de lenguaje, y qué implica eso para evaluar la robustez del modelo como tal. Metodología de evaluación Seguridad y robustez
  26. Gideon Mann Cómo son los modelos de lenguaje cuando se entrenan para una vertical única de alto valor —finanzas, en este caso— y qué evaluación exige esa especialización más allá de los benchmarks generalistas. Transparencia y gobernanza Metodología de evaluación Figuras fundacionales
  27. Graham Neubig Conectar recuperación, generación y evaluación en un único sistema que funcione — y preguntar cuándo esas conexiones realmente se sostienen. Generación aumentada por recuperación (RAG) Metodología de evaluación Diálogo y agentes
  28. Hannaneh Hajishirzi Cuándo un modelo de lenguaje debería recurrir a una fuente externa de conocimiento, y cuándo basta su propia memoria paramétrica. Transparencia y gobernanza Alucinación y factualidad Metodología de evaluación
  29. Igor Mordatch Qué significa evaluar un modelo de lenguaje que toma acciones consecuenciales a través de su texto, no solo produciendo respuestas sino operando en entornos que responden. Razonamiento y descomposición Sistemas y escalado Diálogo y agentes
  30. Ion Stoica La infraestructura de computación distribuida sobre la que casi todo LLM moderno se entrena, se sirve o se evalúa. Figuras fundacionales Sistemas y escalado
  31. Iryna Gurevych Construir la infraestructura de codificadores que convierte «encontrar frases similares a esta consulta» en una operación rápida y fiable entre idiomas y tareas. Generación aumentada por recuperación (RAG) Recuperación de información Figuras fundacionales
  32. James Zou Qué aspecto tiene la evaluación cuando la IA evaluada tiene que superar barreras regulatorias antes del despliegue, y qué debería aprender la evaluación general de LLM de un campo que lleva años haciendo esto. Transparencia y gobernanza Metodología de evaluación Figuras fundacionales
  33. Jamie Callan Qué aspecto tiene la generación aumentada por recuperación (RAG) cuando quien la mira conoce de verdad los treinta años de historia de la recuperación de información que está reinventando. Generación aumentada por recuperación (RAG) Recuperación de información Figuras fundacionales
  34. Jared Kaplan Si la pérdida de un modelo de lenguaje es una función suave de cómputo, datos y tamaño del modelo, y qué permite predecir (y no predecir) esa suavidad sobre capacidades a mayor escala. Metodología de evaluación Figuras fundacionales Sistemas y escalado
  35. Jennifer Wortman Vaughan Cómo las personas entienden y usan realmente los resultados de evaluación de modelos de lenguaje, y dónde aparece la brecha entre lo que se midió y lo que termina creyéndose. Transparencia y gobernanza Metodología de evaluación
  36. Jesse Dodge Qué tiene que contener un artículo sobre un modelo de lenguaje para que otro laboratorio pueda verificar el resultado. Transparencia y gobernanza Metodología de evaluación
  37. Ji-Rong Wen Organizar la literatura sobre LLM en algo que otros investigadores de NLP en chino puedan navegar realmente desde dentro del ecosistema académico. Metodología de evaluación Evaluación multilingüe Figuras fundacionales
  38. Jian-Guang Lou Si un modelo de lenguaje que produce código produce realmente código que hace lo que la solicitud pedía, y cómo se ve la evaluación cuando la corrección, por una vez, tiene una respuesta definida. Razonamiento y descomposición Metodología de evaluación Figuras fundacionales
  39. Jian-Yun Nie Cómo se comporta de manera distinta la búsqueda cuando la consulta es una conversación en una lengua no inglesa — y cómo los modelos de lenguaje están cambiando ese panorama. Generación aumentada por recuperación (RAG) Recuperación de información Evaluación multilingüe
  40. Jianfeng Gao Qué son los grandes modelos de lenguaje como clase de sistemas: taxonómica y arquitectónicamente, y en cuanto a lo que realmente heredan de la historia más larga del NLP neuronal. Metodología de evaluación Figuras fundacionales Diálogo y agentes
  41. Jie Zhou Si se puede confiar en que los modelos de lenguaje evalúen otros modelos de lenguaje en pipelines NLP de producción. Metodología LLM como juez Diálogo y agentes
  42. Jimmy Lin Hacer que la recuperación de información sea lo bastante reproducible como para que un investigador de LLM y un investigador de IR puedan ejecutar el mismo experimento y obtener la misma respuesta. Generación aumentada por recuperación (RAG) Recuperación de información Transparencia y gobernanza
  43. Jimmy Xiangji Huang Cómo escala la recuperación de información sobre los datos operativos desordenados que poseen las organizaciones reales, frente a los corpus limpios de benchmark sobre los que el campo realmente publica. Recuperación de información Metodología de evaluación
  44. Jindong Wang Estandarizar qué significa siquiera «evaluar un LLM» como procedimiento de investigación. Metodología de evaluación Seguridad y robustez
  45. Jochen Wirtz Qué ocurre cuando la IA de servicios orientada al cliente reemplaza, aumenta o compite con trabajadores humanos de servicio, y qué tipos de evaluación exige realmente ese cambio. Transparencia y gobernanza Metodología de evaluación Diálogo y agentes
  46. Jonathan Berant Si un modelo de lenguaje está haciendo realmente los pasos de razonamiento necesarios para responder a una pregunta — o solo produciendo una respuesta que resulta ser correcta. Razonamiento y descomposición Metodología de evaluación
  47. Juanzi Li Combinar el conocimiento estructurado de grafos de conocimiento con los patrones estadísticos que los modelos de lenguaje aprenden del texto — y qué aporta esa combinación a la evaluación. Generación aumentada por recuperación (RAG) Alucinación y factualidad Figuras fundacionales
  48. Julian McAuley Si los modelos de lenguaje entrenados en la web abierta ya están haciendo recomendación — y qué implica eso para productos que compiten con recomendadores tradicionales. Recuperación de información Metodología de evaluación Diálogo y agentes
  49. Junichi Yamagishi Si los oyentes humanos —o los detectores automatizados— pueden distinguir el habla generada por IA del habla humana real, y cómo cambia esa distinguibilidad a medida que mejora la síntesis del habla. Metodología de evaluación Habla y multimodalidad Seguridad y robustez
  50. Jure Leskovec Qué añade la estructura de grafos a los problemas de razonamiento y recuperación que los modelos de lenguaje actualmente manejan sin ella, y qué se pierde cuando las relaciones en los datos se aplanan en texto. Recuperación de información Figuras fundacionales
  51. Kevin Chen-Chuan Chang Organizar la literatura de crecimiento rápido sobre razonamiento en modelos de lenguaje en algo que un investigador nuevo en el área pueda navegar realmente. Razonamiento y descomposición Metodología de evaluación
  52. Kyle Lo Qué hay realmente en un corpus de entrenamiento cuando uno se sienta a mirarlo documento por documento. Transparencia y gobernanza Metodología de evaluación
  53. Luke Zettlemoyer Si pueden construirse modelos de lenguaje de pesos abiertos a escala de frontera y si su factualidad puede medirse a resolución fina. Alucinación y factualidad Figuras fundacionales
  54. Maarten de Rijke Si la recuperación de información debería hacerla un sistema que «escribe el ID del documento» en lugar de uno que busca en un índice vectorial. Generación aumentada por recuperación (RAG) Recuperación de información
  55. Maarten Sap Si los modelos de lenguaje pueden producir conocimiento social o razonar sobre él con la misma competencia que muestran en tareas factuales, y qué está en juego cuando no pueden. Metodología de evaluación Seguridad y robustez Diálogo y agentes
  56. Maosong Sun Qué aspecto tiene el ecosistema abierto de LLM cuando crece desde el NLP académico chino y no desde organizaciones occidentales sin ánimo de lucro como AI2. Transparencia y gobernanza Evaluación multilingüe Figuras fundacionales
  57. Marco Baroni Si los modelos de lenguaje neuronales pueden componer lo aprendido en combinaciones nuevas que nunca han visto — o si en realidad solo hacen una interpolación sofisticada dentro de su distribución de entrenamiento. Razonamiento y descomposición Evaluación multilingüe Figuras fundacionales
  58. Mari Ostendorf Qué aspecto tiene la tecnología del lenguaje cuando se ha sido responsable de ella como ingeniería desplegable durante treinta años antes de que los LLM llegaran a rehacer el campo. Metodología de evaluación Habla y multimodalidad Figuras fundacionales
  59. Mark Gales Detectar alucinaciones en un modelo de lenguaje sin acceso a sus pesos ni a la verdad de referencia. Alucinación y factualidad Habla y multimodalidad
  60. Martin Potthast Si los modelos de lenguaje pueden usarse para juzgar si un documento es relevante para una consulta — y qué cambia cuando sustituyen a evaluadores humanos en ese rol. Recuperación de información Metodología de evaluación Metodología LLM como juez
  61. Mengnan Du Qué tipos de explicaciones pueden obtenerse para las salidas de modelos de lenguaje, y cuáles de esas explicaciones resultan ser fiables. Metodología de evaluación Interpretabilidad
  62. Michihiro Yasunaga Si un modelo de lenguaje puede traducir correctamente una pregunta en lenguaje natural a una consulta estructurada precisa, y qué revela esa traducción sobre el razonamiento sobre conocimiento. Razonamiento y descomposición Metodología de evaluación
  63. Minlie Huang Si las categorías de «dañino» usadas para evaluar la seguridad de modelos de lenguaje se transfieren de contextos occidentales a contextos de despliegue en chino, donde el marco regulatorio y las categorías culturales son diferentes. Evaluación multilingüe Seguridad y robustez Diálogo y agentes
  64. Mohit Bansal Si los métodos que usamos para evaluar modelos solo de lenguaje siguen funcionando cuando el mismo modelo tiene que manejar imágenes, habla u otras modalidades a la vez, y qué falla primero cuando se combinan modalidades. Metodología de evaluación Habla y multimodalidad Figuras fundacionales
  65. Nan Duan Reescribir la consulta del usuario antes de la recuperación para que el recuperador tenga alguna posibilidad de devolver documentos útiles. Generación aumentada por recuperación (RAG)
  66. Nathan Lambert Qué le ocurre a un modelo de lenguaje entre «entrenado en internet» y «responder a una pregunta de la forma en que lo hace», y cómo estudiar ese paso en público. Transparencia y gobernanza Metodología de evaluación
  67. Noah A. Smith Si un modelo de lenguaje puede producir sus propios datos de entrenamiento, y cuáles son las consecuencias metodológicas cuando eso se convierte en la práctica estándar. Transparencia y gobernanza Metodología de evaluación Figuras fundacionales
  68. Norbert Fuhr Lo que la evaluación de recuperación de información lleva décadas haciendo mal —documentado por escrito— y por qué cada nueva generación de investigadores comete los mismos errores. Recuperación de información Metodología de evaluación Figuras fundacionales
  69. Omer Levy Si un modelo de lenguaje puede inferir la tarea solo a partir de ejemplos — sin que se le diga qué hacer — y qué revela esa capacidad sobre cómo representa las instrucciones. Razonamiento y descomposición Metodología de evaluación Figuras fundacionales
  70. Pang Wei Koh Qué ocurre cuando un modelo de lenguaje encuentra el tipo de datos que no vio durante el entrenamiento, y cómo medir esa brecha con rigor, no solo advertirla después del despliegue. Transparencia y gobernanza Metodología de evaluación Seguridad y robustez
  71. Paolo Rosso Construir campañas de evaluación que funcionen para las lenguas iberorromances —español, catalán, portugués— en lugar de trasladar metodología anglocéntrica y aceptar los puntos ciegos resultantes. Metodología de evaluación Evaluación multilingüe Seguridad y robustez
  72. Pascale Fung Si el mismo modelo de lenguaje realiza el mismo tipo de trabajo en distintas lenguas, y si la metodología de evaluación construida para el inglés nos está engañando sobre lo que hacen los modelos en todo lo demás. Metodología de evaluación Evaluación multilingüe
  73. Percy Liang Cómo medir los modelos de lenguaje de modo que una medición hecha hoy siga significando algo el año próximo. Metodología de evaluación
  74. Peter Henderson Dónde importan realmente los hallazgos técnicos sobre el comportamiento de modelos de lenguaje: en auditorías, regulación y responsabilidad legal, y cómo se ve la brecha entre «medimos esto» y «esto cambia lo que está permitido». Transparencia y gobernanza Metodología de evaluación
  75. Philip S. Yu Tender un puente entre cuatro décadas de metodología de minería de datos y la pregunta de cómo evaluar grandes modelos de lenguaje sin reinventar técnicas que el campo ya tiene. Recuperación de información Metodología de evaluación Figuras fundacionales
  76. Prateek Mittal Cómo las entradas visuales se convierten en una nueva superficie de ataque para modelos de lenguaje con alineación de seguridad que aceptan consultas con multimodalidad. Habla y multimodalidad Seguridad y robustez
  77. Qiang Yang Si puede haber aprendizaje automático útil cuando los datos con los que se entrenaría o evaluaría no pueden trasladarse a un único lugar por razones legales, de privacidad o comerciales. Transparencia y gobernanza Metodología de evaluación Figuras fundacionales
  78. Quoc V. Le Los bloques arquitectónicos y las recetas de entrenamiento sobre los que se construyó la era moderna de los LLM. Razonamiento y descomposición Figuras fundacionales
  79. Rishi Bommasani Qué nos están diciendo —y qué no— los desarrolladores de modelos de lenguaje sobre sus propios modelos, y cómo medirlo sistemáticamente. Transparencia y gobernanza Metodología de evaluación
  80. Roi Reichart Qué significa «dominio» para un modelo de lenguaje — cuando su distribución de entrenamiento deja de coincidir con su contexto de despliegue — y cómo evaluar rigurosamente ese desajuste. Metodología de evaluación Figuras fundacionales
  81. Seungone Kim Si el campo puede contar con una alternativa de evaluador de LLM con pesos abiertos, para que «una caja negra juzgando a otra caja negra» deje de ser la única opción disponible. Transparencia y gobernanza Metodología LLM como juez Metodología de evaluación
  82. Shafiq Joty Metodología de evaluación para modelos de lenguaje cuando el contexto de despliegue es software empresarial y no una demo de investigación. Metodología de evaluación Diálogo y agentes
  83. Shayne Longpre Qué hay realmente dentro de los datos con los que entrenan los modelos de lenguaje, y quién puede o no puede saberlo. Transparencia y gobernanza Metodología de evaluación
  84. Shinji Watanabe La infraestructura de código abierto de procesamiento del habla que permite a grupos académicos e industriales entrenar, evaluar y comparar sistemas de lenguaje con entrada o salida de voz en igualdad de condiciones. Metodología de evaluación Habla y multimodalidad Figuras fundacionales
  85. Shuming Shi Qué aspecto tiene la alucinación de los modelos de lenguaje cuando se es responsable de lanzar productos basados en LLM a una plataforma con mil millones de usuarios. Alucinación y factualidad
  86. Steven Schockaert Cómo evaluar un sistema de generación aumentada por recuperación (RAG) de extremo a extremo cuando cada una de sus partes puede fallar de maneras distintas. Generación aumentada por recuperación (RAG) Metodología de evaluación
  87. Tatsunori Hashimoto Si los números reportados sobre los modelos de lenguaje son hallazgos estadísticos o artefactos metodológicos. Metodología de evaluación
  88. Tom Mitchell Si un modelo de lenguaje tiene una representación interna de si está diciendo la verdad — separable de lo que realmente emite. Alucinación y factualidad Figuras fundacionales Interpretabilidad
  89. Torsten Hoefler Generalizar el razonamiento de modelos de lenguaje más allá de cadenas de razonamiento lineales — hacia ramificación, retroceso y recombinación de pasos intermedios de razonamiento. Razonamiento y descomposición Sistemas y escalado
  90. Tushar Khot Qué significa realmente «capacidad de razonamiento» como algo que se puede poner en un benchmark, y qué cambia cuando también se intenta guiar al modelo para que razone mediante prompting estructurado. Razonamiento y descomposición Metodología de evaluación
  91. Wayne Xin Zhao El lado de síntesis de la investigación en LLM: lo que implica leer todos los artículos del momento y producir algo que otros investigadores puedan navegar. Recuperación de información Metodología de evaluación Figuras fundacionales
  92. Weijia Shi Hacer que la generación aumentada por recuperación funcione cuando el propio modelo de lenguaje es una caja cerrada a la que no se puede aplicar ajuste fino (fine-tuning). Generación aumentada por recuperación (RAG) Recuperación de información
  93. Wen-tau Yih Hacer que el paso de recuperación dentro de sistemas aumentados por recuperación sea lo bastante bueno como para que el paso de generación tenga algo con lo que trabajar. Generación aumentada por recuperación (RAG) Recuperación de información Alucinación y factualidad
  94. Wenjie Li Cómo se relaciona la recuperación generativa con las demás tareas de generación —resumen, respuesta a preguntas— que la misma arquitectura de sistema tiene que manejar. Generación aumentada por recuperación (RAG) Recuperación de información
  95. Xia Hu Si el estado del arte académico en modelos de lenguaje puede convertirse en algo que un profesional —no un laboratorio de investigación— pueda desplegar y en lo que pueda confiar. Metodología de evaluación Figuras fundacionales Interpretabilidad
  96. Xing Xie Conectar la tradición de los sistemas de recomendación, dedicada a medir el comportamiento de la IA de cara al usuario, con los nuevos retos de evaluación que plantean los LLM modernos. Recuperación de información Metodología de evaluación Figuras fundacionales
  97. Xipeng Qiu Construir un gran modelo de lenguaje abierto en chino que la comunidad académica pueda estudiar realmente por dentro — y las herramientas a su alrededor. Evaluación multilingüe Figuras fundacionales
  98. Xueqi Cheng Qué ha estado argumentando la investigación en recuperación de información desde dentro de la tradición china de IR — y en qué difiere su ángulo sobre la recuperación generativa del canon occidental. Generación aumentada por recuperación (RAG) Recuperación de información
  99. Yang Liu Si un modelo de lenguaje más capaz puede usarse para calificar las salidas de uno menos capaz — y cómo hacerlo sin engañarse a uno mismo. Metodología LLM como juez Metodología de evaluación
  100. Yann LeCun Cómo deberían ser los sistemas de aprendizaje automático, contrapuesto a cómo son actualmente. Razonamiento y descomposición Figuras fundacionales
  101. Yarin Gal Cuantificar cuándo los modelos de lenguaje no saben de qué están hablando. Alucinación y factualidad Metodología de evaluación
  102. Yejin Choi Qué haría falta para que un modelo de lenguaje tuviera lo que a los humanos les sobra y a los LLM les falta de forma fiable: sentido común. Razonamiento y descomposición Metodología de evaluación Figuras fundacionales
  103. Yoav Goldberg Si la cadena de razonamiento que produce un modelo de lenguaje es la cadena de razonamiento que realmente siguió. Alucinación y factualidad Figuras fundacionales Interpretabilidad
  104. Yoav Shoham Qué puede medirse sobre el estado de la IA desde fuera de cualquier empresa individual — y cómo se ve el aumento por recuperación cuando no hace falta reentrenar nada. Generación aumentada por recuperación (RAG) Transparencia y gobernanza Figuras fundacionales
  105. Yonatan Belinkov Qué hay realmente dentro de las representaciones ocultas de un modelo de lenguaje — y cuáles de esos estados internos se corresponden con cosas que los humanos reconocerían como conocimiento. Metodología de evaluación Interpretabilidad
  106. Yue Zhang Organizar lo que el campo llama «alucinación» en categorías que de verdad significan cosas distintas. Alucinación y factualidad Metodología de evaluación
  107. Yulia Tsvetkov Qué formas adoptan el sesgo y el daño en las salidas de modelos de lenguaje a través de idiomas, especialmente en las lenguas y comunidades que la evaluación estándar del campo ha ignorado históricamente. Metodología de evaluación Evaluación multilingüe Seguridad y robustez
  108. Zhaochun Ren Si se puede confiar a un modelo de lenguaje el trabajo que actualmente hace un sistema de recuperación de información — y qué partes de ese trabajo hace realmente bien. Generación aumentada por recuperación (RAG) Recuperación de información
  109. Zhiting Hu Tratar un modelo de lenguaje como un componente dentro de un sistema de planificación más amplio, en lugar de pedirle que haga razonamiento de extremo a extremo dentro de su propia cabeza. Razonamiento y descomposición Diálogo y agentes