1. Akari Asai Comment un modèle de langage décide que ses propres connaissances internes sont insuffisantes et qu'il doit plutôt aller chercher une source externe. Génération augmentée par recherche (RAG) Méthodologie d'évaluation
  2. Amir Globerson Utiliser un modèle de langage comme interrogateur adversarial d'un autre afin de faire apparaître des erreurs factuelles qu'aucun des deux ne trouverait seul. Hallucination et factualité Méthodologie d'évaluation
  3. Ari Holtzman Comment les modèles de langage génèrent réellement du texte à partir de leurs distributions de probabilité — et ce que le choix de la méthode d'échantillonnage fait aux résultats d'évaluation. Méthodologie d'évaluation Figures fondatrices
  4. Ashish Sabharwal Ce que la recherche classique en raisonnement formel peut apporter à l'évaluation de la question de savoir si les LLM raisonnent réellement — et comment distinguer cela d'un langage en forme de raisonnement qui tombe par hasard sur la bonne réponse. Raisonnement et décomposition Figures fondatrices
  5. Benno Stein Construire une infrastructure d'évaluation qui transforme le désaccord entre chercheurs en quelque chose de techniquement résoluble. Transparence et gouvernance Méthodologie d'évaluation Recherche d'information
  6. Björn Schuller Ce que la technologie du langage doit évaluer lorsque l'entrée n'est pas du texte mais de la parole — y compris les signaux émotionnels, paralinguistiques et propres à chaque locuteur que les méthodes purement textuelles écartent. Méthodologie d'évaluation Parole et multimodalité Sûreté et robustesse
  7. Charles L. A. Clarke Ce qu'exige une évaluation systématique et réplicable des systèmes de question-réponse — maintenant que les systèmes évalués sont des modèles de langage plutôt que des modules de recherche (retriever). Méthodologie d'évaluation Recherche d'information
  8. Chelsea Finn La manière dont les systèmes de langage et d'apprentissage s'adaptent à une nouvelle tâche avec très peu d'exemples — et ce que la structure théorique de cette adaptation révèle sur ce qu'ils ont ou n'ont pas réellement appris. Systèmes et passage à l'échelle Raisonnement et décomposition Figures fondatrices
  9. Chris Callison-Burch Si les lecteurs humains peuvent distinguer un texte produit par un modèle de langage d'un texte produit par des humains — et comment cette distinguabilité diminue à mesure que les modèles s'améliorent. Méthodologie d'évaluation Évaluation multilingue Figures fondatrices
  10. Christof Monz L'évaluation systématique, année après année, de la traduction automatique sur des dizaines de paires de langues — et ce que ce suivi révèle des problèmes de traduction qui sont en voie d'être résolus et de ceux qui ne le sont pas. Méthodologie d'évaluation Évaluation multilingue
  11. Christopher Manning L'argument selon lequel le sens, tel que les humains emploient ce mot, n'est pas ce que manipulent les grands modèles de langage. Méthodologie d'évaluation Figures fondatrices Interprétabilité
  12. Christopher Potts Les structures linguistiques que les modèles de langage représentent réellement — et celles qu'ils ne font que sembler représenter. Méthodologie d'évaluation Figures fondatrices
  13. Colin Raffel Déterminer si un seul modèle de langage peut accomplir toutes les tâches NLP à la fois quand elles sont toutes formulées comme du texte en entrée et du texte en sortie — et si cette unification tient d'une langue à l'autre. Évaluation multilingue Figures fondatrices
  14. Dan Jurafsky Faire du traitement automatique du langage naturel une discipline enseignable — et utiliser cette perspective pour lire où les pratiques actuelles d'évaluation du domaine s'inscrivent, et ne s'inscrivent pas, dans son histoire longue. Méthodologie d'évaluation Figures fondatrices
  15. Danqi Chen Déterminer si un modèle de langage qui produit une réponse avec citations ancre réellement cette réponse dans ces citations — ou s'il attache simplement après coup des références plausibles. Génération augmentée par recherche (RAG) Hallucination et factualité Figures fondatrices
  16. David Jurgens Si les modèles de langage qui traitent proprement les questions factuelles peuvent aussi traiter le type de savoir social qui détermine ce que les humains veulent réellement dire lorsqu'ils parlent. Méthodologie d'évaluation Sûreté et robustesse Figures fondatrices
  17. Daxin Jiang Comment pré-entraîner un encodeur de sorte que les embeddings qu'il produit soient utiles à la recherche — sans jamais le superviser sur une tâche de recherche. Génération augmentée par recherche (RAG) Recherche d'information
  18. Diyi Yang Le comportement des modèles de langage lorsque la tâche est sociale plutôt qu'informationnelle — persuasion, soutien, conflit, politesse. Méthodologie d'évaluation Dialogue et agents
  19. Dragan Gašević Savoir si les outils d'IA utilisés dans des contextes éducatifs aident réellement les apprenants pour lesquels ils sont construits — et quel type d'infrastructure d'évaluation cette question exige au-delà des benchmarks ML conventionnels. Transparence et gouvernance Méthodologie d'évaluation Figures fondatrices
  20. Ee-Peng Lim Savoir si demander à un modèle de langage d'élaborer un plan avant de résoudre un problème produit un meilleur raisonnement que lui dire de réfléchir étape par étape. Raisonnement et décomposition Méthodologie d'évaluation
  21. Emma Strubell La question de savoir si le coût en calcul et en énergie de l'entraînement et du service des modèles de langage doit figurer dans le titre d'une évaluation, là où l'exactitude se trouve aujourd'hui seule. Transparence et gouvernance Méthodologie d'évaluation
  22. Emmanuel Candès Comment placer des intervalles d'incertitude statistique valides autour des prédictions de n'importe quel modèle — y compris les modèles de langage — sans supposer que l'on sait quel type de distribution d'erreur attendre. Méthodologie d'évaluation Figures fondatrices
  23. Eric Horvitz La forme qualitative des capacités des modèles de langage — à quoi elles ressemblent comme objet, et si nous avons le vocabulaire pour les décrire avant d'avoir la méthodologie pour les mesurer. Transparence et gouvernance Méthodologie d'évaluation Figures fondatrices
  24. Furu Wei Utiliser les connaissances paramétriques propres à un modèle de langage pour aider la recherche à trouver le document que l'utilisateur cherchait réellement. Génération augmentée par recherche (RAG) Méthodologie d'évaluation
  25. George J. Pappas La rapidité avec laquelle un attaquant automatisé peut trouver des prompts qui brisent l'alignement de sûreté d'un modèle de langage — et ce que cela signifie pour évaluer la robustesse du modèle en tant que telle. Méthodologie d'évaluation Sûreté et robustesse
  26. Gideon Mann À quoi ressemblent les modèles de langage lorsqu'ils sont entraînés pour un domaine vertical unique à forte valeur — la finance, en l'occurrence — et ce que l'évaluation de cette spécialisation exige au-delà des benchmarks généralistes. Transparence et gouvernance Méthodologie d'évaluation Figures fondatrices
  27. Graham Neubig Relier recherche, génération et évaluation en un seul système opérationnel — et demander quand ces liens tiennent réellement. Génération augmentée par recherche (RAG) Méthodologie d'évaluation Dialogue et agents
  28. Hannaneh Hajishirzi Quand un modèle de langage doit aller chercher une source de connaissance externe — et quand sa mémoire paramétrique suffit. Hallucination et factualité Transparence et gouvernance Méthodologie d'évaluation
  29. Igor Mordatch Ce que signifie évaluer un modèle de langage qui prend des actions à conséquences par le biais du texte — non seulement produire des réponses, mais opérer dans des environnements qui répondent. Systèmes et passage à l'échelle Raisonnement et décomposition Dialogue et agents
  30. Ion Stoica L'infrastructure de calcul distribué sur laquelle presque tous les LLM modernes est soit entraîné, soit servi, soit évalué. Systèmes et passage à l'échelle Figures fondatrices
  31. Iryna Gurevych Construire l'infrastructure d'encodeurs qui rend l'opération « trouver les phrases similaires à cette requête » rapide et fiable à travers les langues et les tâches. Génération augmentée par recherche (RAG) Recherche d'information Figures fondatrices
  32. James Zou À quoi ressemble l'évaluation lorsque l'IA évaluée doit franchir des seuils réglementaires avant son déploiement — et ce que l'évaluation générale des LLM devrait apprendre d'un domaine qui fait cela depuis des années. Transparence et gouvernance Méthodologie d'évaluation Figures fondatrices
  33. Jamie Callan À quoi ressemble la génération augmentée par recherche (RAG) lorsque l'on connaît réellement les trente ans d'histoire de la recherche d'information qu'elle est en train de réinventer. Génération augmentée par recherche (RAG) Recherche d'information Figures fondatrices
  34. Jared Kaplan Savoir si la perte d'un modèle de langage est une fonction régulière du calcul, des données et de la taille du modèle — et ce que cette régularité permet de prédire, ou non, sur les capacités à plus grande échelle. Systèmes et passage à l'échelle Méthodologie d'évaluation Figures fondatrices
  35. Jennifer Wortman Vaughan La manière dont les gens comprennent réellement les résultats d'évaluation des modèles de langage et agissent à partir d'eux — et l'endroit où se situe l'écart entre ce qui a été mesuré et ce qui finit par être cru. Transparence et gouvernance Méthodologie d'évaluation
  36. Jesse Dodge Ce qu'un article sur un modèle de langage doit contenir pour qu'un autre laboratoire puisse vérifier le résultat. Transparence et gouvernance Méthodologie d'évaluation
  37. Ji-Rong Wen Organiser la littérature sur les LLM sous une forme dans laquelle d'autres chercheurs chinois en NLP peuvent réellement s'orienter depuis l'intérieur de l'écosystème académique. Méthodologie d'évaluation Évaluation multilingue Figures fondatrices
  38. Jian-Guang Lou Savoir si un modèle de langage qui produit du code produit effectivement du code qui fait ce que la demande exigeait — et à quoi ressemble l'évaluation lorsque, pour une fois, la correction a une réponse définie. Raisonnement et décomposition Méthodologie d'évaluation Figures fondatrices
  39. Jian-Yun Nie Comment la recherche se comporte différemment quand la requête est une conversation dans une langue non anglaise — et comment les modèles de langage changent ce tableau. Génération augmentée par recherche (RAG) Recherche d'information Évaluation multilingue
  40. Jianfeng Gao Ce que sont les grands modèles de langage (LLM) comme classe de systèmes — sur le plan taxonomique, architectural, et du point de vue de ce qu'ils héritent réellement de la longue histoire du NLP neuronal. Méthodologie d'évaluation Figures fondatrices Dialogue et agents
  41. Jie Zhou Déterminer si l'on peut faire confiance aux modèles de langage pour évaluer d'autres modèles de langage dans des pipelines NLP de production. Méthodologie du LLM-juge Dialogue et agents
  42. Jimmy Lin Rendre la recherche d'information assez reproductible pour qu'un chercheur en LLM et un chercheur en IR puissent exécuter la même expérience et obtenir la même réponse. Génération augmentée par recherche (RAG) Transparence et gouvernance Recherche d'information
  43. Jimmy Xiangji Huang La manière dont la recherche d'information passe à l'échelle sur les données opérationnelles désordonnées que détiennent les organisations réelles, par opposition aux corpus de benchmark propres sur lesquels le domaine publie effectivement. Méthodologie d'évaluation Recherche d'information
  44. Jindong Wang Standardiser ce que « évaluer un LLM » veut même dire comme procédure de recherche. Méthodologie d'évaluation Sûreté et robustesse
  45. Jochen Wirtz Ce qui se produit lorsque l'IA de service en contact avec la clientèle remplace, augmente ou concurrence les employés humains du service — et quels types d'évaluation ce changement exige réellement. Transparence et gouvernance Méthodologie d'évaluation Dialogue et agents
  46. Jonathan Berant Si un modèle de langage effectue réellement les étapes de raisonnement nécessaires pour répondre à une question — ou s'il produit seulement une réponse qui se trouve être correcte. Raisonnement et décomposition Méthodologie d'évaluation
  47. Juanzi Li Combiner les connaissances structurées issues des graphes de connaissances avec les régularités statistiques que les modèles de langage apprennent à partir du texte — et ce que cette combinaison apporte à l'évaluation. Génération augmentée par recherche (RAG) Hallucination et factualité Figures fondatrices
  48. Julian McAuley Si les modèles de langage entraînés sur le web ouvert font déjà de la recommandation — et ce que cela implique pour les produits qui concurrencent les systèmes de recommandation traditionnels. Méthodologie d'évaluation Recherche d'information Dialogue et agents
  49. Junichi Yamagishi La question de savoir si des auditeurs humains — ou des détecteurs automatisés — peuvent distinguer une parole générée par IA d'une vraie parole humaine, et comment cette distinguabilité change à mesure que la synthèse vocale progresse. Méthodologie d'évaluation Parole et multimodalité Sûreté et robustesse
  50. Jure Leskovec Ce que la structure de graphe ajoute aux problèmes de raisonnement et de recherche que les modèles de langage traitent actuellement sans elle — et ce qui se perd lorsque les relations dans les données sont aplaties en texte. Recherche d'information Figures fondatrices
  51. Kevin Chen-Chuan Chang Organiser la littérature en expansion rapide sur le raisonnement des modèles de langage en quelque chose qu'un chercheur nouveau dans le domaine puisse réellement parcourir. Raisonnement et décomposition Méthodologie d'évaluation
  52. Kyle Lo Ce qu'il y a réellement dans un corpus d'entraînement lorsque l'on s'assoit pour l'examiner document par document. Transparence et gouvernance Méthodologie d'évaluation
  53. Luke Zettlemoyer Déterminer si des modèles de langage à poids ouverts peuvent être construits à l'échelle des modèles de pointe, et si leur factualité peut être mesurée à granularité fine. Hallucination et factualité Figures fondatrices
  54. Maarten de Rijke Déterminer si la recherche d'information devrait être effectuée par un système qui « écrit l'identifiant du document » plutôt que par un système qui cherche dans un index vectoriel. Génération augmentée par recherche (RAG) Recherche d'information
  55. Maarten Sap La question de savoir si les modèles de langage peuvent produire de la connaissance sociale ou raisonner à son sujet avec la même compétence qu'ils montrent sur les tâches factuelles — et ce qui est en jeu lorsqu'ils n'y parviennent pas. Méthodologie d'évaluation Sûreté et robustesse Dialogue et agents
  56. Maosong Sun À quoi ressemble l'écosystème des LLM ouverts lorsqu'il naît du NLP académique chinois plutôt que d'organisations occidentales à but non lucratif comme AI2. Transparence et gouvernance Évaluation multilingue Figures fondatrices
  57. Marco Baroni Déterminer si les modèles de langage neuronaux peuvent composer ce qu'ils ont appris en combinaisons nouvelles qu'ils n'ont jamais vues — ou s'ils ne font en réalité qu'une interpolation sophistiquée au sein de leur distribution d'entraînement. Raisonnement et décomposition Évaluation multilingue Figures fondatrices
  58. Mari Ostendorf À quoi ressemble la technologie du langage lorsqu'on en a été responsable comme ingénierie déployable pendant trente ans avant que les LLM n'arrivent pour refaire le domaine. Méthodologie d'évaluation Parole et multimodalité Figures fondatrices
  59. Mark Gales Détecter les hallucinations d'un modèle de langage sans aucun accès à ses poids (du modèle) ni à la vérité terrain. Hallucination et factualité Parole et multimodalité
  60. Martin Potthast Déterminer si des modèles de langage peuvent être utilisés pour juger de la pertinence d'un document par rapport à une requête — et ce qui change quand ils remplacent des évaluateurs humains dans ce rôle. Méthodologie d'évaluation Méthodologie du LLM-juge Recherche d'information
  61. Mengnan Du Quels types d'explications peut-on obtenir pour les sorties des modèles de langage — et lesquelles de ces explications s'avèrent fiables. Méthodologie d'évaluation Interprétabilité
  62. Michihiro Yasunaga La question de savoir si un modèle de langage peut traduire correctement une question en langue naturelle en requête structurée précise — et ce que cette traduction révèle du raisonnement sur la connaissance. Raisonnement et décomposition Méthodologie d'évaluation
  63. Minlie Huang Savoir si les catégories de « préjudiciable » utilisées pour évaluer la sûreté des modèles de langage se transfèrent des contextes occidentaux aux contextes de déploiement en langue chinoise, où le cadre réglementaire et les catégories culturelles sont différents. Évaluation multilingue Sûreté et robustesse Dialogue et agents
  64. Mohit Bansal La question de savoir si les méthodes utilisées pour évaluer des modèles strictement textuels fonctionnent encore lorsque le même modèle doit traiter simultanément des images, de la parole ou d'autres modalités — et ce qui échoue en premier lorsque les modalités sont combinées. Méthodologie d'évaluation Parole et multimodalité Figures fondatrices
  65. Nan Duan Réécrire la requête de l'utilisateur avant la recherche afin que le module de recherche (retriever) ait une chance de retourner des documents utiles. Génération augmentée par recherche (RAG)
  66. Nathan Lambert Ce qui arrive à un modèle de langage entre « entraîné sur Internet » et « répond à votre question comme il le fait » — et comment étudier cette étape publiquement. Transparence et gouvernance Méthodologie d'évaluation
  67. Noah A. Smith Déterminer si un modèle de langage peut produire ses propres données d'entraînement — et quelles sont les conséquences méthodologiques lorsque cela devient la pratique standard. Transparence et gouvernance Méthodologie d'évaluation Figures fondatrices
  68. Norbert Fuhr Ce que l'évaluation en recherche d'information fait mal, par écrit, depuis plusieurs décennies — et pourquoi chaque nouvelle génération de chercheurs refait les mêmes erreurs. Méthodologie d'évaluation Recherche d'information Figures fondatrices
  69. Omer Levy Si un modèle de langage peut inférer la tâche à partir d'exemples seuls — sans qu'on lui dise quoi faire — et ce que cette capacité révèle de sa manière de représenter les instructions. Raisonnement et décomposition Méthodologie d'évaluation Figures fondatrices
  70. Pang Wei Koh Ce qui se passe lorsqu'un modèle de langage rencontre le type de données qu'il n'a pas vu pendant l'entraînement — et comment mesurer cet écart rigoureusement, au lieu de simplement le constater après déploiement. Transparence et gouvernance Méthodologie d'évaluation Sûreté et robustesse
  71. Paolo Rosso Construire des campagnes d'évaluation qui fonctionnent pour les langues ibéro-romanes — espagnol, catalan, portugais — au lieu de transposer une méthodologie centrée sur l'anglais et d'en accepter les angles morts. Méthodologie d'évaluation Évaluation multilingue Sûreté et robustesse
  72. Pascale Fung Déterminer si le même modèle de langage accomplit le même type de travail dans différentes langues — et si la méthodologie d'évaluation construite pour l'anglais nous trompe sur ce que font les modèles dans toutes les autres langues. Méthodologie d'évaluation Évaluation multilingue
  73. Percy Liang Comment mesurer les modèles de langage de sorte qu'une mesure faite aujourd'hui veuille encore dire quelque chose l'année prochaine. Méthodologie d'évaluation
  74. Peter Henderson Les endroits où les résultats techniques sur le comportement des modèles de langage comptent réellement — dans les audits, la régulation et la responsabilité juridique — et l'écart entre « nous avons mesuré ceci » et « ceci change ce qui est autorisé ». Transparence et gouvernance Méthodologie d'évaluation
  75. Philip S. Yu Relier quatre décennies de méthodologie de fouille de données à la question de savoir comment évaluer les grands modèles de langage sans réinventer des techniques que le domaine possède déjà. Méthodologie d'évaluation Recherche d'information Figures fondatrices
  76. Prateek Mittal La manière dont les entrées visuelles deviennent une nouvelle surface d'attaque pour des modèles de langage alignés en sûreté qui acceptent des requêtes multimodales. Parole et multimodalité Sûreté et robustesse
  77. Qiang Yang Déterminer si un apprentissage automatique utile peut avoir lieu lorsque les données sur lesquelles on entraînerait ou évaluerait le système ne peuvent pas être déplacées vers un seul endroit — pour des raisons juridiques, de confidentialité ou commerciales. Transparence et gouvernance Méthodologie d'évaluation Figures fondatrices
  78. Quoc V. Le Les briques architecturales et les recettes d'entraînement sur lesquelles l'ère moderne des LLM s'est construite. Raisonnement et décomposition Figures fondatrices
  79. Rishi Bommasani Ce que les développeurs de modèles de langage nous disent, et ne nous disent pas, sur leurs propres modèles — et comment le mesurer systématiquement. Transparence et gouvernance Méthodologie d'évaluation
  80. Roi Reichart Ce que « domaine » signifie pour un modèle de langage — lorsque sa distribution d'entraînement cesse de correspondre à son contexte de déploiement — et comment évaluer rigoureusement ce décalage. Méthodologie d'évaluation Figures fondatrices
  81. Seungone Kim La question de savoir si le domaine peut disposer d'une alternative LLM-évaluateur à poids ouverts, afin que « une boîte noire en juge une autre » cesse d'être la seule option disponible. Transparence et gouvernance Méthodologie d'évaluation Méthodologie du LLM-juge
  82. Shafiq Joty La méthodologie d'évaluation des modèles de langage lorsque le contexte de déploiement est le logiciel d'entreprise plutôt qu'une démonstration de recherche. Méthodologie d'évaluation Dialogue et agents
  83. Shayne Longpre Ce qu'il y a réellement dans les données sur lesquelles les modèles de langage s'entraînent — et qui peut, ou ne peut pas, le savoir. Transparence et gouvernance Méthodologie d'évaluation
  84. Shinji Watanabe L'infrastructure à code source ouvert de traitement de la parole qui permet aux groupes académiques et industriels d'entraîner, d'évaluer et de comparer des systèmes langagiers à entrée vocale ou sortie vocale sur un pied d'égalité. Méthodologie d'évaluation Parole et multimodalité Figures fondatrices
  85. Shuming Shi Ce que signifie l'« hallucination » d'un modèle de langage lorsque l'on est responsable de déployer des produits propulsés par LLM sur une surface d'environ un milliard d'utilisateurs. Hallucination et factualité
  86. Steven Schockaert Comment évaluer de bout en bout un système de génération augmentée par recherche (RAG) lorsque chacune de ses parties peut échouer de façon différente. Génération augmentée par recherche (RAG) Méthodologie d'évaluation
  87. Tatsunori Hashimoto Déterminer si les chiffres publiés à propos des modèles de langage sont des résultats statistiques ou des artefacts méthodologiques. Méthodologie d'évaluation
  88. Tom Mitchell Si un modèle de langage possède une représentation interne du fait qu'il dit vrai — séparable de ce qu'il produit effectivement. Hallucination et factualité Figures fondatrices Interprétabilité
  89. Torsten Hoefler Généraliser le raisonnement des modèles de langage au-delà des chaînes de raisonnement linéaires — vers des embranchements, du retour arrière et de la recombinaison d'étapes intermédiaires de raisonnement. Systèmes et passage à l'échelle Raisonnement et décomposition
  90. Tushar Khot Ce que « capacité de raisonnement » signifie réellement comme chose que l'on peut placer dans un benchmark — et ce qui change lorsque l'on essaie aussi d'amener le modèle à raisonner par prompting structuré. Raisonnement et décomposition Méthodologie d'évaluation
  91. Wayne Xin Zhao Le versant synthèse de la recherche sur les LLM — ce qu'il faut pour lire tous les articles du moment et produire quelque chose que d'autres chercheurs peuvent réellement parcourir. Méthodologie d'évaluation Recherche d'information Figures fondatrices
  92. Weijia Shi Faire fonctionner la génération augmentée par recherche quand le modèle de langage lui-même est une boîte fermée que vous ne pouvez pas soumettre à un réglage fin (fine-tuning). Génération augmentée par recherche (RAG) Recherche d'information
  93. Wen-tau Yih Rendre l'étape de recherche, dans les systèmes augmentés par recherche, assez solide pour que l'étape de génération ait réellement de quoi travailler. Génération augmentée par recherche (RAG) Hallucination et factualité Recherche d'information
  94. Wenjie Li La manière dont la recherche générative se rapporte aux autres tâches de génération — résumé, réponse aux questions — que la même architecture système doit prendre en charge. Génération augmentée par recherche (RAG) Recherche d'information
  95. Xia Hu Déterminer si l'état de l'art académique des modèles de langage peut être transformé en quelque chose qu'un praticien — et non un laboratoire de recherche — peut réellement déployer et auquel il peut se fier. Méthodologie d'évaluation Figures fondatrices Interprétabilité
  96. Xing Xie Relier la tradition des systèmes de recommandation, qui mesure le comportement de l'IA face aux utilisateurs, aux nouveaux défis d'évaluation que posent les LLM modernes. Méthodologie d'évaluation Recherche d'information Figures fondatrices
  97. Xipeng Qiu Construire un grand modèle de langage ouvert en chinois que la communauté académique puisse réellement étudier de l'intérieur — ainsi que l'outillage qui l'entoure. Évaluation multilingue Figures fondatrices
  98. Xueqi Cheng Ce que la recherche d'information menée depuis la tradition chinoise de l'IR soutient — et en quoi son angle sur la recherche générative diffère du canon occidental. Génération augmentée par recherche (RAG) Recherche d'information
  99. Yang Liu Si un modèle de langage plus capable peut servir à noter les sorties d'un modèle moins capable — et comment le faire sans se tromper soi-même. Méthodologie d'évaluation Méthodologie du LLM-juge
  100. Yann LeCun Ce à quoi les systèmes d'apprentissage automatique devraient ressembler, par contraste avec ce qu'ils sont actuellement. Raisonnement et décomposition Figures fondatrices
  101. Yarin Gal Quantifier les moments où les modèles de langage ne savent pas ce qu'ils disent. Hallucination et factualité Méthodologie d'évaluation
  102. Yejin Choi Ce qu'il faudrait pour qu'un modèle de langage possède ce que les humains ont en abondance et ce qui manque de façon fiable aux LLM — le sens commun. Raisonnement et décomposition Méthodologie d'évaluation Figures fondatrices
  103. Yoav Goldberg Si la chaîne de raisonnement qu'un modèle de langage produit est bien la chaîne de raisonnement qu'il a réellement suivie. Hallucination et factualité Figures fondatrices Interprétabilité
  104. Yoav Shoham Ce qui peut être mesuré sur l'état de l'IA depuis l'extérieur d'une entreprise donnée — et à quoi ressemble l'augmentation par recherche lorsqu'il n'est pas nécessaire de réentraîner quoi que ce soit. Génération augmentée par recherche (RAG) Transparence et gouvernance Figures fondatrices
  105. Yonatan Belinkov Ce qui se trouve réellement dans les représentations cachées d'un modèle de langage — et lesquels de ces états internes correspondent à des choses qu'un humain reconnaîtrait comme du savoir. Méthodologie d'évaluation Interprétabilité
  106. Yue Zhang Organiser ce que le domaine appelle « hallucination » en catégories qui désignent réellement des phénomènes différents. Hallucination et factualité Méthodologie d'évaluation
  107. Yulia Tsvetkov Les formes que prennent les biais et les préjudices dans les sorties des modèles de langage à travers les langues — en particulier pour les langues et communautés que l'évaluation standard du domaine a historiquement ignorées. Méthodologie d'évaluation Évaluation multilingue Sûreté et robustesse
  108. Zhaochun Ren Si l'on peut faire confiance à un modèle de langage pour assurer le travail actuellement fait par un système de recherche d'information — et quelles parties de ce travail il accomplit effectivement bien. Génération augmentée par recherche (RAG) Recherche d'information
  109. Zhiting Hu Traiter un modèle de langage comme un composant d'un système de planification plus vaste — au lieu de lui demander de faire le raisonnement de bout en bout dans sa propre tête. Raisonnement et décomposition Dialogue et agents